Как нейросети анализируют макроэкономические данные: словарь терминов
Макроэкономические данные — это статистика по ВВП, инфляции, безработице, денежной массе и другим агрегатам. Нейросети помогают находить в этих рядах нелинейные зависимости. Ниже — словарь ключевых понятий.
Основные термины
- Временной ряд — последовательность значений, например квартальный ВВП России с 2000 года. Нейросеть анализирует окно данных длиной 8–12 периодов.
- Нормализация Z-score — приведение показателей к единой шкале. Для инфляции с разбросом 2–17% и безработицы 4–12% вычисляют среднее и стандартное отклонение: x' = (x − μ) / σ.
- LSTM — архитектура рекуррентной нейросети для временных рядов. Пример: модель на данных ФРС США прогнозирует инфляцию CPI на 6 месяцев вперёд с ошибкой MAPE 3,1% против 5,8% у ARIMA.
- Attention-механизм — позволяет модели выделять значимые лаги. В тесте с 140 макроиндикаторами нейросеть с attention снизила среднюю абсолютную ошибку прогноза ВВП до 0,4 п.п.
- Функция потерь Huber — устойчива к выбросам. Применяется, когда кризисные скачки ВВП, например −7,8% в 2009 году в РФ, не должны перекашивать веса.
- Feature embedding — способ превратить категории, такие как сектор экономики или регион, в векторы чисел размерности 16–64.
Пример пайплайна
- Сбор данных: 1200 квартальных наблюдений по 45 странам из OECD.
- Очистка: пропуски заполняются через k-ближайших соседей; удаляются дубли.
- Создание признаков: лаги, скользящее среднее за 4 квартала, волатильность.
- Обучение многослойной LSTM на 80% выборки; валидация на 20%.
- Интерпретация: анализ остатков и SHAP-значений. В среднем 65% внимания модели уходит на ставку ФРС, курс EUR/USD и индекс PMI.
«Нейросеть не говорит “будет кризис”, она говорит “исторические паттерны похожи на 96% из сценариев прошлых рецессий”. Число — это вероятностное суждение, а не приговор».
Метрики точности
| Модель | Задача | Ошибка |
|---|---|---|
| Linear Regression | Прогноз безработицы США | 0,61 п.п. |
| LSTM + Attention | Прогноз безработицы США | 0,29 п.п. |
| Gradient Boosting | Выявление признаков рецессии | F1 = 0,81 |
| Transformer | Сглаживание ВВП | RMSE = 2,3% |
Ограничения и подходы
Проблема причинности: макроэкономические данные короткие и нестационарные. Нейросеть может запомнить шум. Для контроля используют кросс-валидацию по времени в формате rolling-origin, а не случайное перемешивание. Пакет OpaGPT в связке с TensorFlow автоматизирует разметку датасетов и подбор гиперпараметров.