теория

Уроки чужих соревнований

Прогнозированием временных рядов меряются публично уже сорок лет — соревнования Макридакиса, «M-competitions». Их выводы — готовая настройка ожиданий для нашей фабрики.

M4 (2018, сто тысяч рядов). Победил гибрид: экспоненциальное сглаживание, у которого сезонность и уровень настраивались на каждом ряду, а нейросеть училась на всех сразу. Все шесть «чисто нейросетевых» заявок проиграли комбинации трёх простых статистических методов. Из семнадцати лучших методов двенадцать были комбинациями. Мораль в трёх словах: гибриды, комбинации, скромность.

M5 (2020, иерархия Walmart: товар → магазин → штат → страна). Весь топ — градиентный бустинг: машинное обучение впервые честно победило. Но у победы двойное дно: ~92.5% участников не обошли бейзлайн «экспоненциальное сглаживание снизу и сложить вверх». Тысячи команд с нейросетями и ансамблями — хуже метода из учебника. Сложность окупается — у тех, кто умеет её готовить; для остальных она дорогая форма проигрыша планке.

M6 (2022, прогнозы акций в реальном времени). Самый отрезвляющий вывод: корреляция между точностью прогноза и доходностью инвестиционных решений составила 0.04. Точный прогноз и хорошее решение — почти независимые достижения. Для нас это архитектурный факт: слой прогноза и слой решения — разные компоненты с явным контрактом. Терминал продаёт прогноз с интервалом неопределённости; что с ним делать — решает клиент. Обещание «наши прогнозы принесут вам прибыль» не подписал бы даже победитель M6.

И один вывод поверх всех трёх: каждое соревнование выигрывали те, кто одержимо мерил. Не «модель показалась лучше», а тысячи прогонов против планки на честном разрезе времени. Фабрика прогнозов — это в первую очередь фабрика измерений; модели в ней — сменные детали.

← назад