|

TimesFM (Time Series Foundation Model) в работе SRE

SRE привыкли жить в мире, где графики нагрузки вроде бы и повторяются, но каждый день все равно приносит сюрпризы. Мы боремся с запаздывающими алертами, экстренными необходимостями масштабирования и инцидентами, которые можно было бы предвидеть. Google Research выпустила TimesFM — модель, которая может изменить правила игры. Разбираемся, как она работает и что даёт SRE.

Что такое TimesFM и почему это важно для SRE

TimesFM (Time Series Foundation Model) — это предобученная фундаментальная модель для прогнозирования временных рядов от Google Research. В отличие от классических методов (ARIMA, Prophet, LSTM), которые требуют переобучения на каждом новом наборе данных, TimesFM работает в zero-shot режиме: вы подаёте ей историю метрики, и она выдаёт прогноз без дополнительного обучения.

Архитектурно модель построена на decoder-only Transformer (как GPT, только для чисел) и обрабатывает данные патчами по 32 временных шага. Для SRE это означает, что мы получаем инструмент, который:

  • не требует недель на обучение и настройку;
  • работает с контекстом до 16 000 точек (версия 2.5);
  • выдаёт не только точечный прогноз, но и доверительные интервалы (квантили от 10-го до 90-го процентиля);
  • может учитывать внешние события (промоакции, релизы, праздники).

В августе 2026 года вышла версия TimesFM-3, в которой добавилось:

  1. многомерное прогнозирование (Multivariate): модель теперь может прогнозировать не только одну временную линию (униварный анализ), но и несколько взаимосвязанных рядов одновременно (например, температуру, влажность и давление).
  2. поддержка Covariates: в модель можно подавать дополнительные данные, которые помогают делать прогноз:
  • past-only covariates: данные, известные только за прошлые периоды.
  • past-and-future covariates: данные, которые известны как за прошлое, так и на будущий период (например, прогноз погоды или календарь праздников). Всё это работает без дополнительной настройки (per-task tuning).
  1. Топовая производительность: на момент публикации модель занимала 1-е места в трёх основных бенчмарках для фундаментальных моделей временных рядов: fev-bench, TIME Benchmark и GIFT-Eval.

Теперь модель может прогнозировать несколько связанных метрик одновременно (например, CPU, память и задержки) — это критично для SRE, где все показатели завязаны друг на друге.

От запаздывающего HPA к упреждающему масштабированию

Проблема классических горизонтальных автомасштабировщиков (HPA) известна каждому SRE: они всегда опаздывают. Нагрузка растёт в 9:00, HPA замечает это только в 9:01, а новый под становится готовым к работе в 9:03. Две-три минуты мы работаем с перегрузкой.

Эту проблему решает проект Presage — opensource инструмент для прогнозного масштабирования в Kubernetes, построенный на TimesFM. Presage прогнозирует не текущий спрос, а спрос в тот момент, когда новые поды будут готовы (с учётом leadTime), и масштабируется заранее.

Тесты показывают впечатляющие результаты, при одинаковых затратах на инфраструктуру Presage сокращает время простоя из-за нехватки ресурсов в 7.5 раз. Более того, он никогда не оставляет нас с меньшим числом реплик, чем необходимо: традиционный расчёт работает параллельно и задаёт нижнюю границу, поэтому ошибочный прогноз может дать только избыточные реплики, но никогда — недостаточные.

Важная деталь: Presage поддерживает режим Shadow. Можно запустить его в кластере, он будет вычислять прогнозы и рекомендовать число реплик, но ничего не менять. Пару недель наблюдаем, сравниваем с реальностью и только потом переключаем в режим Enforce.

Аномалии: от статичных порогов к динамическим доверительным интервалам

Статичные пороги для алертов это постоянный компромисс. Слишком высокие — и мы пропускаем инциденты, слишком низкие — получаем тонны ложных срабатываний. TimesFM предлагает альтернативу: прогнозировать не только ожидаемое значение, но и его разброс.

Модель выдаёт прогноз на каждый шаг в виде 9 квантилей (от 10-го до 90-го процентиля). Это позволяет строить динамический доверительный коридор: если фактическое значение выходит за его границы — это аномалия, достойная алерта. Причём ширина коридора меняется в зависимости от неопределённости модели: в периоды высокой вариативности пороги расширяются автоматически.

На практике это выглядит так: вместо алерта «CPU > 80%» вы получаете алерт «CPU на 15% выше прогноза для этого часа с учётом истории и дня недели». Ложных срабатываний становится значительно меньше, а реальные проблемы выявляются быстрее.

Управление рисками деплоев: выбираем правильное время

SRE-команды знают, что деплой — это всегда риск. Но рисковать можно по-разному. Один из подходов — использовать TimesFM для прогнозирования «окон риска».

Идея простая: модель анализирует исторические паттерны (трафик, инциденты, расписание деплоев) и вычисляет вероятность проблем для каждого часа в предстоящую неделю. В результате получается тепловая карта, где видны периоды с максимальным совпадением деплой-активности и пиков нагрузки.

Это не «запрет» на деплой в определённые часы, а дополнительный сигнал для принятия решения. Если модель показывает высокий риск на завтра 10:00, команда может перенести деплой на 14:00 или усилить мониторинг перед релизом.

Что нового даёт TimesFM-3 для SRE

С выходом TimesFM-3 появляются возможности, которые раньше требовали сложных инженерных решений:

Многомерное прогнозирование

Версия 2.5 умела работать только с одной метрикой за раз. Если у вас 50 сервисов, каждый со своей метрикой CPU, вы делали 50 вызовов модели. TimesFM-3 принимает 2D-вход: время по одной оси, ряд метрик — по другой. Модель через специальный механизм «variate attention» учится видеть взаимосвязи между метриками.

Для SRE это означает, что можно прогнозировать CPU, память, сетевой трафик и частоту ошибок одним вызовом — и все прогнозы будут согласованы друг с другом.

Нативная поддержка covariates

TimesFM-3 принимает два типа внешних данных:

  • Past-only: данные, известные только за прошлые периоды (история инцидентов, предыдущие релизы);
  • Past-and-future: данные, известные и в прошлом, и в будущем (календарь релизов, прогноз погоды для дата-центра, плановые технические работы).

Это позволяет модели учитывать контекст, который мы, SRE, знаем, но не можем передать в простую модель временных рядов.

Несаморегрессионное декодирование

Раньше модель генерировала прогноз пошагово (шаг за шагом, как языковая модель генерирует текст). Это приводило к накоплению ошибок и задержкам. TimesFM-3 генерирует весь горизонт прогноза за один проход (single forward pass), что ускоряет инференс и повышает точность.

Подводные камни: лицензия и ограничения

Есть важный нюанс: лицензия на веса TimesFM-3 отличается от версий 2.x. Если TimesFM 2.5 и 2.0 поставлялись с открытой лицензией Apache 2.0 (можно использовать коммерчески, веса можно распространять), то TimesFM-3 использует timesfm-non-commercial-license-v1.0, которая запрещает коммерческое и production-использование.

Что это означает для SRE:

  • для production-решений (прогнозное масштабирование, алертинг) пока рекомендуется использовать TimesFM 2.5 (200M параметров, Apache 2.0).
  • TimesFM-3 можно тестировать в исследовательских целях, оценивать потенциальный эффект, но не внедрять в боевые контуры.
  • исходный код всех версий остаётся под Apache 2.0.

Путь к production

Интеграция фундаментальных моделей временных рядов в production — это в первую очередь инженерная задача, а не ML-задача.

Путь внедрения в SRE:

  • Zero-Shot валидация (1–2 недели): берёте TimesFM 2.5, применяете к вашим метрикам, оцениваете качество на исторических данных. Минимальная стоимость PoC.
  • In-Context адаптация (2–4 недели): используете подходящие примеры из вашего домена как контекст для модели. Улучшение метрик +7–25% без изменения весов.
  • Shadow-режим (2–3 недели): запускаете Presage или свой пайплайн в режиме наблюдения, сравниваете с реальностью, настраиваете параметры.
  • Enforce: переводите в production, настроив мониторинг качества прогнозов и fallback-стратегии на случай сбоя модели.

TimesFM это не замена SRE, а инструмент, который позволяет перейти от реакции на уже случившееся к предсказанию. Прогнозное масштабирование, динамические пороги аномалий, оценка рисков деплоев — это реальные кейсы, которые уже работают в индустрии.

Версия 2.5 доступна для production под Apache 2.0 и уже решает 80% задач. TimesFM-3 открывает новые горизонты с многомерным прогнозированием, но пока ограничена лицензионно.

Начинайте с Shadow-режима. Проверьте на своих данных, убедитесь, что прогнозы приносят пользу, и только потом внедряйте. Как сказано в документации Presage: «Run it on your metrics before believing any of it — that is exactly what the tool is for«.

В репо много примеров, читайте оригинальный репо.

Похожие записи