Между удачным тестом и стабильной работой в боевом режиме — отдельный слой инженерии. Его закрывает сопровождение моделей в работе (MLOps) на заказ. Берём на себя запуск модели в работу и её дальнейшую жизнь: контроль качества, обновления, откаты (возврат к прошлой версии).
Работа модели под реальной нагрузкой
Модель работает как сервис и отвечает на запросы. Масштабируем по фактической нагрузке: в пик добавляются мощности, в затишье освобождаются.
Время ответа держим в рамках SLA — норматива скорости и доступности. Простаивающие GPU отключаются, стоимость работы модели видна в отчётах.
Мониторинг дрейфа модели и качества
Дрейф — постепенный сдвиг данных, из-за которого модель ошибается чаще. Мониторинг дрейфа модели ловит этот сдвиг и падение качества по сегментам.
Средняя метрика бывает в норме, пока важный сегмент проваливается. Оповещение приходит раньше, чем просадку заметит бизнес.
Чем отличаемся: отвечаем за модель после запуска
Многие подрядчики сдают модель и уходят. Мы остаёмся: сопровождение ML-модели — это регламент обновлений, переобучение и разбор инцидентов по SLA.
Новую версию сначала гоняем в теневом режиме: модель работает параллельно, клиенты её не видят. Затем включаем её на части трафика и замеряем эффект — так работает проверка на части трафика (A/B).
Смежные услуги: обучение больших моделей на GPU — если модель ещё не обучена; работа модели под высокой нагрузкой — если главное скорость ответов; потоковая аналитика в реальном времени — решения за миллисекунды. Прикинуть бюджет — в калькуляторе стоимости.