Задача
Энергетическое предприятие. Параметры техпроцесса «плывут», настройки автоматики быстро устаревают. Каскад ПИД-регуляторов подкручивали вручную, и хуже всего он держал переходные режимы — моменты перестройки процесса.
Подход
Обучили агента в симуляторе с физикой реального процесса — Reinforcement Learning: алгоритм методом проб сам ищет стратегию управления. Параметры среды на обучении постоянно меняли, чтобы агент не привык к одному режиму. В критерии обучения зашили запас по безопасности для редких тяжёлых сценариев.
На объект выходили поэтапно: сначала агент только наблюдал рядом со старой автоматикой, потом под контролем инженеров принял управление.
Стек
PyTorch · кастомная sim-среда · domain randomization · gRPC (мост к SCADA)
Результат
На переходных режимах эффективность выросла на 31%. Перенастраивать регуляторы вручную больше не нужно.