К содержимому
MoranaLabs
Энергетика — 02 мар. 2026 г.

RL-управление нестационарным технологическим процессом 

Прежде чем звать сюда обучение с подкреплением, мы честно попробовали донастроить существующий регулятор — и уперлись в запаздывание и дрейф сырья. RL здесь дает уставку внутри коридора, который держат обычные блокировки: без этого его нельзя пускать к процессу.

+31 %
к эффективности
3 ступени
допуска агента к процессу: советчик, коридор, рабочий режим
sim-to-real
перенос на железо
стенд · запускается здесь

Стенд: запас до предела и есть весь выигрыш

Регулятор не делает процесс лучше — он держит его ровнее. Ровнее значит ближе к пределу, а проценты выработки живут именно там. Переключайте регулятор.

температура в зоне три сигмы разброса предел, за который нельзя
регулятор

Видит только ошибку и только после того, как она доехала до датчика. Шум измерения отрабатывает как настоящее отклонение.

Запаздывание 5 тактов, инерция 8, шум датчика ±0,9. Регламент требует 3 сигмы запаса до предела.

0,0 %
прирост выработки от приближения к пределу
± 0,00
разброс регулирования, ед.
94,0
уставку можно поднять до этого, сейчас 94
0
времени за пределом
Выигрыш тут не в том, что регулятор «умнее». Уставка ставится с запасом в 3 сигмы до предела, и весь запас — это разброс регулирования. Разброс вдвое меньше — запас вдвое меньше — уставка уезжает к пределу на 0,00 ед., а это 0,0 % выработки. Переключите регулятор и смотрите не на красоту линии, а на ширину серой полосы.

Объект, возмущение и шкала условные, порядок — инерционный техпроцесс с запаздыванием. Правило «уставка равна пределу минус три сигмы» — регламентное.

Сначала мы попробовали обойтись без RL

Правильный порядок действий в задачах управления — сперва выжать все из того, что уже стоит. Мы так и сделали: разобрали существующий контур, пересчитали настройки регуляторов, проверили датчики.

Это дало прибавку, и на ней можно было остановиться. Уперлись в другое: процесс нестационарный. Свойства сырья плывут от партии к партии, характеристики оборудования меняются по мере наработки, а между управляющим воздействием и откликом — заметное запаздывание. Классический регулятор настраивается вокруг рабочей точки, а рабочая точка здесь сама уезжает.

Вот тогда обучение с подкреплением стало обоснованным, а не модным.

Что именно оптимизируем

Половина провальных проектов RL в промышленности заваливается на формулировке цели. Агент честно максимизирует то, что записали, — включая варианты, которые технолог никогда бы не назвал улучшением.

Функцию цели собирали вместе с технологами и переписывали трижды. В нее вошли не только целевой показатель, но и штрафы: за приближение к технологическим границам, за резкие движения исполнительных механизмов, за колебания. Без штрафа на дерготню агент в симуляции быстро нашел стратегию, которая формально выигрывала, а физически означала износ оборудования за месяцы.

Симулятор, собранный из истории

Учиться на живом процессе нельзя: у экспериментов есть цена в тоннах и в риске. Поэтому обучение шло в модели.

Модель процесса построена по архиву телеметрии: длинная история режимов, возмущений и откликов. Она заведомо неточна — и это учтено в самой методике. Обучение идет не на одной модели, а на семействе: параметры среды случайно разбрасываются вокруг оценок, включая запаздывание, инерцию и шум датчиков. Агент, который выживает во всем семействе, переносит на реальный объект.

Правило простое: агент, обученный на одной идеально подогнанной модели, на железе разваливается. Агент, обученный на плохих моделях в широком разбросе, приезжает работать.

Три ступени допуска к процессу

  1. Советчик. Агент выдает рекомендации, исполняет их оператор, все расхождения журналируются. Здесь набирается доверие и вскрывается расхождение симулятора с реальностью.
  2. Ограниченный автомат. Агент управляет сам, но в узком коридоре вокруг привычного режима, с правом оператора в любой момент забрать управление.
  3. Рабочий режим. Коридор расширяется до технологических границ.

Ни на одной ступени агент не общается с исполнительными механизмами напрямую. Он выдает уставку в существующий контур регулирования, а поверх работают штатные блокировки и защиты, которые никакая модель отменить не может. Это архитектурное требование, и оно не обсуждается: система безопасности обязана оставаться простой и проверяемой.

Что делает агент, когда ситуация невиданная

Отдельный вопрос, который задают на любой защите проекта. Ответ: у агента есть детектор выхода за пределы освоенного. Если текущее состояние процесса непохоже на то, что встречалось при обучении, управление автоматически возвращается к консервативной базовой стратегии, а оператор получает уведомление.

Скучный откат к обычному регулятору лучше творчества модели в незнакомой обстановке.

Кто дежурит рядом с агентом

Обучение с подкреплением на объекте — это не поставка коробки. Вместе с агентом заказчик получает контур наблюдения: журнал всех решений с состоянием процесса на момент решения, сравнение факта с базовой стратегией и еженедельный отчет по отклонениям. Оператор в любой момент видит, почему уставка ушла именно туда, и может вернуть управление одним переключателем.

Без такого журнала первая же нештатная ситуация закончится тем, что агента выключат навсегда — просто потому, что никто не сможет объяснить комиссии, что он делал и почему.

Откуда 31%

Замер сделан сравнением сопоставимых периодов работы на одном оборудовании: базовая стратегия против агента, с учетом различий в сырье. Прибавка складывается из двух источников. Первый — меньше отклонений от оптимальной точки: агент компенсирует запаздывание заранее, потому что видит динамику, а не только текущую ошибку. Второй — меньше времени в переходных режимах при смене партии сырья.

Отдельно фиксируем: часть эффекта дала уже донастройка классического контура на первом этапе. Мы не приписываем ее агенту — иначе цифра врет, а первый же дотошный технолог это вскроет.

Когда за RL браться не надо

  • Процесс стабильный и хорошо описан — обычный регулятор дешевле и надежнее.
  • Нет архива телеметрии хотя бы за длительный период с разными режимами. Собирать историю с нуля — это отдельный проект на год.
  • Нет технолога, готового участвовать в постановке цели. Без него функция вознаграждения будет фантазией инженера.
  • Нельзя выделить контур, где ошибка не приводит к аварии. Если любое неверное действие — сразу авария, начинать надо с советчика и не спешить дальше.

Направление целиком — обучение с подкреплением; порядок внедрения и этапы — внедрение ИИ.

+31 %
к эффективности
  • Reinforcement Learning
  • control
  • sim-to-real
заказчик

Энергетика · детали под NDA

СтендПроверить расчет руками ↑

Те же цифры, но с ручками: порог, нагрузка, объем.

НаправлениеReinforcement Learning

Что мы делаем в этом направлении и сколько это стоит.

Комментарий инженера

В симуляции агент нашел красивую стратегию: он дергал уставку мелко и часто, и по нашей метрике выигрывал у всех. На разборе технолог посмотрел на график и спросил, сколько проживет привод в таком режиме. Ответ был — недолго. Мы забыли, что у железа есть ресурс, и записали это в функцию штрафом за резкие движения. После этого агент стал скучнее и заметно ближе к тому, что можно пускать на объект.
инженер RL, промышленное управление · MoranaLabs
Другие кейсы
— заявка

Опишите задачу  ответим как инженеры. 

Оставьте имя и Telegram — остальное обсудим. Без брифов на 40 слайдов и звонков по три раза.

Отвечаем за пару часовотвечает инженер, а не отдел продажNDA до передачи данных

Любой один канал — куда удобнее, туда и ответим

Или сразу написать в Telegram

Без спама и звонков-роботов. Нажимая кнопку, вы соглашаетесь с политикой конфиденциальности и обработкой персональных данных.