Сначала мы попробовали обойтись без RL
Правильный порядок действий в задачах управления — сперва выжать все из того, что уже стоит. Мы так и сделали: разобрали существующий контур, пересчитали настройки регуляторов, проверили датчики.
Это дало прибавку, и на ней можно было остановиться. Уперлись в другое: процесс нестационарный. Свойства сырья плывут от партии к партии, характеристики оборудования меняются по мере наработки, а между управляющим воздействием и откликом — заметное запаздывание. Классический регулятор настраивается вокруг рабочей точки, а рабочая точка здесь сама уезжает.
Вот тогда обучение с подкреплением стало обоснованным, а не модным.
Что именно оптимизируем
Половина провальных проектов RL в промышленности заваливается на формулировке цели. Агент честно максимизирует то, что записали, — включая варианты, которые технолог никогда бы не назвал улучшением.
Функцию цели собирали вместе с технологами и переписывали трижды. В нее вошли не только целевой показатель, но и штрафы: за приближение к технологическим границам, за резкие движения исполнительных механизмов, за колебания. Без штрафа на дерготню агент в симуляции быстро нашел стратегию, которая формально выигрывала, а физически означала износ оборудования за месяцы.
Симулятор, собранный из истории
Учиться на живом процессе нельзя: у экспериментов есть цена в тоннах и в риске. Поэтому обучение шло в модели.
Модель процесса построена по архиву телеметрии: длинная история режимов, возмущений и откликов. Она заведомо неточна — и это учтено в самой методике. Обучение идет не на одной модели, а на семействе: параметры среды случайно разбрасываются вокруг оценок, включая запаздывание, инерцию и шум датчиков. Агент, который выживает во всем семействе, переносит на реальный объект.
Правило простое: агент, обученный на одной идеально подогнанной модели, на железе разваливается. Агент, обученный на плохих моделях в широком разбросе, приезжает работать.
Три ступени допуска к процессу
- Советчик. Агент выдает рекомендации, исполняет их оператор, все расхождения журналируются. Здесь набирается доверие и вскрывается расхождение симулятора с реальностью.
- Ограниченный автомат. Агент управляет сам, но в узком коридоре вокруг привычного режима, с правом оператора в любой момент забрать управление.
- Рабочий режим. Коридор расширяется до технологических границ.
Ни на одной ступени агент не общается с исполнительными механизмами напрямую. Он выдает уставку в существующий контур регулирования, а поверх работают штатные блокировки и защиты, которые никакая модель отменить не может. Это архитектурное требование, и оно не обсуждается: система безопасности обязана оставаться простой и проверяемой.
Что делает агент, когда ситуация невиданная
Отдельный вопрос, который задают на любой защите проекта. Ответ: у агента есть детектор выхода за пределы освоенного. Если текущее состояние процесса непохоже на то, что встречалось при обучении, управление автоматически возвращается к консервативной базовой стратегии, а оператор получает уведомление.
Скучный откат к обычному регулятору лучше творчества модели в незнакомой обстановке.
Кто дежурит рядом с агентом
Обучение с подкреплением на объекте — это не поставка коробки. Вместе с агентом заказчик получает контур наблюдения: журнал всех решений с состоянием процесса на момент решения, сравнение факта с базовой стратегией и еженедельный отчет по отклонениям. Оператор в любой момент видит, почему уставка ушла именно туда, и может вернуть управление одним переключателем.
Без такого журнала первая же нештатная ситуация закончится тем, что агента выключат навсегда — просто потому, что никто не сможет объяснить комиссии, что он делал и почему.
Откуда 31%
Замер сделан сравнением сопоставимых периодов работы на одном оборудовании: базовая стратегия против агента, с учетом различий в сырье. Прибавка складывается из двух источников. Первый — меньше отклонений от оптимальной точки: агент компенсирует запаздывание заранее, потому что видит динамику, а не только текущую ошибку. Второй — меньше времени в переходных режимах при смене партии сырья.
Отдельно фиксируем: часть эффекта дала уже донастройка классического контура на первом этапе. Мы не приписываем ее агенту — иначе цифра врет, а первый же дотошный технолог это вскроет.
Когда за RL браться не надо
- Процесс стабильный и хорошо описан — обычный регулятор дешевле и надежнее.
- Нет архива телеметрии хотя бы за длительный период с разными режимами. Собирать историю с нуля — это отдельный проект на год.
- Нет технолога, готового участвовать в постановке цели. Без него функция вознаграждения будет фантазией инженера.
- Нельзя выделить контур, где ошибка не приводит к аварии. Если любое неверное действие — сразу авария, начинать надо с советчика и не спешить дальше.
Направление целиком — обучение с подкреплением; порядок внедрения и этапы — внедрение ИИ.