Март. Платформа корпоративного университета проводит масштабную аттестацию инженеров-проектировщиков. Панель мониторинга залита красным цветом: система прокторинга на онлайн-экзамене выдала флаги нарушения для сорока процентов сдающих. Причина? Солнце зашло за тучи, дешёвые веб-камеры не вытянули экспозицию, и динамический порог детектора лиц рухнул, потеряв людей в кадре. В это же время кандидат с микронаушником спокойно получает высший балл, потому что алгоритм видит идеальное лицо с идеальным фокусом. Любая автоматика ломается именно здесь — на стыке глянцевых обещаний вендоров и суровой физики дешёвой оптики конечного пользователя.
— Кому вы сказки рассказываете? Ваш детект списывания нейросетью обходится за две минуты. На Хабре лежат десятки мануалов: я просто заворачиваю зацикленное видео в OBS, скармливаю его браузеру как виртуальную камеру, и ваш искусственный интеллект радостно ставит мне статус «чисто».
И я полностью соглашусь с этим возражением, если ваша архитектура собрана на коленке из бесплатных репозиториев. Давайте отделим хайп от реальной инженерии. Что действительно качественно ловит машинное зрение? Отсутствие или подмену лица, появление второго человека в кадре, наличие смартфона в руке и отвод взгляда. Но дьявол кроется не в красивых демонстрациях, а в частоте ложных срабатываний. Обычный детект второго человека даёт от двух до трёх процентов FP просто потому, что камера цепляется за плакат на стене, отражение в оконном стекле или младшего брата, пробегающего далеко на фоне. Детект смартфона генерирует ложные срабатывания на чёрные калькуляторы, массивные кошельки и прямоугольные плитки шоколада. А отвод взгляда — это вообще катастрофа. Если вы начнёте жёстко штрафовать за отклонение зрачков, ваш FP пробьёт потолок в тридцать процентов. Люди смотрят в потолок или в стену, когда пытаются вспомнить формулу. Они не роботы.
— Значит, вся эта автоматика слепа к базовым трюкам. Я просто распечатаю своё фото в хорошем разрешении и повешу его на картонку перед объективом.
Именно для этого внедряется liveness античит прокторинг. Без проверки витальности весь ваш контур безопасности — это успокоительное плацебо для деканата. Когда мы в Morana Labs калибровали гибридные модели для крупной платформы оценки компетенций, цифры показали суровую реальность: классический face detection бесполезен против спуфинга. Liveness-алгоритмы бывают активными, где пользователя просят улыбнуться или повернуть голову, что дико бесит сдающих, и пассивными. Пассивный liveness бесшумно анализирует частоту микровибраций, текстуру в фурье-пространстве и оценку глубины сцены. Плоский лист бумаги или экран смартфона с видео отражают свет иначе, чем трёхмерное живое лицо с капиллярной сеткой. Это отсекает виртуальные камеры и фотографии.
— Допустим, подмену видео вы отбили. Тогда я вставлю в ухо магнитный микронаушник, а мой приятель встанет ровно за крышкой ноутбука, вне поля зрения камеры, и будет пальцем показывать мне на правильные ответы на экране.
Бинго. И мы это не поймаем никогда. Я повторю эту мысль максимально чётко для всех руководителей продуктов и проректоров по цифровизации: ни одна система компьютерного зрения, работающая через единственную фронтальную 720p веб-камеру, не способна физически увидеть капсулу наушника в слуховом канале. Мы не поймаем шпаргалку, аккуратно наклеенную прямо на рамку монитора. Мы не задетектим суфлёра, стоящего в слепой зоне за кадром, если он не издаёт звуков. Это антихайп, о котором нужно честно говорить заказчику. Если вендор обещает вам «гарантированное обнаружение скрытых микронаушников» по видеопотоку — он врёт. Нейросеть в прокторинге работает как крупное сито. Она отфильтровывает наглую глупость, очевидные нарушения и фоновый шум.
— Какой тогда смысл платить за этот софт? Раз это просто сито, я напишу скрипт, который автоматически аннулирует экзамен после трёх предупреждений от нейросети, и уволю всех живых наблюдателей.
Сделайте так. А потом готовьте бюджет на юристов. Одно ложное обвинение кристально честного студента, который просто слишком долго смотрел в окно, обернётся официальной жалобой, публичным скандалом в соцсетях и судебным иском. Цена одного авто-вердикта слишком высока. Нельзя выносить финальное решение «списал» без человека-в-петле. Роль автоматики — просеять поток. Она снижает когнитивную нагрузку на живого проктора: вместо просмотра двух часов скучнейшего видео он получает пять коротких клипов с таймкодами, где зафиксированы реальные аномалии. Итоговая кнопка «аннулировать» всегда нажимается пальцем живого человека.
Распознавание лиц на экзамене, 152-ФЗ и физика вычислений: где живёт архитектура
— Человек так человек. Я просто пущу весь видеопоток со всех камер студентов в облако на мощные GPU-сервера, там нейросети всё распознают и выдадут дашборд наблюдателям.
Поздравляю, вы только что подписали себе приговор при первой же проверке Роскомнадзора. Лица пользователей — это биометрические персональные данные. Передача непрерывного потока биометрии в случайное публичное облако для обработки нарушает базовые принципы 152-ФЗ. Для легальной работы вам требуется локальный on-premise контур, развёрнутый строго внутри защищённого периметра заказчика или на сертифицированной инфраструктуре. Вам нужны явные, юридически выверенные согласия на обработку биометрии, протоколы немедленного обезличивания после завершения сессии и акты об уничтожении персональных данных. Хранить эти данные годами «на всякий случай» категорически запрещено.
— On-premise инфраструктура для процессинга тысяч видеопотоков разорит любую платформу. Значит, я упакую нейросети в WebAssembly и заставлю их работать прямо в браузере студента на его устройстве.
Чистый edge-инференс — это прекрасная концепция ровно до того момента, пока она не столкнётся с реальностью пятилетнего ноутбука на процессоре Celeron. Да, перенос вычислений на сторону клиента решает проблему узкой полосы пропускания и снимает часть рисков по 152-ФЗ, так как сырое видео не покидает устройство. Но когда вы попытаетесь запустить в Chrome тяжёлый пайплайн распознавания лиц и liveness-проверку, FPS упадёт до трёх кадров в секунду, кулер взвоет, как турбина самолёта, а вкладка крашнется из-за утечки памяти WebGL. Парк устройств слишком разнороден для агрессивных локальных вычислений.
Жизнеспособная архитектура всегда гибридная. Вы опускаете на edge только самые легковесные каскады: трекинг bounding box лица, пассивный анализ освещённости и быстрый детект крупных объектов вроде телефонов. Если локальная модель фиксирует устойчивую аномалию, она не принимает решение. Она вырезает несколько кадров инцидента в низком разрешении и отправляет этот легковесный кроп на сервер. А вот уже внутри защищённого on-premise контура включаются тяжёлые ансамбли моделей, которые проводят глубокую валидацию. Это экономит трафик, не сжигает железо пользователя и удерживает обработку биометрии в рамках закона.
Чек-лист для легального и рабочего контура прост. Автоматика размечает таймлайны и собирает артефакты. Проктор отсматривает только спорные эпизоды и выносит контекстно-зависимые решения. Вся передача данных идёт с шифрованием, а биометрия уничтожается строго по регламенту без оседания на промежуточных серверах. Если вы устали от презентаций, где ИИ обещает магически решить все проблемы, приходите на пилот. Мы развернём гибридный контур на вашей платформе, прогоним модели на реальных архивах записей экзаменов и замерим процент ложных срабатываний. Вы увидите сухую физику вычислений и поймёте, что именно работает под нагрузкой.