Девяносто процентов ИИ-демонстраций в энтерпрайзе — это технологический иллюзион, собранный на вылизанных датасетах и железе, которое вы никогда не поставите в свой контур. Вы сидите в переговорке, смотрите на красивые дашборды, где bounding boxes идеально обводят каски рабочих или брак на конвейере, и это выглядит как магия. Но чтобы не купить подписку на чёрный ящик, который умрёт при первом изменении освещения в цеху, вам нужен фильтр от продавцов воздуха. Понимать, что спросить у ИИ-подрядчика на демо: 15 вопросов, после которых половина вендоров поплывёт, — это единственный способ вытащить разговор из маркетинга в инженерию.
Запомните сразу: если интегратор обещает точность в 99.9% «из коробки» до того, как посмотрел на вашу реальную выборку, гоните его из офиса. В реальном мире модели деградируют. Камеры покрываются пылью, поставщик меняет цвет упаковки деталей, освещение дрейфует. Честный инженер всегда обещает базовый бейзлайн и архитектуру регулярного дообучения, а не абсолютные цифры, высеченные в камне.
Меня всегда веселит, когда стартапы меряют инференс «в вакууме», хвастаясь 10 миллисекундами на прогон модели. А то, что перед этим кадр нужно декодировать из RTSP-потока, сделать ресайз, перегнать из CPU в GPU-память, а после — вытащить тензоры обратно, распарсить JSON и отправить по сети с диким оверхедом, скромно умалчивается. В итоге 10 мс превращаются в 150, и ваш реалтайм летит в стену. Архитектура ломается не на матричных умножениях, она ломается на вводе-выводе и интеграции.
Что спросить у ИИ-подрядчика на демо: 15 вопросов для аудита
Ниже — кросс-индустриальный чек-лист. Задайте эти вопросы подрядчику. Если в ответ вы слышите туман, просьбы «довериться алгоритму» или мантру «всё работает в нашем облаке» — перед вами красный флаг. Сворачивайте встречу.
- На чьих данных училась базовая (foundation) модель? Если вам продают систему контроля качества, а нейросеть предобучена на ImageNet с котиками и собаками, её способность генерализоваться на специфические царапины на металле будет нулевой. Требуйте подтверждения доменной специфики датасета.
- Как физически и юридически изолируются наши данные при дообучении? Если вендор планирует забирать вашу телеметрию или видеопоток на свои сервера для fine-tuning, убедитесь, что ваши данные не станут частью общей модели, которую завтра продадут вашим конкурентам.
- Как архитектура обрабатывает edge cases и аномалии? Если система не видела ржавую деталь нестандартной формы, она выдаст мусор. Как модель сигнализирует о том, что она «не знает» ответ? Настраивается ли confidence threshold (порог уверенности) для отбраковки сомнительных инференсов в ручной разбор?
- Какой у вас p99 latency под пиковой нагрузкой с учётом полного пайплайна? Требуйте цифры от момента захвата кадра до выдачи бизнес-решения, а не время работы самой нейросети. Просите профиль нагрузки: что будет, если на API упадёт в 10 раз больше запросов, чем обычно.
- Как реализован graceful degradation? Если отвалится соединение с GPU-кластером или забьётся очередь брокера сообщений, упадёт ли весь конвейер или система переключится на запасную эвристику/CPU-инференс с потерей FPS, но без остановки производства?
- Кто конкретно дежурит по ночам и каков SLA на поднятие? Когда инференс в 3 часа ночи начнёт сыпать 500-ми ошибками, блокируя отгрузку товара, вам нужен прямой доступ к L3-инженерам, а не тикетница с ответом в течение суток.
- Сколько стоит инференс-железо для поддержания заявленного throughput? Вендор показывает 60 FPS на демо, но молчит, что под капотом крутится сервер с четырьмя H100. Спросите точную спецификацию оборудования, необходимого для edge-вычислений на вашей локации.
- Какова стоимость и сложность пайплайна переобучения при data drift? Через полгода распределение данных изменится. Кто платит за разметку новых семплов? Насколько автоматизирован процесс continuous training, или для каждого апдейта нужно вызывать команду вендора за отдельный прайс?
- Способна ли система работать в air-gapped контуре без интернета? Для промышленных предприятий зависимость от внешнего облака — это недопустимый риск. Если вендор говорит, что «лицензия проверяется онлайн каждую минуту», это уязвимость инфраструктуры.
- Кому физически принадлежат итоговые веса модели, обученной на наших данных? Это критический вопрос выхода. Если веса остаются собственностью подрядчика, вы платите пожизненную ренту.
- В каком формате отдаётся модель? Если это открытый стандарт вроде ONNX или скомпилированный движок TensorRT — отлично. Если проприетарный бинарник, зашифрованный внутри их контейнера, вы в ловушке.
- Есть ли vendor-lock на инфраструктуру инференса? Можете ли вы взять обученную модель и развернуть её на своём Triton Inference Server, или вы обязаны использовать только проприетарный API-шлюз подрядчика?
- Готовы ли вы прямо сейчас прогнать инференс на нашем сыром датасете, который вы не видели до этой встречи? Это убивает 90% мошенников на месте. Подготовьте флешку с вашим видеопотоком и попросите скормить его модели в реальном времени.
- Каковы метрики на валидационных данных по миноритарным классам? Не смотрите на общую точность (accuracy). Если брака всего 1%, модель может всегда говорить «всё ок» и иметь точность 99%. Смотрите на Precision и Recall (или F1-score) именно по редким и самым критичным событиям.
- Сколько времени займёт интеграция с нашими legacy-системами? Модель может работать идеально, но если для передачи сигнала на ПЛК (программируемый логический контроллер) конвейера потребуется переписать половину заводского софта, проект умрёт на этапе деплоя.
Как отличить честную демку от подкрученной
Индустрия полна фокусов с cherry-picked данными. Подрядчик берёт сотню видео с вашего объекта, выбирает десять самых идеальных, где освещение падает ровно, а объекты движутся предсказуемо, и затачивает (overfits) модель исключительно под них. На демо вы видите магию. На проде вы получаете мусор, потому что модель выучила конкретные кадры, а не физику процесса.
Второй популярный трюк — подмена понятий. Вам показывают работу тяжелого трансформера в облаке, уверяя, что «на edge-устройствах будет работать так же, мы просто сделаем квантизацию». Квантизация с FP32 до INT8 может срезать качество детекции мелких объектов в разы, и то, что работало на сервере, превратится в слепого котенка на камере. Честные подрядчики дают осторожные оценки и всегда показывают метрики после квантизации на целевом железе.
Наш подход в Morana Labs строится на обратном принципе. Мы сразу говорим заказчику: демо на эталонных датасетах ничего не доказывает. Мы берём кусок сырого потока с ваших камер, пусть даже там будет пересвет, блики и грязь на объективе. Гоняем computer vision пайплайн на этом мусоре и показываем реальную метрику без сглаживания. Она будет ниже, чем на красивых выставках. Это честный трейд-офф. Идеальные ответы на пресейле не гарантируют ничего, гарантии даёт только хардкорный тест в боевых условиях.
Вам не нужны вендоры, которые соглашаются со всем и обещают решить любую проблему нейросетью. Вам нужны те, кто на первой же встрече укажет на узкие места в ваших данных, рассчитает TCO с учётом деградации модели и предложит пилот на вашем потоке с прозрачно согласованными метриками успеха. Только такой прагматичный подход позволяет довести индустриальный ИИ до продакшена, а не похоронить бюджет в бесконечных proof-of-concept.