Парсер первички закрыт на расчете
Направление задумывалось вторым продуктом: агент в контуре клиента разбирает счета, УПД и акты. Спрос по частотности в десятки раз больше, чем у видеоаналитики. Направление закрыто до того, как в него ушло GPU-время, и вот арифметика, которая к этому привела.
вход в рынок не сходится: канал занят вендором
закрыто в июле 2026
- layout detection
- table structure
- dewarping
- json schema v1
- расчет входа
- 01
Вход
цифровой PDF, DOCX, скан МФУ, фото с телефона
- 02
Границы листа
детекция, ректификация, деварпинг изогнутой страницы
- 03
Детектор layout
блоки, классы, порядок чтения
- 04
Строчник и таблицы
распознавание строк, структура ячеек со спанами
- 05
page JSON v1
bbox, порядок чтения, provenance; DOCX и Markdown из него
- спрос
- «распознавание документов» — 6 107 запросов в месяц, ценовой интент сформирован
- кто держит канал
- 1С:Распознавание первичных документов в ИТС, Entera и другие сервисы по подписке
- датасет
- готового русского layout-набора не существует, сбор — месяцы работы
- часть источников
- отвалилась на антиботе: госзакупки и pravo.gov.ru не отвечают ни со станции, ни с мака
- своя vlm
- претрейн исключен расчетом: сотни тысяч GPU-часов
- решение
- закрыто в июле 2026 до вложения GPU-времени
Технически задача решалась
Конвейер был спроектирован целиком: детекция границ листа и деварпинг для фото с телефона, детектор layout, распознаватель строк, модель структуры таблиц. Выход — JSON с координатами и порядком чтения, из него рендерятся Markdown, HTML и DOCX. Ни один пункт не выглядел невыполнимым — вопрос был в объеме данных и сроке.
Что убило направление
Бухгалтеру не нужно искать поставщика распознавания: сервис вшит в 1С и продается по страницам через ИТС, а на местах стоят франчайзи. Мы попадали не в пустой рынок, а в занятый канал, куда пришлось бы заходить с нулевой узнаваемостью и с датасетом, который еще предстояло собрать с нуля. Дыра была в канале продаж, а не в технологии — и закрыть ее обучением моделей невозможно.
Почему закрыли до старта обучения, а не после
Расчет делался в том же порядке, что и по любой гипотезе: сначала цена входа и канал, потом GPU-часы. Претрейн собственной VLM отпал первым — сотни тысяч GPU-часов при том, что преимущество в этой задаче дают данные, а не размер модели. Дальше стало видно, что и облегченный вариант требует месяцев сбора данных ради выхода в занятый канал. Направление закрыто.
Что осталось полезного
Канон формата страницы с координатами и порядком чтения, реестр источников с проверкой лицензий (NC, ND и research-наборы в продуктовые веса не заезжают) и прием генерации синтетики на лету в даталоадере вместо хранения сотен гигабайт. Все это переиспользуется в заказных OCR-работах и в RAG on-prem, где развалившийся PDF гробит выдачу.
Закрытие относится к продуктовой затее, а не к задаче. Разбор документов под конкретного заказчика остается рабочей услугой: там есть его бланки, его объем и его канал — то есть все то, чего не было у продуктовой версии.
Что происходило по направлению
- 29.07.2026
Скоуп пересобран с извлечения реквизитов на разбор структуры страницы, претрейн своей VLM исключен расчетом. Заведен реестр источников с лицензиями, часть источников признана недоступной из-за антибота.
- июль 2026
Направление закрыто как продуктовое: вход в рынок требует собрать датасет с нуля и конкурировать с сервисом, вшитым в 1С. Наработки по формату и лицензиям переведены в заказные работы.
Другие направления
Вся витрина R&D →Статус этого направления — закрыто неудачно. Как читать статусы и по каким правилам работает лаборатория — на витрине R&D.