К содержимому
MoranaLabs.
Инженерные гайды10 мин чтения0 просмотров

СБИС, Диадок, Контур или своя модель: чем отличается распознавание первички 

Разбор по применимости, а не по громкости маркетинга: что решает штатный сервис платформы, что — распознавание внутри ЭДО, что — специализированные OCR-вендоры и когда есть смысл в своей модели. С таблицей по пяти осям и процедурой выбора за две недели.

0xReality

Запрос «СБИС или Диадок для распознавания» выглядит как вопрос про конкурентов, но внутри он про разные классы инструментов. Это как выбирать между грузовиком и погрузчиком: оба ездят и оба нужны, только задачи у них разные, и на площадке они обычно работают вместе.

Поэтому ниже никакого рейтинга «лучших сервисов распознавания». Вместо него — разбор четырех классов решений, честные границы применимости каждого и процедура, по которой выбор делается за две недели на ваших документах. Как устроен сам поток документов, разобрано отдельно: распознавание первичных документов в 1С.

Класс 1. Штатный сервис платформы

Распознавание, встроенное в саму учетную систему: загрузили скан из карточки документа, получили заполненную форму. Подключается из интерфейса, тарифицируется пакетами документов, живет в облаке вендора платформы.

Сильная сторона: нулевой порог входа. Никакой интеграции, никаких договоров с третьей стороной, работает в тот же день, на типовых печатных формах результат предсказуемый.

Граница: сопоставление с вашей номенклатурой ограничено тем, что накоплено в базе, нетиповые формы мелких поставщиков идут тяжело, а документы уходят на сторону вендора. При потоке в пару сотен документов в месяц это лучший выбор по соотношению усилий и результата, и мы первыми это скажем.

Класс 2. Распознавание внутри ЭДО

Экосистемы операторов электронного документооборота: СБИС от Тензора, Диадок и продукты Контура. Их основной продукт — юридически значимый обмен, а распознавание бумажного и сканированного хвоста прикручено к нему как дополнительный сервис.

Логика тут стройная. Если контрагент уже подключен к тому же оператору, документ приходит структурированными данными и распознавать нечего вообще. Хвост из сканов оператор подбирает своим сервисом, чтобы вы не держали два разных процесса.

Сильная сторона: один поставщик на весь входящий поток, готовые модули для типовых конфигураций 1С, зрелая поддержка, понятная тарификация. Если вы уже живете в одной из этих экосистем, первым делом спросите своего менеджера: такой разговор дешевле любого тендера.

Граница: распознавание тут развивается как сервис вокруг основного продукта. Ваша номенклатура, отраслевые формы и требование держать документы внутри периметра — это ровно те места, где сервис общего назначения упирается в свою универсальность.

Класс 3. Специализированные OCR и IDP-вендоры

Компании, для которых распознавание документов и есть основной бизнес: ABBYY, чьи продукты годами были отраслевым стандартом, Smart Engines, Content AI и другие игроки этого класса. Продается лицензия на платформу плюс проект внедрения силами партнера.

Сильная сторона: движки, обкатанные на миллионах документов, готовые модули под паспорта и удостоверения, on-prem поставка, зрелые инструменты разметки шаблонов. Для потоков в десятки тысяч документов в месяц и для отраслей с жесткими требованиями это индустриальный стандарт.

Граница и главный практический вопрос: лицензия закрывает извлечение полей, а сопоставление с вашим справочником, коннектор к 1С и очередь спорных документов остаются проектом. То есть к стоимости лицензии прибавляется интеграционная работа, сопоставимая с самостоятельным внедрением. Отдельно уточняйте, кто сегодня поставляет лицензию и техподдержку в России: за последние годы состав вендоров и правообладателей на этом рынке заметно перетасовался.

Класс 4. Своя модель в вашем контуре

Сервис разворачивается на ваших серверах, обучается на ваших документах и справочниках, документы наружу не выходят. Разовая стоимость проекта плюс сопровождение, объем не тарифицируется.

Сильная сторона: сопоставление с вашей номенклатурой здесь центральная задача, под нее и строится вся система; нетиповые формы лечатся дообучением на ваших правках; данные не покидают периметр; на больших объемах стоимость единицы стремится к стоимости электричества.

Где мы проигрываем готовому, и это стоит сказать прямо: скорость запуска (три-четыре недели против одного дня), цена входа, отсутствие круглосуточной поддержки уровня федерального вендора и годы обкатки на чужих документах. Если ваши документы типовые, а объем небольшой, коробка даст результат быстрее и дешевле. Экономику по объемам мы посчитали в отдельном разборе: сколько стоит распознавание документов в 1С.

Пять осей сравнения

Таблица отвечает на вопрос «что кому дается легче», а не «кто лучше». Первый столбец — ось, по которой стоит оценивать свою задачу до общения с продавцами.

ОсьШтатный сервисЭДО-операторOCR-вендорСвоя модель
Сопоставление с вашей номенклатуройВ пределах накопленного в базеБазовое, по истории обменаНастраивается проектомЦентральная задача проекта
Нетиповые формы поставщиковСлабое местоСредне, шаблонамиШаблоны и обучение, за отдельные деньгиДообучение на ваших правках
Документы не выходят из контураОблако вендораОблако оператораЕсть on-prem поставкаТолько ваш контур
Стоимость на объемеЛинейно за документЛинейно за документСтупени лицензииРазово плюс сопровождение
Скорость запускаДеньДниНедели и месяцы3–4 недели до пилота

Шестая ось, которая не помещается в таблицу, но решает в закупке: наличие в реестре российского ПО. Для госзаказчиков и компаний с госучастием это пропуск к сделке, и проверяется он до всех технических дискуссий — что там требуется, разобрано в статье про реестр российского ПО для ИИ.

Когда честно выгоднее взять готовое

Четыре признака. Если у вас хотя бы три из них, разговор о своей модели можно закрывать и экономить время.

  • Поток до полутора тысяч документов в месяц. Разовая стоимость внедрения не отобьется, арифметика приведена в разборе цены.
  • Документы типовые. Печатные формы из тех же учетных систем, десяток постоянных поставщиков, никакой экзотики.
  • Нет требований к контуру. Персональные данные в потоке не идут, служба безопасности спокойно относится к облаку.
  • Справочник в порядке. Артикулы поставщиков заполнены, дублей нет, наименования устоявшиеся.

Отдельный случай: если больше половины контрагентов уже подключены к вашему оператору ЭДО, первым шагом идет расширение обмена, и только потом распознавание. Каждый переведенный на ЭДО поставщик убирает документы из очереди навсегда и стоит ноль рублей на технологиях.

Когда готовое не тянет

Обратный список. Здесь универсальные сервисы упираются в свою же универсальность, и это нормальное свойство продукта для всех сразу.

  • Самописная конфигурация. Готовый модуль рассчитан на типовые объекты; на конфигурации, которую пилили десять лет, он встает через доработку, и вопрос сводится к тому, кто ее делает. Что именно ломается — в разборе про базу с 2011 года.
  • Специфичная номенклатура. Метизы, кабельно-проводниковая продукция, химия, автозапчасти с кросс-номерами. Там наименование поставщика и ваша позиция расходятся принципиально, и универсальное сравнение строк не помогает.
  • Закрытый контур и 152-ФЗ. Паспорта, персональные данные, коммерческая тайна, требование обрабатывать все внутри периметра.
  • Отраслевые формы. Спецификации, отраслевые накладные, документы с приложениями на десятки листов — того, чего нет в наборе шаблонов вендора.
  • Объем от нескольких тысяч документов в месяц. Тариф за документ превращается в постоянную статью расходов, которая растет вместе с бизнесом.

Ваш случай — ваш класс решения

Навигатор по типичным ситуациям. Он огрубляет, но экономит месяц переговоров.

СитуацияС чего начинать
200–500 документов, типовые формы, типовая конфигурацияШтатный сервис платформы. Проект тут не окупится
Живете в экосистеме оператора ЭДО, хвост сканов небольшойСервис своего оператора плюс подключение новых контрагентов к обмену
Розница или дистрибуция, десятки тысяч позиций и сотни поставщиковСвоя модель: узкое место — сопоставление номенклатуры, его никто не закроет за вас
Госзаказчик или компания с госучастиемСначала фильтр по реестру российского ПО, потом все остальное
Паспорта, персональные данные, закрытый контурOn-prem: своя модель или коробка OCR-вендора с локальной поставкой
Производство с отраслевыми формами и спецификациямиПилот у двух классов сразу на одной выборке: коробка и своя модель
Десятки тысяч документов в месяц, несколько юрлицOCR-вендор или своя модель, выбор по совокупной стоимости владения на три года

Три способа тарификации и где в них ловушки

Итоговые цифры коммерческих предложений сравнимы только после того, как приведены к одной единице. Единиц на рынке три.

За документ. Понятнее всего, но уточняйте, что считается документом. Накладная на пять листов — это одна единица или пять? Пачка сканов, загруженная одним файлом, — сколько? Разница в счете за месяц бывает двукратной.

За страницу или за поле. Ближе к себестоимости вендора и хуже прогнозируется вами: счет зависит от того, какие документы придут в этом месяце. Просите посчитать по вашей реальной статистике за прошлый квартал.

Лицензия ступенями. Оплачивается объем в год, часто с привязкой к мощности сервера. Тут ловушка в переходе через ступень: рост потока на десять процентов может стоить как половина годовой лицензии. Спрашивайте цену следующей ступени сразу, до подписания текущей.

Чего не решит ни один класс

Список вещей, которые останутся вашими независимо от выбора поставщика. Продавцы о них обычно молчат, потому что это чужая зона ответственности.

  • Беспорядок в справочниках. Дубли контрагентов и позиции без артикулов ломают сопоставление у любой системы. Сначала данные, потом технологии.
  • Отсутствие владельца процесса. Кто-то должен разбирать очередь спорных документов каждый день и отвечать за качество потока. Без этой роли система через квартал превращается в свалку необработанных файлов.
  • Документы, которые физически не читаются. Копия копии с печатью поверх суммы остается ручной работой и у самого дорогого вендора.
  • Регламент приемки. Пока не решено, кто проводит документ и что делать с расхождением по количеству, автоматика просто ускоряет неопределенность.

Гибрид, о котором редко говорят продавцы

Выбор редко бывает взаимоисключающим. Рабочая конструкция в среднем бизнесе выглядит так: оператор ЭДО закрывает юридически значимый обмен со всеми, кого удалось подключить, а своя модель разбирает бумажный и сканированный хвост, который остается. Первый канал дешевеет с каждым переведенным контрагентом, второй берет на себя то, что структурированным не станет никогда.

При таком разделении и объем для своей модели считается честно: не весь входящий поток, а только та его часть, которая реально приходит картинками. Иногда после такого подсчета проект отменяется — и это правильный результат разговора.

Двенадцать вопросов вендору

Список работает с любым классом решений, включая нас. Ответы стоит получить письменно до сравнения итоговых цифр в коммерческих предложениях.

  1. Где физически обрабатываются документы и есть ли поставка в наш контур?
  2. Что считается единицей тарификации: документ, страница или поле? Накладная на пять листов — это сколько?
  3. Сопоставляете ли позиции с нашей номенклатурой или отдаете распознанный текст?
  4. Что происходит с формой поставщика, которой нет в ваших шаблонах: кто ее добавляет, за чей счет и в какой срок?
  5. Дообучается ли система на правках наших операторов и кому принадлежат эти данные?
  6. Какая метрика точности используется и фиксируется ли она в договоре?
  7. Как документы попадают в 1С: готовая обработка, расширение, внешний сервис? Требуются ли правки конфигурации и снятие с поддержки?
  8. Что с персональными данными: обрабатываются ли паспорта, где хранятся, как закрываются требования 152-ФЗ?
  9. Есть ли решение в реестре российского ПО?
  10. Как меняется цена при росте потока вдвое?
  11. Какой SLA в пиковые дни? Конец месяца и квартала — это момент, когда весь рынок шлет документы одновременно.
  12. Если мы уйдем к другому поставщику, что заберем с собой: шаблоны, накопленные сопоставления, историю?

Шестой и двенадцатый вопросы отсеивают больше всего. Метрика без фиксации в договоре означает, что спорить о результате вы будете после оплаты, а невозможность забрать накопленные сопоставления — это стоимость перехода, которая растет каждый месяц работы.

Как выбрать за две недели

Процедура, которая стоит дешевле любого сравнения по презентациям. Она же защищает от главной ловушки демонстраций: вендор показывает результат на своих документах, и результат всегда прекрасен.

  1. Соберите одну выборку. Пятьдесят своих документов: сорок типичных и десять худших из тех, что реально приходят.
  2. Раздайте всем претендентам одинаковый набор. Включая внутреннюю команду, если рассматриваете вариант «сделаем сами».
  3. Задайте одну метрику. Доля документов, прошедших без единой правки человеком. Проценты по символам к сравнению не принимаются.
  4. Проверяйте результат сами. Считает вашу выборку ваш бухгалтер, а не менеджер вендора.
  5. Сравнивайте по цене сэкономленного часа, а не по цене лицензии. Как это считается — в разборе цены на потоке в 3000 документов.

Две недели такого забега дают больше, чем два месяца переговоров, и стоят только времени вашего бухгалтера. По итогам обычно выясняется, что классы решений различаются сильнее, чем продукты внутри одного класса.

Что дальше

Если после этого разбора видно, что задача укладывается в готовый сервис — берите готовый сервис, это честный ответ и он экономит вам деньги. Если упирается в свою номенклатуру, нетиповые формы или закрытый контур, состав работ и вилки по нашей стороне лежат на странице распознавания первичных документов в 1С. Когда документы идут не только в учетную систему, но и в архив, ERP или CRM, задача шире и разбирается в направлении OCR-систем на заказ; смежные сценарии внутри учетной системы собраны в разделе ИИ в 1С.

И самый дешевый шаг перед любым выбором: посчитайте, сколько ваших контрагентов можно перевести на электронный обмен в этом квартале. Документ, который не пришел картинкой, распознавать не нужно ни за какие деньги.

  • #
  • #OCR
  • #выбор подрядчика
  • #первичные документы
  • #распознавание документов
  • #ЭДО
ПоделитьсяTelegramX
рассылка

Новые статьи — на почту

Лонгриды про ML в проде, edge и компьютерное зрение — сразу после выхода.

Канал в Telegram: morana.log

Без спама. Нажимая «Подписаться», соглашаетесь с обработкой персональных данных

бесплатный pdf-гайд

Edge AI или облако: когда тащить нейросеть на железо

Признаки, фреймворк выбора и прикидка экономии — короткий PDF-гайд на почту.

PDF · 5 страниц · без спама. Нажимая «Получить», соглашаетесь с обработкой персональных данных

Читать дальше
— заявка

Опишите задачу  ответим как инженеры. 

Оставьте имя и Telegram — остальное обсудим. Без брифов на 40 слайдов и звонков по три раза.

Отвечаем за пару часовотвечает инженер, а не отдел продажNDA по запросу

Сюда напишем — это быстрее всего

Или сразу написать в Telegram

Без спама и звонков-роботов. Нажимая кнопку, вы соглашаетесь с политикой конфиденциальности и обработкой персональных данных.