К содержимому
MoranaLabs
Банки / Документооборот — 19 нояб. 2025 г.

Извлечение данных из грязных сканов для бэк-офиса 

Точность распознавания по символам — метрика, которая красиво выглядит и ничего не значит: 99% по символам на документе в сорок строк дает ошибку почти в каждом документе. Мы считали долю документов, ушедших в учет без единой правки оператора.

97,3 %
точность извлечения ключевых полей
34 стр/мин
пропускная способность на узле
29 %
остается оператору — и это тоже результат
стенд · запускается здесь

Стенд: порог автопроведения

Порог решает не «тревога или нет», а «уйдет в учет само или ляжет оператору». Поднимите его — очередь оператора вырастет; опустите — ошибка уедет в проводки.

ОПТИМУМ ПО ЦЕНЕ0 — уверенно нетуверенно да — 1
документ с ошибкой в ключевом поледокумент распознан верноошибка ушла в учетверное ушло оператору

Поток за сутки: 600 документов с ошибкой и 9 400 верно распознанных документов.

71,4 %
уходит в учет без оператора
99,83 %
чистота того, что ушло само
2 855
на ручной разбор за сутки
148 тыс. ₽
цена ошибки за сутки
Без единого гейта на том же пороге было бы 27 ложных за сутки — гейты снимают 55 % мусора и уносят с собой 1,0 % находок. Бесплатных гейтов не бывает. Цена ошибки считается так: три минуты оператора против разбора ошибочной проводки. Порог у заказчика стоит выше расчетного оптимума намеренно: ошибка в учете стоит еще и разговора с аудитором, а это в рублях не считается.

Поток документов и доля сырых ошибок синтетические, порядок — бэк-офис банка. Сверка с мастер-данными контрагентов работает так же.

Метрика, из-за которой проваливаются проекты

Подрядчики распознавания любят число «точность 99%». Посчитаем, что оно означает на практике.

В накладной средней руки — сорок строк, в каждой наименование, количество, цена и сумма. Это порядка полутора тысяч значащих символов. Точность 99% по символам означает пятнадцать ошибок на документе. Оператор все равно проверяет каждую строку, потому что не знает, в какой из них ошибка. Экономии нет, зато есть отчет с красивой цифрой.

Мы с самого начала перешли на другую метрику: доля документов, которые дошли до учетной системы без единой правки человеком. Она безжалостная. Одна ошибка в одном поле — весь документ идет в минус. Зато она напрямую переводится в часы работы бэк-офиса, а значит, в деньги.

Отсюда и заявленный результат: 71% потока проходит насквозь. Остальные 29% попадают к оператору с уже заполненными полями и подсвеченным спорным местом.

Что такое «грязный скан» на самом деле

Термин обманчиво звучит как «немного размыто». В реальном потоке бэк-офиса это:

  • синяя печать, поставленная точно поверх суммы и итога;
  • рукописная подпись, перечеркивающая последние строки таблицы;
  • документ, отправленный факсом, отсканированный, распечатанный и отсканированный снова;
  • сшивка из пяти документов в одном файле без разделителей;
  • страницы вверх ногами и боком, потому что в лоток положили как получилось;
  • сгиб ровно по строке с реквизитами и тень от него на всю страницу.

Ни один из этих случаев не решается выбором движка распознавания. Все они решаются конвейером вокруг него.

Документ проверяет сам себя

Главный рычаг качества в первичных документах — избыточность. Бухгалтерский документ полон арифметики, которую можно пересчитать и поймать ошибку без всякого эталона.

  1. Сумма по строке равна количеству, умноженному на цену. Разошлось — распозналась одна из трех величин неверно.
  2. Сумма всех строк равна итогу документа. Разошлось — потеряна или задвоена строка.
  3. НДС соотносится с суммой по одной из действующих ставок. Не соотносится — ошибка в разряде.
  4. ИНН имеет контрольную сумму и проверяется арифметически, без обращения к справочникам.
  5. В ТОРГ-12 есть поле «Всего наименований» — бесплатный валидатор полноты разбора таблицы.
  6. Дата документа не бывает из будущего и почти никогда — старше квартала.

Эти проверки поймали больше ошибок, чем любое улучшение модели. Более того, они дают то, чего не дает ни одна нейросеть: понимание, где именно документ разошелся, — и оператор смотрит в одну строку вместо сорока.

Порог, который отдает документ человеку

Система обязана уметь признавать поражение. У каждого извлеченного поля есть оценка уверенности, у документа — набор пройденных и проваленных самопроверок. Документ уходит в учет автоматически только при полном сходе арифметики и уверенности выше порога по ключевым полям.

Порог — это ручка, за которую держится заказчик. Выкрутили в одну сторону — больше автоматизации и больше риска, в другую — меньше риска и больше ручной работы. Мы отдали эту ручку финансовому блоку вместе с отчетом, который показывает обе стороны размена на реальном потоке за прошедший месяц.

Сшивки, повороты и прочая механика

До распознавания поток проходит подготовку: определение ориентации страницы и разворот, выравнивание перекоса, разделение сшитого файла на отдельные документы по признакам первой страницы, отбрасывание пустых оборотов. Скучный конвейер, который дает больше процентов, чем смена модели.

Пропускная способность в 34 страницы в минуту на узле — это цифра со всем конвейером, а не только со временем работы сети. Такую цифру и надо требовать от подрядчика: время от файла на входе до записи в учетной системе.

Почему все это стоит внутри периметра

Банковские документы, паспорта, кадровые сканы в публичное облако не отправляются. Это требование закона о персональных данных. Служба безопасности тут просто соглашается. Вся обработка идет на серверах заказчика, наружу не уходит ни один файл.

Побочный эффект приятный: нет платы за страницу. Облачные сервисы распознавания тарифицируются с документа, и на потоке в десятки тысяч страниц в месяц собственный контур окупается быстрее, чем заканчивается пилот.

Чего мы не обещаем

  • Рукописный текст в свободной форме. Печатные бланки с рукописными полями — да, сплошной рукописный документ — нет.
  • 100% автоматизации. Спорные документы будут всегда, вопрос только в их доле.
  • Работы с незнакомым типом документа из коробки. Новый тип — это разметка выборки и цикл дообучения.
  • Проведения документов без человека. Мы создаем черновик, решение о проведении остается за бухгалтером.

С чего начинается такой проект

С выборки. Двести-триста реальных документов из живого потока, со всей грязью, а не отобранные красивые образцы. На них измеряется базовая линия, оценивается доля автоматизации и считается экономика. Эту оценку мы делаем до договора, потому что она же определяет, стоит ли вообще браться.

Рядом лежат OCR-системы как направление, распознавание первички в 1С, если поток идет в учетную систему, и сверка документов, когда распознанное нужно сопоставить с данными контрагента.

71 %
сканов в учетную систему без оператора
  • OCR
  • document AI
  • CV
  • on-prem
  • извлечение реквизитов
заказчик

Банки / Документооборот · детали под NDA

СтендПроверить расчет руками ↑

Те же цифры, но с ручками: порог, нагрузка, объем.

НаправлениеOCR-системы на заказ

Что мы делаем в этом направлении и сколько это стоит.

Комментарий инженера

Заказчик пришел с готовым требованием: точность не ниже 98% по символам. Мы посчитали при нем, что это значит на его же документах, — около тридцати ошибок на пачке из десяти накладных, размазанных случайно. Оператор при таком раскладе перепроверяет все подряд, и вся автоматизация превращается в двойную работу. Переписали требование на долю документов без правок. Спорить пришлось час, зато потом весь проект мерился тем, что реально экономит время.
инженер document AI · MoranaLabs
Другие кейсы
— заявка

Опишите задачу  ответим как инженеры. 

Оставьте имя и Telegram — остальное обсудим. Без брифов на 40 слайдов и звонков по три раза.

Отвечаем за пару часовотвечает инженер, а не отдел продажNDA до передачи данных

Любой один канал — куда удобнее, туда и ответим

Или сразу написать в Telegram

Без спама и звонков-роботов. Нажимая кнопку, вы соглашаетесь с политикой конфиденциальности и обработкой персональных данных.