К содержимому
MoranaLabs.
12 — направление

OCR-системы на заказ 

Ручной ввод документов стремится к нулю: данные сами попадают в вашу систему уже проверенными.

пилот от 500 000 ₽4–6 недель

входной этап, не весь проект

у вас без облака

Отвечает инженер за пару часовсмета фиксируется на этапправа на код ваши после оплаты

Сканы, фото и PDF превращаются в готовые данные для ваших систем. Разрабатываем OCR-системы на заказ — автоматическое распознавание документов.

95–99%
точность на печатном тексте
−80%
ручного ввода
у вас
без облака

Разрабатываем OCR-системы на заказ: распознавание документов, встроенное в ваши процессы — от входящей почты до архива. Документ считывается, раскладывается по полям и попадает в вашу систему готовой записью.

Это не «подключить готовый OCR». Готовые движки хорошо читают чистый печатный текст и плывут на ваших бланках, печатях, штампах, рукописных пометках и кривых сканах с телефона. Мы строим систему под ваш документооборот: дообучаем под ваши формы, добавляем извлечение нужных полей и проверку по правилам — и отвечаем за точность на ваших реальных документах.

Что распознаем

Потоки документов, которые автоматизируем чаще всего:

  • Финансовые и юридические документы: счета, акты, спецификации, договоры. Учетный поток в 1С вынесен в отдельное направление — распознавание документов в 1С.
  • Удостоверяющие документы: паспорта, СНИЛС, ИНН, водительские удостоверения.
  • Договоры и юридические документы: реквизиты, суммы, сроки, стороны.
  • Анкеты, заявления и формы — в том числе с рукописным заполнением.
  • Таблицы и реестры — извлечение в структурированный вид, а не «простыня текста».
  • Чеки и квитанции — для расходов, авансовых отчетов и программ лояльности.

Точность — честно

На чистых печатных полях типовая точность — 95–99%. На рукописи, слабых сканах и нестандартных бланках она ниже, и мы говорим об этом прямо. Поэтому первый этап — пилот на ваших реальных документах: измеряем точность по каждому полю, считаем, сколько ручного ввода реально уходит, и только потом масштабируем.

On-prem и 152-ФЗ

Документы — это почти всегда персональные данные и коммерческая тайна. Поэтому систему разворачиваем on-prem, в вашем контуре: ни один скан и ни одно распознанное поле не уходит во внешние облачные сервисы. Это снимает риски по 152-ФЗ и банковской тайне — в отличие от облачных OCR-сервисов.

Если задача шире распознавания документов — детекция и трекинг объектов в видео — это компьютерное зрение. Если поверх распознанных документов нужен поиск и ответы по смыслу — смотрите LLM и RAG-ассистенты on-prem. Прикинуть бюджет можно в калькуляторе стоимости.

Что на выходе
  • Распознавание документов: счета, накладные, паспорта, договоры
  • Извлечение данных по полям: реквизиты, суммы, даты, таблицы
  • Обучение модели на ваших бланках и реальном качестве сканов
  • Проверка по правилам и выгрузка в 1С / ERP / CRM
  • Установка on-prem: система работает внутри вашей ИТ-инфраструктуры, без внешних сервисов
  • OCR
  • распознавание документов
  • извлечение данных
  • on-prem
пилот от
500 000
входной этап, не весь проект
пилот 4–6 недель
Кейс по направлению

Извлечение данных из грязных сканов для бэк-офиса

71%сканов в учетную систему без оператора
Смотреть кейс
сколько стоит

Четыре уровня сложности — четыре вилки цены

01

Готовый модуль и обвязка

Паспорта, ИНН, типовые счета и формы, которые движок читает из коробки. Обучать нечего — работа в интеграции: забрать файлы, прогнать, разложить поля по местам в 1С, обработать сбои.

200 000 – 500 000 ₽
2–3 недели
02

Типовые формы

Структурированный PDF из ЭДО, единый шаблон, машинный текст. Счета и акты одного макета, полей немного, выгрузка в одну систему.

500 000 – 700 000 ₽
4–6 недель
03

Полуструктура

Сотни поставщиков, разные макеты, сканы среднего качества, таблицы и печати. Первичка «как в жизни» — сюда попадает большинство реальных задач, как бы ни хотелось верить в уровень выше.

700 000 – 1 500 000 ₽
1,5–3 месяца
04

Тяжелый случай

Рукопись, печати поверх текста, мятые и кривые сканы, чертежи, таблицы без линий, исторический архив под оцифровку и поиск.

от 1 500 000 ₽
от 3 месяцев

Двести тысяч — реальная цена, и вот за что. Паспорта, ИНН, типовые счета готовый движок читает из коробки, учить его нечему. Платите вы за обвязку: забрать файлы из почты и сетевой папки, прогнать, разложить поля по местам в 1С, поймать сбой и не потерять документ. Две-три недели — и оно работает. Если ваш случай такой, мы так и скажем. Продавать пилот за полмиллиона там, где хватает интеграции, невыгодно нам самим: вы поймете это на второй месяц и уйдете. Дороже становится тогда, когда документы уходят от идеала — свои бланки, печати поверх текста, сканы с убитого МФУ. Тут коробка садится: нужна разметка, дообучение и замер точности по каждому полю. Это уже пилот.

Посчитать вилку под свою задачу
как это работает

От задачи до результата — по шагам

01

Разметка

До запуска система учится на ваших документах. Собираем 300–1000 реальных сканов из вашего потока и вручную размечаем поля: где ИНН, где сумма, где дата. Без этой работы модель знает средние документы мира и не знает ваших бланков, печатей и качества съемки.

02

Вход

Документ попадает в систему любым способом: загрузка файла, скан с МФУ, фото с телефона, e-mail или API.

03

Подготовка изображения

Выравниваем перекос, чистим шум и определяем тип документа: счет это, акт или паспорт.

04

Распознавание (OCR)

Система снимает текст с документа. Модель обучена на ваших шрифтах, печатях и качестве съемки — за счет этого держит точность.

05

Извлечение и проверка

Из текста достаем поля — ИНН, сумму, дату, номер — и проверяем каждое по правилам: контрольные суммы, форматы дат, сверка итогов.

06

Выгрузка

Проверенные данные уходят в 1С, ERP, CRM или вашу базу, сомнительные — оператору на подтверждение.

07

Приемка и контроль качества

Точность замеряем на отложенной выборке ваших документов, которую модель не видела при обучении. Порог по каждому полю записан в договор до старта, сдача идет по этой таблице. После запуска следим за долей ручной доверки: выросла — значит в поток пришел новый тип документа и модель пора дообучить.

сценарии

Где это дает результат

Финансовые документы

Счета, акты и спецификации из почты: распознаем, сверяем с оплатами и договорами, передаем в вашу систему. Поток учетных документов в 1С — отдельное направление со своей страницей.

Удостоверяющие документы

Паспорта, СНИЛС, ИНН, водительские удостоверения: реквизиты сразу уходят в заявки, анкеты и проверку клиентов (KYC).

Договоры

Из договоров вытаскиваем реквизиты, суммы, сроки и стороны — и заносим в CRM и реестры.

Логистика и склад

Накладные, ТОРГ-12 и транспортные документы: данные попадают в систему еще до приемки товара.

Банки и страхование

Поток клиентских документов и заявлений обрабатывается у вас: персональные данные не передаются наружу.

Анкеты и формы

Бумажные анкеты и заявления, в том числе заполненные от руки: оцифровка и занос в базу.

Оцифровка архива

Дела, папки и коробки за прошлые годы: распознаем, раскладываем по полям и собираем поисковый индекс. Дальше документ находится по номеру, дате, контрагенту или фразе из текста за секунды, а не за полдня в подвале.

FAQ

Частые вопросы по направлению

Сколько стоит разработка OCR-системы?
Зависит от того, насколько ваши документы далеки от идеала. Паспорта, ИНН и типовые счета готовый движок читает из коробки — тогда это интеграция от 200 000 ₽ за 2–3 недели. Свои бланки, печати поверх текста и сканы среднего качества требуют разметки и дообучения — это пилот от 500 000 ₽ за 4–6 недель. Рукопись, чертежи и архивы — от 1 500 000 ₽.
Можно ли сделать дешевле 500 000 ₽?
Да, если задача того стоит. Когда ваши документы уже умеет читать готовый движок, обучать нечего и платите вы только за обвязку: забрать файлы из почты и сетевой папки, прогнать, разложить поля по местам в 1С, поймать сбой и не потерять документ. Это от 200 000 ₽ и две-три недели. Мы скажем прямо, если ваш случай именно такой: продавать пилот за полмиллиона там, где хватает интеграции, невыгодно нам самим.
Сколько времени занимает проект?
Интеграция готового модуля — две-три недели. Пилот с разметкой и дообучением — четыре-шесть недель до первых честных цифр по точности. Промышленное внедрение с несколькими типами документов и интеграциями — от полутора до трех месяцев. Главный источник задержек обычно снаружи: пока мы ждем выгрузку документов и доступ к тестовому контуру 1С, часы идут.
Что подготовить до старта?
Три вещи, на них уходит вечер. Первое — 200 документов из реального потока, включая те, на которых спотыкаетесь вы сами. Второе — список полей для извлечения с пометкой, где ошибка стоит денег, а где терпимо. Третье — куда уходит результат: 1С, ERP, СЭД и в каком виде. Техническое задание, метрики приемки и ограничения соберем на первом созвоне сами.
Сколько наших документов нужно, чтобы обучить систему?
От 300 до 1000 на каждый тип — реальных, из вашего потока, вместе с мятыми сканами и бланками, которые вы сами читаете с трудом. Эталонные образцы для обучения бесполезны: модель выучит идеал и сядет на первой же накладной с печатью поверх суммы. Размечаем мы. От вас нужна выгрузка и полчаса на созвон, где вы объясните, какие поля важны и что с ними происходит дальше.
Как проверяете точность перед приемкой?
На отложенной выборке ваших документов, которую модель не видела при обучении. По каждому полю считаем долю верных извлечений и сравниваем с порогом, записанным в договор до начала работ. Отчет по полям отдаем на руки: видно, где система уверена и где документ уйдет оператору. Приемка идет по этой таблице — общее впечатление к делу не подошьешь.
Чем это лучше готового OCR — Tesseract или облачных API?
Готовый движок никто не настраивал под ваши бланки и печати — отсюда ошибки. Мы обучаем модель на ваших документах, ставим ее у вас и подтверждаем точность на реальном потоке.
Распознаете рукописный текст и плохие сканы?
Да, в разумных пределах. Печатные поля — стабильно 95–99%, рукопись и слабые сканы дают меньше: результат зависит от качества исходника. На пилоте видно, какие поля система вытягивает сама, а какие лучше отдать оператору.
Можно ли заказать это на фриланс-бирже?
Разово оцифровать пачку документов — да, нормальный выбор. Поставить в процесс — нет, и квалификация исполнителя тут ни при чем. За тридцать тысяч делают скрипт поверх чужого облачного API: без обработки сбоев, без защиты от повторной обработки, без интеграции, с вашими документами на чужом сервере. Когда он встанет в пятницу вечером, чинить будет некому.
Оцифруете бумажный архив?
Да, это отдельный сценарий и считается отдельно. Дела и коробки за прошлые годы распознаем, раскладываем по полям и собираем поисковый индекс: дальше документ находится по номеру, дате, контрагенту или фразе из текста. На цену влияет разнородность сильнее, чем объем — сто типов документов из девяностых дороже миллиона однотипных бланков.
Данные не уйдут в облако? Как с 152-ФЗ?
Нет. Система работает on-prem: внутри вашей сети, на вашем оборудовании. Наружу не уходит ничего — ни сканы, ни распознанные поля. Требования 152-ФЗ и банковской тайны это закрывает.
Интегрируете с 1С, ERP и CRM?
Да. Проверенные данные выгружаем в ERP, CRM или напрямую в вашу базу — через API, обмен файлами или коннектор под вашу конфигурацию. Если задача именно в учетном потоке — накладные, УПД и счета в 1С, — смотрите отдельное направление «Распознавание документов в 1С»: там разобрано сопоставление с номенклатурой и работа с формами поставщиков.
Что если документ распознан с ошибкой?
Каждое поле получает оценку уверенности. Если система сомневается, документ уходит оператору: тот проверяет и подтверждает данные на одном экране. Молча ошибка в учетную систему не запишется.
гарантии

«Сольем бюджет, а оно не взлетит» 

Страх обоснованный: на ИИ-проектах сгорело много денег. Пять правил ниже устроены так, чтобы вы видели результат раньше, чем платите крупно.

01

Начинаем с пилота

Первый этап — недорогая проверка на ваших данных и оборудовании. Масштабируем только то, что показало результат.

02

Не решается — скажем до старта

Оцениваем достижимую точность до подписания сметы. Если метод задачу не вытянет, вы узнаете это на бесплатном разборе.

03

Цена и объем зафиксированы на этап

Никаких «вышло дороже»: этап — это согласованные заранее смета и результат. Платите по факту принятого этапа.

04

Код и права — ваши

После оплаты этапа исключительные права на код и модели переходят вам. Это пункт оферты.

05

NDA и данные под контролем

NDA подписываем до обсуждения деталей. Видео и документы обрабатываются на вашем оборудовании, данные не уходят на сторону — требования 152-ФЗ закрыты.

Другие направления
— заявка

Опишите задачу  ответим как инженеры. 

Оставьте имя и Telegram — остальное обсудим. Без брифов на 40 слайдов и звонков по три раза.

Отвечаем за пару часовотвечает инженер, а не отдел продажNDA по запросу

Любой один канал — куда удобнее, туда и ответим

Или сразу написать в Telegram

Без спама и звонков-роботов. Нажимая кнопку, вы соглашаетесь с политикой конфиденциальности и обработкой персональных данных.