Интеллектуальная обработка документов: распознавание и извлечение данных

Автоматизируем перенос данных из документов в учётные системы: счета, акты, накладные, договоры, анкеты, справки. Система распознаёт документ, извлекает нужные поля, проверяет их и передаёт в систему, а спорные случаи с низкой уверенностью отправляет человеку. Мы не обещаем стопроцентную автоматизацию — обещаем измеримое сокращение ручной работы с контролем над ошибками.

Коротко о задаче

Ручной перенос данных из документов — одна из самых дорогих и самых незаметных статей расходов. Незаметных, потому что она размазана по времени десятков людей и нигде не отражается отдельной строкой.

Бухгалтер вбивает реквизиты со счетов. Менеджер переносит данные из анкет в систему. Кадровик набирает сведения из документов кандидатов. Логист вводит номера накладных. Каждая операция занимает минуты, но повторяется сотни раз в месяц.

Сопутствующие проблемы предсказуемы. Опечатки, которые всплывают при сверке через квартал. Неравномерная нагрузка: в конце месяца поток удваивается, и сроки срывает не бухгалтерия, а физическая невозможность успеть. Задержка между поступлением документа и появлением данных в системе, из-за которой отчёт всегда отстаёт от реальности.

При этом попытки автоматизировать это раньше часто заканчивались разочарованием: старые системы распознавания требовали жёстких шаблонов и ломались на любом отклонении. Современные модели работают с документом, а не с координатами полей, и это меняет применимость.

Что входит в услугу

  • Разбор потока документов

Собираем реальные экземпляры каждого типа, включая плохие: мятые сканы, фотографии с телефона, документы с рукописными пометками. Оцениваем, что реально извлекать, а что нет.

  • Определение состава полей

Договариваемся, какие данные извлекаются, какие обязательны, какие проверяются по справочникам. Меньше полей — выше надёжность.

  • Распознавание

Обработка сканов, фотографий и электронных файлов, включая многостраничные документы и пакеты, где несколько документов идут одним файлом.

  • Извлечение данных

Определение типа документа и вытаскивание значений полей. Работаем с моделью в контуре заказчика, если документы содержат персональные или коммерческие сведения. Смотрите {{ссылка: Внедрение языковых моделей в контуре заказчика}}.

  • Проверка результата

Форматная проверка, сверка со справочниками контрагентов и номенклатуры, арифметический контроль сумм, сопоставление с ожидаемыми значениями из системы.

  • Порог уверенности и участие человека

По каждому полю система возвращает уверенность. Значения ниже порога попадают на подтверждение оператору с подсветкой места в документе. Порог настраивается: он определяет баланс между объёмом ручной работы и риском пропустить ошибку.

  • Интеграция с учётными системами

Готовые данные уходят в вашу систему автоматически, с привязкой к исходному файлу документа. Смотрите {{ссылка: Интеграция систем и разработка API}}.

  • Измерение точности

Замеряем долю полей, извлечённых верно, и долю документов, прошедших без вмешательства. Эти два показателя — предмет договорённости и контроля, а не обещаний.

  • Журналирование

Каждая обработка фиксируется: исходный документ, извлечённые значения, уверенность, кто и что исправил. Смотрите {{ссылка: Журналирование, мониторинг и разбор инцидентов}}.

Что это даёт заказчику

  • Сокращение ручного ввода. Основная часть документов проходит без участия человека.
  • Ошибки под контролем. Спорные случаи попадают на проверку, а не в базу.
  • Пиковая нагрузка перестаёт быть проблемой. Конец месяца обрабатывается тем же составом.
  • Данные появляются сразу. Отчёт перестаёт отставать от документооборота.
  • Прослеживаемость. Видно, из какого документа взято значение и кто его правил.
  • Документы не уходят наружу. Обработка идёт внутри вашего контура.

Как мы работаем

Начинаем с пилота на реальном потоке за месяц. Он даёт фактические показатели точности по каждому типу документа, и уже по ним считается эффект.

Стопроцентной автоматизации не обещаем. Работающая схема выглядит иначе: основная масса проходит автоматически, спорное уходит человеку, доля ручной работы измеряется и постепенно снижается.

Начинать советуем с одного самого массового типа документа. Автоматизировать сразу всё — верный способ получить систему, которая нигде не работает хорошо.

Наш опыт

Мы разработали систему, которая обрабатывает поток внешних публикаций: извлекает полный текст материала, а затем размечает его языковой моделью по содержательным категориям. Отдельная подсистема отвечает за получение текста, с несколькими поставщиками данных и запасным механизмом на случай, когда основной не справился. Такой запас необходим в любой обработке документов: часть источников всегда оказывается неудобной.

Модель в этой системе развёрнута локально, а по каждому материалу возвращает вердикт, уверенность и фрагмент, на котором построен вывод. Тот же подход мы применяем к документам: сотрудник видит не просто извлечённое значение, а место в документе, откуда оно взято.

Расскажите, какие документы и в каком объёме обрабатываются вручную. Начнём с разбора потока и пилота.

Давайте создавать вместе!

Свяжитесь с нами и мы проконсультируем по вопросам реализации IT-решений и найдем лучший подход к разработке

Контакты

Офис: г. Казань, ул. Островского, 57Б, оф. 110
Почта: info@nabla-lab.ru
Телефон: +7 (965) 595-62-78