Интеллектуальная обработка документов: распознавание и извлечение данных
Автоматизируем перенос данных из документов в учётные системы: счета, акты, накладные, договоры, анкеты, справки. Система распознаёт документ, извлекает нужные поля, проверяет их и передаёт в систему, а спорные случаи с низкой уверенностью отправляет человеку. Мы не обещаем стопроцентную автоматизацию — обещаем измеримое сокращение ручной работы с контролем над ошибками.
Коротко о задаче
Ручной перенос данных из документов — одна из самых дорогих и самых незаметных статей расходов. Незаметных, потому что она размазана по времени десятков людей и нигде не отражается отдельной строкой.
Бухгалтер вбивает реквизиты со счетов. Менеджер переносит данные из анкет в систему. Кадровик набирает сведения из документов кандидатов. Логист вводит номера накладных. Каждая операция занимает минуты, но повторяется сотни раз в месяц.
Сопутствующие проблемы предсказуемы. Опечатки, которые всплывают при сверке через квартал. Неравномерная нагрузка: в конце месяца поток удваивается, и сроки срывает не бухгалтерия, а физическая невозможность успеть. Задержка между поступлением документа и появлением данных в системе, из-за которой отчёт всегда отстаёт от реальности.
При этом попытки автоматизировать это раньше часто заканчивались разочарованием: старые системы распознавания требовали жёстких шаблонов и ломались на любом отклонении. Современные модели работают с документом, а не с координатами полей, и это меняет применимость.
Что входит в услугу
- Разбор потока документов
Собираем реальные экземпляры каждого типа, включая плохие: мятые сканы, фотографии с телефона, документы с рукописными пометками. Оцениваем, что реально извлекать, а что нет.
- Определение состава полей
Договариваемся, какие данные извлекаются, какие обязательны, какие проверяются по справочникам. Меньше полей — выше надёжность.
- Распознавание
Обработка сканов, фотографий и электронных файлов, включая многостраничные документы и пакеты, где несколько документов идут одним файлом.
- Извлечение данных
Определение типа документа и вытаскивание значений полей. Работаем с моделью в контуре заказчика, если документы содержат персональные или коммерческие сведения. Смотрите {{ссылка: Внедрение языковых моделей в контуре заказчика}}.
- Проверка результата
Форматная проверка, сверка со справочниками контрагентов и номенклатуры, арифметический контроль сумм, сопоставление с ожидаемыми значениями из системы.
- Порог уверенности и участие человека
По каждому полю система возвращает уверенность. Значения ниже порога попадают на подтверждение оператору с подсветкой места в документе. Порог настраивается: он определяет баланс между объёмом ручной работы и риском пропустить ошибку.
- Интеграция с учётными системами
Готовые данные уходят в вашу систему автоматически, с привязкой к исходному файлу документа. Смотрите {{ссылка: Интеграция систем и разработка API}}.
- Измерение точности
Замеряем долю полей, извлечённых верно, и долю документов, прошедших без вмешательства. Эти два показателя — предмет договорённости и контроля, а не обещаний.
- Журналирование
Каждая обработка фиксируется: исходный документ, извлечённые значения, уверенность, кто и что исправил. Смотрите {{ссылка: Журналирование, мониторинг и разбор инцидентов}}.
Что это даёт заказчику
- Сокращение ручного ввода. Основная часть документов проходит без участия человека.
- Ошибки под контролем. Спорные случаи попадают на проверку, а не в базу.
- Пиковая нагрузка перестаёт быть проблемой. Конец месяца обрабатывается тем же составом.
- Данные появляются сразу. Отчёт перестаёт отставать от документооборота.
- Прослеживаемость. Видно, из какого документа взято значение и кто его правил.
- Документы не уходят наружу. Обработка идёт внутри вашего контура.
Как мы работаем
Начинаем с пилота на реальном потоке за месяц. Он даёт фактические показатели точности по каждому типу документа, и уже по ним считается эффект.
Стопроцентной автоматизации не обещаем. Работающая схема выглядит иначе: основная масса проходит автоматически, спорное уходит человеку, доля ручной работы измеряется и постепенно снижается.
Начинать советуем с одного самого массового типа документа. Автоматизировать сразу всё — верный способ получить систему, которая нигде не работает хорошо.
Наш опыт
Мы разработали систему, которая обрабатывает поток внешних публикаций: извлекает полный текст материала, а затем размечает его языковой моделью по содержательным категориям. Отдельная подсистема отвечает за получение текста, с несколькими поставщиками данных и запасным механизмом на случай, когда основной не справился. Такой запас необходим в любой обработке документов: часть источников всегда оказывается неудобной.
Модель в этой системе развёрнута локально, а по каждому материалу возвращает вердикт, уверенность и фрагмент, на котором построен вывод. Тот же подход мы применяем к документам: сотрудник видит не просто извлечённое значение, а место в документе, откуда оно взято.
Расскажите, какие документы и в каком объёме обрабатываются вручную. Начнём с разбора потока и пилота.
Давайте создавать вместе!
Свяжитесь с нами и мы проконсультируем по вопросам реализации IT-решений и найдем лучший подход к разработке
Контакты
Офис: г. Казань, ул. Островского, 57Б, оф. 110
Почта: info@nabla-lab.ru
Телефон: +7 (965) 595-62-78