Разбор входящих документов - редкий случай, когда автоматизация окупается почти всегда. Причина в том, что задача идеально подходит под сильные стороны моделей: операция повторяется десятки раз в день, структура предсказуема, а ошибка не смертельна, потому что результат всё равно проверяет человек.

Но у этой темы есть слой, о котором не пишут в рекламных материалах. Разбираю, где автоматика надёжна, а где стабильно спотыкается.

Что происходит с документом

Схема одинаковая, меняются детали.

Файл попадает в систему - почтой, из чата, из папки. Модель определяет тип: счёт, накладная, договор, чек, резюме. Дальше извлекает поля, которые вам нужны: суммы, даты, реквизиты сторон, номера, позиции.

Дальше самое важное и самое скучное - нормализация. Даты приводятся к одному формату, суммы очищаются от пробелов и валютных знаков, названия компаний сверяются со справочником. Без этого шага вы получаете кашу, которую всё равно правят руками.

Готовые данные уезжают в учётную систему или таблицу. Человек видит уже заполненную карточку и либо подтверждает, либо правит одно поле.

Где это работает надёжно

Типовые печатные документы. Счета, накладные, акты, договоры по шаблону. Структура повторяется, модель её усваивает.

Хорошие сканы и PDF. Электронный документ, выгруженный из системы, читается почти без ошибок - там текст лежит слоем, его не нужно распознавать по картинке.

Извлечение конкретных полей. «Найди ИНН, сумму и дату» работает заметно лучше, чем «перескажи документ». Чем конкретнее задача, тем меньше выдумок.

Сортировка потока. Даже без глубокого разбора модель уверенно раскладывает входящие по типам и направляет в нужный процесс.

Где ломается стабильно

Пять мест, на которых спотыкаются почти все проекты.

Плохая физика документа. Смятая бумага, выцветшая термолента, блик от вспышки, фотография под углом. Никакая модель не прочитает то, чего не видно.

Рукописный текст. Печатный - да, рукописный - лотерея. Планировать на нём процесс нельзя.

Многостраничные файлы. Классическая ловушка: обработчик читает первую страницу, а нужные реквизиты лежат на последней. Документ уходит в ручную очередь как нераспознанный, хотя с ним всё в порядке.

Сложные таблицы. Объединённые ячейки, вложенные заголовки, переносы строк внутри позиции. Здесь ошибки появляются тихо: цифра встала не в ту колонку, и это заметят через месяц в отчёте.

Нестандартные формы. Каждый контрагент верстает по-своему. Модель, обученная на ваших пяти шаблонах, на шестом начинает фантазировать.

Что делать с этим на практике

Работающая схема состоит из трёх уровней, и третий обязателен.

Сначала автоматическое распознавание - оно закрывает основную массу.

Дальше ручной ввод ключевых полей: человек вбивает номер и сумму, остальное система подтягивает сама. Это быстрее, чем заполнять карточку целиком.

И очередь на проверку: документы, где модель не уверена, уходят оператору. Не как признание поражения, а как штатный сценарий - именно он держит качество данных.

Отдельно про уверенность модели. Ответ «не знаю» должен быть предусмотрен явно, иначе на непонятном документе вы получите правдоподобные, но выдуманные цифры. Порог уверенности - самая полезная настройка во всей этой конструкции.

Хотите понять, ляжет ли ваш поток на автоматику - возьмите тридцать реальных документов и посмотрите, сколько из них типовые и печатные. Можете прислать эту статистику в Telegram @viktdo, скажу, какая доля закроется без человека.

Про персональные данные

Момент, который всплывает поздно и дорого. Договоры, резюме и счета содержат персональные данные, а отправка их в зарубежную модель без обезличивания нарушает требования 152-ФЗ.

Варианты стандартные: российские модели с серверами в РФ, обезличивание перед отправкой либо локальная модель на своём железе. Выбирать нужно до разработки, потому что от этого зависит вся архитектура.

Сколько стоит

Ориентиры по нашей практике на 2026 год.

Извлечение полей из одного типа документов с выгрузкой в таблицу - от 80 тысяч рублей и 1-2 недели.

Несколько типов, нормализация, интеграция с учётной системой - от 150 тысяч.

Полный контур с очередью модерации, ролями операторов и отчётностью - от 250 тысяч.

Расходы на модель - обычно единицы тысяч рублей в месяц: документы это не диалоги, объём токенов небольшой.

Когда не стоит браться

Меньше двадцати документов в день - ручная обработка дешевле разработки и поддержки.

Каждый документ уникален по структуре - модели не на чем учиться, будете править всё подряд.

Цена ошибки в данных высока и проверять некому. Автоматика без проверяющего в бухгалтерии или юридических документах создаёт риск дороже экономии.

Документы приходят в плохом качестве и повлиять на это нельзя. Тогда сначала решается вопрос источника, а не распознавания.

Разберём вашу ситуацию

Напишите в Telegram @viktdo - посмотрю ваш поток документов и скажу, какая доля обрабатывается автоматически, а что останется людям. Разбор бесплатный, обычно 15 минут.

Что делаем: интеграцию ИИ в процессы - извлечение данных из документов, сортировка входящих, выгрузка в учётные системы; чат-ботов, которые принимают документы прямо в переписке. Прикинуть бюджет можно в калькуляторе.

BotKraft - студия чат-ботов и автоматизации: 5 лет на рынке, больше 300 проектов.