Задача 01 / Первичные документы

Извлечение реквизитов из УПД, счетов и накладных

Обновлено 15.09.2026

Коротко

Получить номер, дату, стороны и суммы в проверяемом виде, чтобы не вводить их повторно вручную.

Это направления для проверки. Modelium не запускал эти модели. Публичные показатели на других наборах не подтверждают качество на ваших документах.

Сначала определите вход

Что у вас естьПервое действие
Структурированные поляПроверить прямой разбор и соответствие схеме. AI может не понадобиться.
PDF с текстовым слоемПроверить полноту и порядок текста, затем исследовать извлечение полей.
Готовый текстСравнивать извлечение отдельно от ошибок распознавания.
Скан или фотографияИзучать OCR с извлекателем либо визуально-языковую модель.
Многостраничный документСохранять связь страниц, проверять дубли и противоречия.

Что должно быть в результате

Рабочая схема: тип, номер и дата документа; продавец и покупатель с названиями и ИНН; валюта, сумма без НДС, НДС и итог — если они указаны в исходнике. Обязательность полей задаётся отдельно для каждого типа документа.

Сохраняйте исходное значение, нормализованный вариант и место в документе, когда его можно установить. «Поля нет», «не удалось прочитать» и «есть противоречие» — разные состояния. Отсутствие суммы нельзя автоматически превращать в ноль.

Три подхода к моделям

ПодходКандидатыЧто ещё требуется
Изображение → поляQwen2.5-VL 7BСхема ответа, контроль неподтверждённых значений, связи страниц и проверка реквизитов.
OCR → текст → поляКириллический PP-OCRv5Детектор строк, порядок чтения и отдельный текстовый извлекатель. Одна эта модель не читает целый документ.
Разбор страницы → поляPaddleOCR-VL 1.6 + PP-DocLayoutV3Сборка документа и извлечение бизнес-полей. Разметка страницы сама по себе не является готовой схемой реквизитов.

Как измерять результат

Измеряйте правильность обязательных полей, перепутанные стороны, пропуски, выдуманные значения и долю полностью правильных документов. Отдельно учитывайте время ручной проверки. Порог приёмки зависит от процесса; универсального подтверждённого «95%» здесь нет.

DocVQA оценивает ответы на вопросы о документах. Его показатель нельзя приравнивать к доле корректно извлечённых ИНН или сумм российских УПД. Текстовые синтетические счета также не проверяют чтение сканов.

Когда достаточно готового сервиса

Сначала сопоставьте требования с 1С:Распознавание первичных документов и Saby. Поставщики описывают распознавание и работу в учётной системе. Это более широкий процесс, чем отдельная модель.

Собственный подбор имеет смысл исследовать, если осталось конкретное требование: своя схема полей, особые документы или ограничения размещения. Сравнивайте подключение, эксплуатацию, проверку и исправления за один период, а не только цену страницы. Экономия от собственного подхода заранее не установлена.

До внедрения остаётся выяснить

  • Состав и объём документов, обязательные поля и допустимую ручную проверку.
  • Условия обработки данных и размещения всего процесса.
  • Совместимость компонентов, лицензии и ресурсы на ваших размерах страниц.
  • Качество на отложенных примерах, которые не использовались для настройки.

Интеграция с 1С и сопоставление контрагентов со справочником — отдельные последующие задачи.

Источники

  1. 1С:Распознавание первичных документов. Получено 15.09.2026.
  2. Saby. Получено 15.09.2026.