Задача 01 / Первичные документы
Извлечение реквизитов из УПД, счетов и накладных
Коротко
Получить номер, дату, стороны и суммы в проверяемом виде, чтобы не вводить их повторно вручную.
Это направления для проверки. Modelium не запускал эти модели. Публичные показатели на других наборах не подтверждают качество на ваших документах.
Сначала определите вход
| Что у вас есть | Первое действие |
|---|---|
| Структурированные поля | Проверить прямой разбор и соответствие схеме. AI может не понадобиться. |
| PDF с текстовым слоем | Проверить полноту и порядок текста, затем исследовать извлечение полей. |
| Готовый текст | Сравнивать извлечение отдельно от ошибок распознавания. |
| Скан или фотография | Изучать OCR с извлекателем либо визуально-языковую модель. |
| Многостраничный документ | Сохранять связь страниц, проверять дубли и противоречия. |
Что должно быть в результате
Рабочая схема: тип, номер и дата документа; продавец и покупатель с названиями и ИНН; валюта, сумма без НДС, НДС и итог — если они указаны в исходнике. Обязательность полей задаётся отдельно для каждого типа документа.
Сохраняйте исходное значение, нормализованный вариант и место в документе, когда его можно установить. «Поля нет», «не удалось прочитать» и «есть противоречие» — разные состояния. Отсутствие суммы нельзя автоматически превращать в ноль.
Три подхода к моделям
| Подход | Кандидаты | Что ещё требуется |
|---|---|---|
| Изображение → поля | Qwen2.5-VL 7B | Схема ответа, контроль неподтверждённых значений, связи страниц и проверка реквизитов. |
| OCR → текст → поля | Кириллический PP-OCRv5 | Детектор строк, порядок чтения и отдельный текстовый извлекатель. Одна эта модель не читает целый документ. |
| Разбор страницы → поля | PaddleOCR-VL 1.6 + PP-DocLayoutV3 | Сборка документа и извлечение бизнес-полей. Разметка страницы сама по себе не является готовой схемой реквизитов. |
Как измерять результат
Измеряйте правильность обязательных полей, перепутанные стороны, пропуски, выдуманные значения и долю полностью правильных документов. Отдельно учитывайте время ручной проверки. Порог приёмки зависит от процесса; универсального подтверждённого «95%» здесь нет.
DocVQA оценивает ответы на вопросы о документах. Его показатель нельзя приравнивать к доле корректно извлечённых ИНН или сумм российских УПД. Текстовые синтетические счета также не проверяют чтение сканов.
Когда достаточно готового сервиса
Сначала сопоставьте требования с 1С:Распознавание первичных документов и Saby. Поставщики описывают распознавание и работу в учётной системе. Это более широкий процесс, чем отдельная модель.
Собственный подбор имеет смысл исследовать, если осталось конкретное требование: своя схема полей, особые документы или ограничения размещения. Сравнивайте подключение, эксплуатацию, проверку и исправления за один период, а не только цену страницы. Экономия от собственного подхода заранее не установлена.
До внедрения остаётся выяснить
- Состав и объём документов, обязательные поля и допустимую ручную проверку.
- Условия обработки данных и размещения всего процесса.
- Совместимость компонентов, лицензии и ресурсы на ваших размерах страниц.
- Качество на отложенных примерах, которые не использовались для настройки.
Интеграция с 1С и сопоставление контрагентов со справочником — отдельные последующие задачи.
Источники
- 1С:Распознавание первичных документов. Получено 15.09.2026.
- Saby. Получено 15.09.2026.