ИИДля
← Назад
Гайд / DOCS · 20.09.2026 · 05:27

ИИ для таблиц из сканов: проверяем DeepSeek-OCR-2 на архиве документов

Практический маршрут от отбора страниц до сверки строк и сохранения связи с оригиналом.

Антон ЛевинРедактор инструментов и кода
Редакционная иллюстрация к материалу «ИИ для таблиц из сканов: проверяем DeepSeek-OCR-2 на архиве документов»
Авторская иллюстрация редакции «ИИ Для»
Суть задачи

Не распознавайте весь архив сразу

Сначала выберите один вид документа и пять обязательных полей. Архив кажется однородным только до первой проверки: в нём встречаются повороты, тени, печати и страницы без таблиц. Для накладной важны позиция, количество, цена и сумма; декоративные заголовки не должны улучшать метрику. Запишите формат результата и критическую ошибку. Если неверная сумма опаснее пропущенного примечания, проверка обязана это отражать.

Что подготовить

Соберите честный набор

Возьмите 30 страниц: цифровой PDF, плохой скан, фотографию, многострочную ячейку, разрыв таблицы и пустое обязательное поле. Подготовьте ручной эталон с номером страницы для каждой строки. Когда два человека читают символ по-разному, пометьте его спорным. Модель не должна изображать точность там, где её нет в источнике. Архивные формы храните отдельной группой, чтобы понимать, на каких шаблонах качество падает.

Рабочий маршрут

Подготовьте рабочую копию

Оригинал оставьте неизменным. Копию можно выровнять, обрезать и привести к стабильному разрешению, но каждую операцию нужно записать. Сильный контраст иногда удаляет тонкую запятую или часть цифры. Если в PDF уже есть текстовый слой, сравните его с визуальным OCR, а не принимайте за истину. У рабочего файла сохраняются имя оригинала, страница и контрольная сумма.

Контроль качества

Запустите DeepSeek-OCR-2

Модель получает страницу и строгую схему ответа. Попросите оставлять неразборчивое пустым и не додумывать значение по соседним строкам. Сохраните сырой вывод до нормализации. Поддержка DeepSeek-OCR-2 в OpenVINO GenAI 2026.4 облегчает локальный тест, но не гарантирует точность на русских формах. Запишите checkpoint, runtime, оборудование и параметры. Другой сотрудник должен иметь возможность повторить прогон.

Пример

Проверяйте структуру, затем цифры

Сначала сверяйте число строк, заголовки и порядок колонок. Затем проверяйте обязательные ячейки и арифметику. Частая ошибка выглядит правдоподобно: все цифры распознаны, но одна строка съехала в соседний столбец. Формула помогает обнаружить расхождение, но не исправляет его без оригинала. Исходное значение, нормализованное значение и решение проверяющего сохраняются раздельно.

Границы метода

Не смешивайте распознавание и обогащение

Сопоставление со справочником, исправление названия и присвоение категории — отдельный этап. Если всё сделать сразу, известное название товара может скрыть ошибку OCR. Сначала зафиксируйте, что видно на странице; затем правила или другая модель предлагают соответствие. У каждой замены должна быть причина. Так можно отличить ошибку скана от ошибки распознавания и от неверного справочника.

После запуска

Создайте очередь сомнений

На ручную проверку отправляются страницы с нарушенной схемой, несовпавшей суммой, новым шаблоном, обязательным пустым полем или низкой читаемостью. Проверяющий видит нужную область рядом с ячейкой, а не ищет её во всём файле. Исправление не перезаписывает сырой ответ. После пилота сгруппируйте причины возврата: иногда полезнее настроить сканер или форму, чем менять модель.

Внедрение

Проверьте невидимые страницы

Отложите десять документов до конца настройки. Прогоните их без добавления новых исключений. Если качество резко падает, процесс подстроен под небольшой корпус. Новый шаблон формы оформляйте отдельной категорией, а не исправляйте единичным промптом. Повторите измерение после квантования и обновления runtime. Так команда узнает не лучший результат на знакомом наборе, а реальный диапазон качества на будущем потоке.

Первый день

Передайте процесс коллеге

Другой человек получает инструкцию, рабочее окружение и пять страниц. Он должен повторить результат и восстановить каждую правку по журналу. Любое объяснение, которое существует только устно, добавляется в документ. Проведите учебный отказ на копии: неподдерживаемый файл должен попасть в понятную очередь, а не исчезнуть. Если результат нельзя воспроизвести без автора, архив пока нельзя обрабатывать массово.

Вывод

Метрика и FAQ

Считайте точность критичных ячеек, долю полностью принятых страниц, время проверки и тяжёлые ошибки. **Можно сразу обработать весь архив?** Нет, сначала подтвердите качество на каждом заметном шаблоне. **Локальный запуск обязателен?** Нет, но он бывает полезен для чувствительных документов и стабильного потока. **Что считать готовностью?** Другой человек повторяет обработку, каждая итоговая строка ведёт к оригиналу, а сомнение не маскируется созданной моделью цифрой. Запишите дату проверки и владельца корпуса. При смене сканера, формы, модели или квантования контрольные страницы прогоняются снова, а прежний отчёт сохраняется для сравнения.

Перед использованием

Короткая проверка

  • Выбран один вид документа
  • Есть эталон и трудные страницы
  • Сырой OCR сохранён
  • Критичные ячейки ведут к оригиналу
  • Исправления попадают в журнал
Продолжить тему

Другие материалы этого направления