Перейти к содержанию
Публикация AiManual

Docmatix: как крупный датасет для DocVQA может повлиять на качество open-source VLM

Разбираем, что такое Docmatix и DocVQA, как PDF превращается в пары «вопрос-ответ» и почему большой synthetic dataset может помочь open-source VLM. Пошагово оце

Коротко

Что будет в материале

  1. 01

    Docmatix: коротко о главном - почему этот датасет важен для DocVQA

  2. 02

    Как устроен Docmatix: от PDF до обучающей пары вопрос-ответ

  3. 03

    Почему масштаб Docmatix может повлиять на fine-tuning VLM

  4. 04

    Где Docmatix полезен разработчикам и исследователям

Docmatix интересен как крупный набор примеров для Document Visual Question Answering, или DocVQA. Такие данные связывают изображение документа, вопрос и ответ, поэтому open-source VLM получает материал для обучения работе с текстом, структурой страницы и визуальным контекстом одновременно.

Большой объём сам по себе не гарантирует скачка качества. Результат fine-tuning зависит от разнообразия документов, точности ответов, баланса типов вопросов и того, насколько обучающая выборка похожа на реальные задачи. Для Docmatix особенно важны сведения о составе корпуса, способе генерации synthetic data и правилах фильтрации. Без первичного технического описания нельзя честно называть точный размер датасета, прирост метрик или конкретную модель-генератор.

Ниже разобраны различия между DocVQA и обычным VQA, типовой путь от PDF до пары «вопрос-ответ», влияние масштаба на document understanding, практические сценарии и ограничения синтетической разметки.

Docmatix: коротко о главном - почему этот датасет важен для DocVQA

Обычная VLM может распознавать объекты на изображении и отвечать на вопросы о сцене. Для документа этого недостаточно. Модель должна прочитать мелкий текст, определить положение блоков, сопоставить строку таблицы с нужным столбцом, учесть заголовок и иногда собрать ответ из нескольких частей страницы.

Docmatix потенциально расширяет количество таких учебных ситуаций. Если примеры отличаются по верстке, языку, плотности текста и сложности вопросов, fine-tuning получает более широкое покрытие document visual question answering. Если страницы и формулировки повторяются, большой счётчик примеров даст гораздо меньший эффект.

Что такое DocVQA и чем он отличается от обычного VQA

VQA, Visual Question Answering, проверяет способность модели ответить на вопрос по изображению. В типичном примере нужно определить цвет предмета, количество объектов или действие человека. Документное VQA добавляет слой распознавания и пространственного анализа.

В DocVQA вопрос может требовать:

  • найти итоговую сумму в счёте;
  • определить дату подписания договора;
  • сопоставить название позиции со значением в соседнем столбце;
  • сравнить два показателя в таблице;
  • найти заголовок, к которому относится абзац;
  • объединить сведения с нескольких страниц;
  • выбрать нужный фрагмент среди похожих полей формы.

Ответ зависит от нескольких уровней обработки. OCR должен правильно прочитать символы. Document parsing должен восстановить блоки, таблицы, координаты и порядок чтения. Document reasoning должен понять вопрос и выбрать связанные фрагменты. Ошибка на любом уровне может привести к неверному ответу, даже если остальные этапы сработали корректно.

Почему документные данные нужны open-source VLM

Мелкий шрифт, две колонки, вложенные таблицы, формулы и нестандартный порядок чтения создают для VLM отдельные трудности. Общая визуальная подготовка модели не гарантирует точного чтения страницы с высокой плотностью информации.

Здесь полезно разделять три задачи:

  • OCR извлекает текст из изображения;
  • document parsing восстанавливает структуру, координаты, таблицы и порядок чтения;
  • document reasoning связывает вопрос с фрагментами документа и формирует ответ.

Специализированные OCR-модели вроде PaddleOCR-VL-1.6, MinerU2.5-Pro и GLM-OCR ориентированы на text recognition, document parsing, извлечение таблиц, распознавание формул, layout analysis и reading-order detection. В доступном сравнении на OmniDocBench v1.6 они показывают более сильные результаты в задачах, связанных с разбором документов, чем general-purpose VLM, включая Qwen3-VL-235B.

Это сравнение нельзя превращать в универсальный рейтинг. Qwen3-VL-235B рассчитана на широкий visual reasoning и может быть удобнее там, где от модели требуется объяснение, свободный ответ или работа с разными визуальными типами. Специализированная OCR-модель часто практичнее для массового parsing, когда важны скорость, память и стабильный структурированный вывод. Подробное сравнение подходов к документному OCR собрано в статье об открытых моделях OCR.

Как устроен Docmatix: от PDF до обучающей пары вопрос-ответ

Пайплайн document QA обычно состоит из нескольких последовательных операций: выбор документов, подготовка визуального представления, создание вопросов и ответов, фильтрация, дедупликация и упаковка данных для обучения. Для конкретного Docmatix точные модели, пропорции и пороги проверки нужно сверять с первичным описанием датасета. Ниже приведена техническая схема и указаны места, где часто появляются ошибки.

Источники документов и разнообразие форматов

Состав исходного корпуса определяет диапазон навыков, который получает модель. В такой выборке могут встречаться деловые формы, счета, отчёты, статьи, многостраничные PDF, таблицы и страницы со смешанными текстовыми и графическими элементами. Эти категории нельзя автоматически приписывать Docmatix без подтверждённого описания.

При аудите датасета нужно проверить:

  • какие языки и алфавиты представлены;
  • есть ли цифровые PDF и сканы;
  • каковы качество изображений и типичный размер текста;
  • сколько страниц приходится на один документ;
  • встречаются ли колонки, вложенные таблицы, графики, печати и рукописные пометки;
  • как распределены короткие формы и длинные отчёты;
  • не доминирует ли один шаблон страницы или один тип источника.

Разнообразие измеряется не количеством файлов. Две тысячи страниц одного шаблона могут дать модели меньше новых визуальных ситуаций, чем несколько сотен документов с разной версткой и структурой.

Перевод PDF в изображения страниц

Мультимодальная модель обычно получает страницу как изображение. PDF растеризуют с заданным разрешением, сохраняют порядок страниц и связывают каждый визуальный файл с исходным документом и метаданными. При подготовке важно не потерять координаты текста, таблицы, иллюстрации и разрывы страниц.

На этом шаге появляются технические артефакты:

  • слишком мелкий шрифт после уменьшения изображения;
  • размытые символы при низком разрешении;
  • обрезанные поля и колонтитулы;
  • ошибки отображения шрифтов;
  • неверный порядок страниц;
  • различия между текстовым слоем PDF и тем, что фактически видит модель.

Разрешение приходится выбирать с учётом архитектуры VLM и ограничений контекста. Слишком маленькое изображение ухудшает OCR. Слишком большое повышает расход памяти и может привести к уменьшению или обрезке страницы уже внутри inference-пайплайна.

Генерация вопросов и ответов

После подготовки страницы генератор создаёт задания DocVQA. Полезно делить их по сложности и типу операции:

Тип вопросаЧто проверяетПример задачи
Извлечение фактаПоиск точного фрагментаНайти номер счёта или дату
Поиск в таблицеСвязь строки, столбца и значенияОпределить цену для конкретной позиции
СравнениеСопоставление нескольких элементовУказать, какой показатель выше
АгрегацияОбъединение сведенийСложить значения нескольких строк
Структурное пониманиеСвязь заголовка и блокаОпределить раздел, к которому относится текст
Reasoning по документуВывод на основе нескольких фрагментовСопоставить условие договора с указанным сроком

Хороший вопрос опирается на содержимое страницы и допускает проверяемый ответ. Для document QA ему обычно не нужны внешние знания. Если генератор задаёт вопрос, на который нельзя ответить по документу, или подменяет визуальный анализ догадкой по шаблону, пример снижает ценность обучения.

Какая модель генерировала вопросы Docmatix, применялись ли шаблоны и как авторы задавали уровень сложности, нельзя утверждать без первичного технического описания. Эти детали влияют на интерпретацию результатов сильнее, чем само название пайплайна.

Фильтрация и контроль качества synthetic data

Автоматическая генерация создаёт большой поток примеров, но требует нескольких независимых проверок. Обычно полезны следующие уровни контроля:

  • удаление пустых страниц, вопросов без ответа и повреждённых изображений;
  • проверка, что ответ встречается на нужной странице или выводится из её содержимого;
  • сверка с OCR и исходным текстовым слоем, когда он доступен;
  • проверка длины, формата и допустимого набора ответов;
  • выявление дубликатов вопросов, страниц и почти одинаковых документов;
  • ручная проверка части выборки с разбивкой по типам документов и вопросов.

Это типовая схема контроля, а не подтверждённое описание каждого фильтра Docmatix. Перед обучением нужно получить список фактически применённых правил и понять, какая доля данных прошла ручную проверку. Полезные практики очистки и дедупликации разобраны в материале о дедупликации данных для LLM.

Почему масштаб Docmatix может повлиять на fine-tuning VLM

Большой датасет повышает вероятность, что модель встретит разные формулировки вопросов, варианты расположения ответа и типы страниц. Это особенно полезно для open-source VLM, которую нужно адаптировать под document understanding.

Связь не линейная. Каждая новая порция данных помогает, если добавляет полезное покрытие и не приносит много ошибок или копий. Синтетические примеры могут ускорить сбор материала, но качество определяется всей цепочкой, начиная с исходного документа.

Объём против разнообразия: что именно получает модель

Количество пар «страница-вопрос-ответ» отвечает на вопрос о масштабе, но мало говорит о покрытии. Для оценки полезности Docmatix нужно посмотреть на распределение данных:

  • разные типы верстки и плотность текста;
  • языки, алфавиты и форматы чисел;
  • короткие и многостраничные документы;
  • цифровые файлы и сканы разного качества;
  • таблицы, формулы, графики и подписи;
  • ответы в верхней, центральной и нижней частях страницы;
  • вопросы на извлечение, сравнение, агрегацию и reasoning.

Повторение одного шаблона создаёт иллюзию масштаба. Модель может запомнить расположение поля или устойчивую формулировку вопроса, не освоив перенос на новый документ.

Как данные влияют на OCR и document reasoning

DocVQA помогает обучать связку между визуальным содержимым и ответом, но не заменяет каждый компонент OCR-пайплайна. У модели могут быть разные причины ошибки:

УровеньТипичная ошибкаЧто проверять
РаспознаваниеНеверно прочитана цифра или символТекст, качество изображения, шрифт
ЛокализацияВыбрана соседняя строка или колонкаКоординаты и границы блока
Порядок чтенияСвязаны части в неправильной последовательностиКолонки, заголовки, разрывы страниц
Понимание вопросаМодель ищет не тот тип значенияФормулировку и класс задачи
ОтветПравильные фрагменты собраны в неверный выводЛогику сравнения или агрегации

Специализированный document parsing может дать более предсказуемый результат для таблиц, формул и reading order. VLM после fine-tuning полезнее там, где требуется задать вопрос свободной формой и связать несколько визуальных элементов.

Почему fine-tuning не гарантирует универсального улучшения

Дообучение может адаптировать модель к стилю synthetic data. Она начнёт лучше распознавать характерные формулировки, длину ответов и визуальные шаблоны корпуса, но столкнётся с трудностями на других документах.

Основные риски:

  • переобучение на повторяющиеся макеты;
  • смещение в сторону простого извлечения фактов;
  • слабая работа с рукописными пометками и плохими сканами;
  • падение качества на языках, которых мало в обучении;
  • ошибки при переносе на документы другой отрасли;
  • запоминание особенностей генератора вместо решения задачи по странице.

Рост метрики на близком тестовом наборе ещё не означает улучшение пользовательского сценария. Нужны независимые документы и разбор причин ошибок.

Место Docmatix в обучающем наборе модели

Docmatix разумно использовать как часть data mixture. В зависимости от цели обучения рядом могут понадобиться реальные document QA-примеры, общие visual instruction данные, OCR-пары и ручная разметка целевого домена.

Общие визуальные данные поддерживают широкий набор навыков. OCR-примеры помогают точнее работать с текстом и структурой. DocVQA связывает эти способности с вопросом пользователя. Точные пропорции зависят от базовой модели, разрешения изображений, длины контекста и целевых метрик, поэтому их нужно подбирать экспериментально.

Где Docmatix полезен разработчикам и исследователям

Практическая ценность датасета зависит от того, какую задачу нужно решить. Для эксперимента с VLM он может стать источником supervised-сигнала. Для production-системы одной обучающей выборки недостаточно: там важны качество входных файлов, retrieval, валидация ответа и контроль доступа к документам.

Дообучение open-source VLM под документы

Базовый эксперимент можно построить в несколько шагов:

  1. Выбрать open-source VLM и зафиксировать её исходные настройки inference.
  2. Проверить формат изображений, диалогов, ответов и специальных токенов.
  3. Разделить документы на train, validation и test, не смешивая страницы одного документа между частями.
  4. Запустить supervised fine-tuning или parameter-efficient fine-tuning, например через адаптеры.
  5. Сравнить базовую и дообученную версии на независимом наборе.
  6. Разбить ошибки по OCR, локализации, структуре и reasoning.

Расход VRAM и время обучения зависят от архитектуры, размера изображения, длины контекста, batch size и метода адаптации. Поэтому размер Docmatix нельзя напрямую переводить в требования к видеопамяти.

Документные ассистенты, RAG и извлечение данных

Сценарии с счетами, отчётами, инструкциями и договорами требуют нескольких компонентов. VLM должна увидеть страницу, OCR или parser должны сохранить структуру, retrieval должен найти нужный фрагмент, а итоговый ответ должен пройти проверку.

Docmatix может обучить модель поведению в document QA: находить значение, сравнивать поля и отвечать по визуальному контексту. Он не решает автоматически проблемы chunking, поиска, доступа к файлам и фактической верификации. Ошибка на этапе извлечения документа может попасть в ответ даже при хорошем fine-tuning. Практический разбор таких сбоев есть в статье о причинах галлюцинаций в RAG на документах.

Локальные модели и self-hosted document processing

Локальный inference полезен, когда документы нельзя отправлять во внешний API, нужен стабильный throughput или требуется адаптация под внутренний формат. Команда получает контроль над версиями модели, логированием и маршрутизацией запросов.

Для массового parsing компактные OCR-модели часто практичнее: им нужно меньше GPU memory и вычислений, что повышает пропускную способность и упрощает запуск на небольшой инфраструктуре. В исследовательском document QA general-purpose VLM может оказаться удобнее, когда вопрос требует свободного объяснения или reasoning по нескольким элементам.

Выбор self-hosted модели стоит делать по связке «качество, память, скорость, формат результата и требования к приватности». Один показатель на бенчмарке не описывает весь pipeline.

Когда лучше выбрать специализированную OCR-модель

Специализированный инструмент логичнее, если основной результат должен иметь стабильную структуру:

ЗадачаПредпочтительный класс решенияПочему
Распознавание текстаOCR-модельФокус на точности символов и скорости
Layout analysisDocument-модельНужны блоки, координаты и типы элементов
Извлечение таблицСпециализированный parserКритична связь строк, колонок и ячеек
Распознавание формулOCR-модель с поддержкой формулОбычный текстовый OCR может потерять структуру
Reading orderDocument-модельНужно восстановить последовательность чтения
Свободные вопросы и объясненияVLMТребуется reasoning по визуальному контексту

PaddleOCR-VL-1.6, MinerU2.5-Pro и GLM-OCR можно использовать как ориентиры для специализированного OCR-класса. Qwen3-VL-235B подходит для сравнения с general-purpose VLM. Результаты OmniDocBench v1.6 нельзя автоматически переносить на fine-tuning с Docmatix, поскольку это разные экспериментальные условия.

Ограничения Docmatix и synthetic data: где масштаб не спасает

Синтетическая разметка ускоряет создание большого корпуса, но переносит в обучение ошибки генератора и свойства исходных документов. Масштаб усиливает полезные закономерности и одновременно может закрепить систематические ошибки.

Ошибочные или неоднозначные ответы

Генератор способен неверно прочитать мелкий текст, пропустить строку таблицы или связать ответ с соседней страницей. В документе могут встречаться сокращения, несколько допустимых форматов даты и значения, которые выглядят одинаково, но относятся к разным разделам.

Нужно отдельно проверять:

  • совпадает ли ответ с видимым содержимым;
  • есть ли у вопроса один однозначный вариант ответа;
  • сохраняются ли единицы измерения, знаки и формат чисел;
  • не возникла ли фактическая ошибка при пересказе;
  • можно ли объяснить ответ конкретным фрагментом страницы.

Точную долю ошибочных пар для Docmatix нельзя называть без опубликованного аудита или собственного анализа выборки.

Артефакты генератора вопросов

Одинаковый генератор оставляет узнаваемый след: повторяющиеся конструкции, похожую длину вопросов, предсказуемые типы ответов и перекос в сторону легко извлекаемых фактов. В таком случае модель учится распознавать шаблон задания.

Проверка должна включать распределение вопросов по классам, длине и сложности. Полезно добавить контрольный набор, созданный другим генератором или вручную. Если качество падает на такой выборке, fine-tuning мог улучшить соответствие синтетическому формату, а не сам навык document reasoning.

Domain shift и неполное покрытие реальных документов

Публичные и синтетически подготовленные документы могут отличаться от файлов конкретной компании. Разрыв появляется из-за отраслевой терминологии, языков, плохих сканов, печатей, рукописных пометок, нестандартных таблиц и многостраничных форм.

Перед запуском production-сценария нужна собственная обезличенная контрольная выборка. В неё стоит включить реальные типы документов, сложные случаи и примеры, где ошибка дорого обходится. Docmatix может помочь обучить общему поведению модели, но целевой домен всё равно требует отдельной оценки.

Лицензии, происхождение документов и утечки

До использования датасета нужно проверить лицензию, происхождение документов, правила распространения и допустимость коммерческого применения. Отдельный вопрос, пересекаются ли страницы или близкие шаблоны с evaluation-наборами.

Утечка возможна даже без полного совпадения пары «вопрос-ответ». Повтор страницы, почти идентичный шаблон или тот же источник в train и test способны завысить результат. Проверка происхождения и дедупликация нужны для юридической и методологической чистоты эксперимента. Наличие конкретных нарушений или утечек в Docmatix нельзя утверждать без отдельной проверки.

Как проверить, что обучение на Docmatix действительно помогло

Надёжный эксперимент сравнивает одну базовую VLM и её дообученную версию на одинаковом независимом наборе. Инференс-настройки, разрешение изображений, лимит токенов и правила нормализации ответов нужно зафиксировать заранее.

Разделение данных и независимая контрольная выборка

Разделять следует документы, а не отдельные пары. Все страницы одного PDF, его производные изображения и близкие варианты должны находиться в одной части эксперимента.

Минимальный контрольный список:

  • удалить точные дубликаты страниц и вопросов;
  • проверить почти одинаковые изображения и текстовые отпечатки;
  • исключить страницы из одного документа одновременно из train и test;
  • сформировать held-out documents, которых не было при обучении;
  • добавить реальные обезличенные документы целевого домена;
  • зафиксировать версию датасета и настройки inference.

Отдельно нужно искать benchmark contamination, то есть пересечение с тестами и публичными оценочными наборами. Иначе метрика может отражать знакомство с материалом, а не способность решить новую задачу.

Какие метрики и ошибки анализировать

Одной общей accuracy недостаточно. Оценку полезно разделить по операциям и типам документов.

ОбластьЧто измерятьЧто дополнительно проверить вручную
ИзвлечениеСовпадение ответа с эталоном после нормализацииЦифры, даты, единицы и регистр
ТаблицыПравильность выбора строки и столбцаСоседние ячейки и объединённые поля
Многостраничные документыПоиск нужной страницы и фрагментаПереходы между разделами
ReasoningКорректность вывода по нескольким фактамОпору на текст и отсутствие внешних догадок
СтруктураПонимание блоков и порядка чтенияКолонки, подписи, заголовки и сноски

Ошибки стоит помечать по причинам: OCR, локализация, reading order, понимание вопроса, арифметика, фактический ответ или формат вывода. Такая таксономия показывает, что именно улучшил fine-tuning и где потребуется другой компонент.

Сравнение с базовой VLM и специализированным OCR

Практическое сравнение должно включать три варианта: базовую general-purpose VLM, ту же VLM после дообучения и специализированную OCR-модель. Все три решения нужно прогнать через одинаковый набор документов и сопоставимые сценарии.

Сравнивать следует:

  • точность по каждому типу вопроса;
  • качество на плохих сканах и сложной верстке;
  • скорость обработки одной страницы;
  • потребление VRAM и требования к серверу;
  • стабильность формата ответа;
  • частоту критических ошибок в целевом домене.

Такой тест помогает понять, оправдывает ли VLM после fine-tuning дополнительные вычисления. Для извлечения текста и таблиц специализированная модель может сохранить преимущество, а для свободных вопросов по содержимому документа дообученная VLM может оказаться удобнее.

Итог: кому стоит обратить внимание на Docmatix

Исследователям DocVQA Docmatix интересен как материал для изучения масштабирования, synthetic supervision и связи между визуальными признаками документа и ответом на вопрос. Главные объекты анализа здесь, качество генерации, разнообразие страниц и независимость оценки.

Разработчикам open-source VLM датасет может дать дополнительный supervised-сигнал для адаптации модели под document QA. Перед обучением нужно проверить формат, лицензию, распределение типов задач и соответствие собственному домену.

Командам массового OCR Docmatix разумно воспринимать как дополнение к специализированному document processing. Для text recognition, layout analysis, table extraction, formula recognition и reading-order detection отдельная OCR-модель может быть быстрее и экономнее.

Ценность Docmatix определяется сочетанием четырёх факторов: качества пайплайна, разнообразия документов, точности ответов и результата на независимой выборке. Размер датасета повышает потенциал fine-tuning, но решение о применении принимают по измерениям, ручному анализу ошибок, требованиям к локальному inference и реальным документам.

Для команд, которые собирают собственные данные, полезно сопоставить Docmatix с практиками коллективной разметки и подготовки открытых наборов, описанными в статье о создании датасетов для LLM. Такой подход помогает оценить, где синтетическая генерация ускоряет работу, а где нужна ручная проверка эксперта.

Подписаться на канал