Перейти к содержанию
Публикация AiManual

Лучшие компактные vision-модели до 6B параметров для локального запуска в 2026 году

Сравниваем Qwen 3.5 4B и MiniCPM-V-4.6 для локального запуска без фиктивного рейтинга: разбираем качество зрения, OCR, русский диалог, VRAM, квантизацию и совме

Коротко

Что будет в материале

  1. 01

    Короткий ответ: какую компактную vision-модель выбрать

  2. 02

    Qwen 3.5 4B и MiniCPM-V-4.6: что именно сравнивать

  3. 03

    Как выбрать между языковой универсальностью и качеством зрения

  4. 04

    VRAM и локальный запуск: почему 6B параметров недостаточно для расчёта

Короткий ответ: какую компактную vision-модель выбрать

Универсального победителя среди vision-моделей до 6B параметров нет. Выбор зависит от главной задачи: общего диалога на русском языке, описания фотографий, анализа скриншотов, OCR, работы с таблицами или минимального потребления VRAM.

Qwen 3.5 4B и MiniCPM-V-4.6 стоит рассматривать как две отправные точки для сравнения. Первый кандидат логично проверять в роли локального мультимодального ассистента, которому нужны обычный диалог, инструкции и анализ изображений. Второй кандидат нужно оценивать по работе с фотографиями, скриншотами, документами и несколькими визуальными входами, если такую возможность подтверждает выбранная сборка.

Число параметров само по себе не отвечает на вопрос о качестве и требованиях к памяти. Перед установкой проверьте формат весов, квантизацию, vision-компоненты, поддержку конкретным runtime, длину контекста и поведение модели после добавления изображения. В доступных материалах нет подтверждённых характеристик Qwen 3.5 4B и MiniCPM-V-4.6, поэтому точный рейтинг, цифры VRAM и сравнительные бенчмарки здесь не приводятся.

  • Для общего локального помощника сравните обе модели на русском диалоге, структурированном выводе и анализе скриншотов.
  • Для фотографий и сцен проверьте состав объектов, пространственные отношения и способность отвечать только по видимым данным.
  • Для документов сначала проведите отдельный OCR-тест. Красивая подпись к фотографии не доказывает точность распознавания таблиц.
  • При жёстком лимите VRAM выбирайте конкретную сборку после замера полного сценария, включая изображение и рабочий контекст.

Qwen 3.5 4B и MiniCPM-V-4.6: что именно сравнивать

Названия моделей задают направление поиска, но не заменяют проверку карточки модели и инструкции выбранного движка. Для честного сравнения нужны одинаковые изображения, одинаковые промпты, сопоставимые форматы весов и один порядок заданий.

Qwen 3.5 4B как кандидат для локального мультимодального ассистента

Qwen 3.5 4B имеет смысл проверять в сценарии, где изображение дополняет обычный текстовый диалог. Примеры: разбор скриншота ошибки, описание интерфейса, извлечение видимого текста с последующим объяснением, подготовка JSON-ответа или краткая инструкция по изображению.

До запуска подтвердите пять характеристик:

  • есть ли у конкретной версии полноценный vision-вход, а не только текстовая часть;
  • какие форматы изображений принимает выбранная сборка;
  • какой chat template нужен для передачи изображения;
  • поддерживает ли используемый runtime эту архитектуру и формат весов;
  • сохраняется ли структурированный вывод при добавлении визуального входа.

Для проверки общего ассистента используйте короткие задания с известным ответом. Например, покажите скриншот с несколькими кнопками и попросите перечислить их в порядке слева направо. Затем попросите вернуть результат в заранее заданной структуре. Такой тест одновременно проверяет зрение, порядок элементов и следование инструкции.

Отдельный промпт должен проверять границы уверенности: Перечисли только текст, который виден на изображении. Если фрагмент не читается, напиши неразборчиво. Не восстанавливай слова по догадке. Ответ нужно оценивать по каждой строке, а не по общему впечатлению.

MiniCPM-V-4.6 как кандидат для задач с изображениями

MiniCPM-V-4.6 следует оценивать как отдельного кандидата для визуальных задач, а не автоматически считать заменой любой другой мультимодальной модели. До публикации или рабочего использования нужно подтвердить режимы загрузки, типы входных данных, требования конкретной сборки и ограничения при обработке нескольких изображений.

Минимальный набор проверок включает четыре группы:

  • фотография сцены с пятью или шестью объектами, расположенными в разных частях кадра;
  • скриншот интерфейса с мелким текстом, статусами и несколькими похожими элементами;
  • страница документа с заголовком, абзацами, таблицей и графическим фрагментом;
  • пара изображений для сравнения, если runtime действительно передаёт модели оба файла в одном запросе.

Для каждой группы задайте вопрос на факт и вопрос на вывод. Например, сначала попросите перечислить видимые поля таблицы, затем найти строку с конкретным значением. Это отделяет распознавание изображения от рассуждения по распознанным данным.

Если модель уверенно называет элемент, которого нет на изображении, зафиксируйте это как отдельную ошибку. Правдоподобный текст не компенсирует выдуманный факт, особенно при работе с чеками, кодом, конфигурациями и техническими схемами.

Сравнительная матрица без фиктивного рейтинга

При отсутствии подтверждённых карточек нельзя заполнять сравнительную таблицу догадками. Ниже приведён шаблон, который можно заполнить после выбора конкретных репозиториев весов и runtime.

КритерийQwen 3.5 4BMiniCPM-V-4.6Как принять решение
Число параметровВ названии указано 4B, подтвердите фактическую конфигурациюПодтвердите по карточке моделиСравнивайте конкретную версию, а не маркетинговое обозначение
Vision-входНужно подтвердить для выбранной сборкиНужно подтвердить для выбранной сборкиПустой текстовый запуск не доказывает поддержку изображений
Языки и русский диалогПроверить на одинаковом наборе промптовПроверить на одинаковом наборе промптовОценивать связность, точность и формат ответа
Описание сценНужен тест на объекты и их расположениеНужен тест на объекты и их расположениеСчитать ошибки объектов и пространственных отношений
OCR и документыНужен тест на крупный, мелкий текст и таблицыНужен тест на крупный, мелкий текст и таблицыРазделять распознавание текста и сохранение структуры
Форматы весовПроверить карточку и репозиторий сборкиПроверить карточку и репозиторий сборкиУчитывать связку весов, vision-компонента и runtime
КвантизацияПодтвердить доступные уровниПодтвердить доступные уровниСравнивать качество и память на сопоставимых уровнях
Несколько изображенийПроверить лимит и порядок входовПроверить лимит и порядок входовНе переносить поддержку между версиями
КонтекстПроверить лимит для текста и визуальных токеновПроверить лимит для текста и визуальных токеновТестировать длинный рабочий запрос, а не пустой чат
Локальный запускПроверить совместимый runtimeПроверить совместимый runtimeФакт наличия весов не гарантирует запуск
Лицензия и дата версииПроверить перед использованиемПроверить перед использованиемФиксировать дату проверки и номер сборки

Как выбрать между языковой универсальностью и качеством зрения

У компактной мультимодальной модели ограничен общий бюджет параметров и памяти. Часть архитектуры отвечает за язык, часть связывает изображение с текстом, а runtime хранит промежуточные данные. Поэтому сильный ответ на обычный вопрос не доказывает точность анализа изображения.

Общие языковые задачи и работа с инструкциями

Проверьте модель на пяти типах запросов: краткий ответ на русском языке, многошаговая инструкция, структурированный вывод, исправление собственной ошибки и отказ от неподтверждённого утверждения.

Практический тест может выглядеть так:

  1. Дайте изображение и попросите извлечь три наблюдаемых факта.
  2. Попросите преобразовать их в JSON с заранее заданными полями.
  3. Добавьте условие: пропущенные данные помечать как неизвестные.
  4. Проверьте, сохранила ли модель структуру и не добавила ли сведения, которых нет в кадре.

Для русского языка проверяйте падежи, сокращения, технические термины и смешение кириллицы с латиницей. Отдельно фиксируйте случаи, когда модель правильно описала сцену, но исказила значение распознанной строки.

Полезный ответ должен содержать проверяемые наблюдения и отделять их от интерпретации. Если модель не сообщает о неопределённости при плохом качестве изображения, это снижает её пригодность для автоматизации.

Описание изображения и визуальное рассуждение

Простое описание сцены и визуальное рассуждение требуют разных проверок. В первом случае достаточно назвать объекты. Во втором нужно сопоставить их положение, состояние и последовательность событий, не добавляя причин, которых изображение не подтверждает.

Используйте набор из шести вопросов:

  • Какие объекты видны в центре, слева и справа?
  • Какой объект расположен ближе к камере?
  • Какие элементы имеют одинаковый цвет или форму?
  • Что изменилось между двумя изображениями?
  • Какой шаг действия можно подтвердить по кадру?
  • Какие сведения невозможно определить по изображению?

Последний вопрос особенно полезен. Он показывает, умеет ли модель работать с границами наблюдения. Для коротких описаний и alt-text полезно сравнить длину ответа, полноту ключевых объектов и отсутствие выдуманных деталей. Подход к такой проверке разобран в материале о выборе мультимодальной модели для коротких описаний изображений.

OCR, документы и таблицы

OCR нужно оценивать по нескольким независимым показателям: правильность символов, сохранение строк, порядок колонок, распознавание чисел и корректность ответа на вопрос по документу. Ошибка в одном символе может менять смысл команды, суммы или идентификатора.

Разделите тестовый набор на такие фрагменты:

  • крупный печатный текст с хорошим контрастом;
  • мелкий текст на скриншоте;
  • скан с перекосом, тенью или сжатием;
  • таблица с несколькими колонками;
  • документ со смешением текста и графики;
  • рукописная или частично закрытая область.

Сначала попросите модель переписать видимый текст без пересказа. Затем задайте вопрос по одной конкретной строке. Третий шаг, восстановление таблицы в виде списка или JSON, покажет, сохраняет ли система структуру исходного документа.

Полноценный документный OCR нельзя обещать без отдельной проверки на реальных сканах. Для критичных данных используйте ручную сверку или специализированный OCR-процесс.

VRAM и локальный запуск: почему 6B параметров недостаточно для расчёта

Объём параметров описывает размер весов, но не общий расход памяти. При запуске система хранит веса, vision-компоненты, KV-cache, визуальные токены, временные буферы и данные самого runtime.

Параметры модели, формат весов и квантизация

Для грубой оценки сырых весов число параметров умножают на количество байт на параметр. Модель с 4 млрд параметров потребует около 8 ГБ при хранении в формате с 2 байтами на параметр, около 4 ГБ при 1 байте и около 2 ГБ при 4 битах. Это арифметическая оценка самих весов, без vision-части, служебных буферов и кэша.

Квантизация уменьшает размер весов, но итоговый расход зависит от формата, группировки, метаданных и того, какие компоненты были сжаты. Более агрессивное сжатие может снизить требования к памяти и повлиять на точность. Особенно внимательно сравнивайте OCR, числа, имена файлов и структурированный вывод.

Ссылки на название квантизации недостаточно. Нужны размер файла, требования сборщика, способ загрузки на GPU и объём данных, который остаётся на CPU. Практический разбор выбора формата для запуска на 6 ГБ VRAM приведён в статье о квантизации и балансе скорости с качеством.

Контекст, изображения и дополнительная нагрузка

После добавления изображения память расходуется на визуальные признаки и их представление в контексте. Рост разрешения, число изображений и длина диалога могут увеличить нагрузку даже при неизменных весах.

Сценарий с одним небольшим изображением и коротким вопросом нельзя использовать для оценки многостраничного документа. Запустите модель с тем же количеством изображений, которое будет в работе, затем добавьте длинный текст и попросите структурированный ответ. Именно такой запрос показывает, хватает ли памяти для реального режима.

Закладывайте запас VRAM. Если видеопамяти недостаточно, runtime может перенести часть вычислений в оперативную память. Это помогает избежать ошибки загрузки, но скорость и задержка могут измениться. Поэтому нужно отдельно фиксировать факт запуска и комфортность работы.

Как оценить конфигурацию перед установкой

  1. Запишите объём свободной VRAM и RAM до старта.
  2. Выберите конкретный формат весов и проверьте размер файла.
  3. Уточните, загружается ли vision-компонент вместе с языковой частью.
  4. Проверьте поддержку GPU, драйвера и архитектуры выбранным runtime.
  5. Запустите короткий текстовый запрос.
  6. Повторите запуск с одним изображением и рабочим промптом.
  7. Проверьте длинный контекст, несколько изображений и CPU-offload, если они нужны.

Записывайте время до первого токена, скорость генерации, пиковую VRAM, пиковую RAM, ошибки и результат повторного запуска. Числа относятся к конкретной видеокарте, драйверу, версии runtime, формату весов и параметрам контекста. Переносить их на другую конфигурацию нельзя.

Какие задачи реально поручать компактной vision-модели

Компактная vision-модель полезна там, где результат можно быстро проверить человеком. Для критичных решений нужен дополнительный контроль, специализированный инструмент или более крупная модель.

Скриншоты интерфейсов и технические изображения

Подходящие задачи: найти сообщение об ошибке, перечислить видимые элементы, объяснить назначение кнопки, извлечь короткий фрагмент текста, описать схему или подготовить черновик пошагового ответа.

Для скриншота с интерфейсом задайте три запроса:

  • перепиши весь читаемый текст без исправлений;
  • назови область, где видна ошибка;
  • составь инструкцию, используя только элементы, присутствующие на экране.

Мелкие подписи, скрытые состояния, всплывающие окна и элементы за пределами кадра требуют ручной проверки. Модель видит переданное изображение, а не весь интерфейс пользователя.

Фотографии, предметы и бытовые сцены

Для фотографий подходят описание объектов, поиск различий, классификация видимых предметов и ответы на вопросы о композиции сцены. Начните с простых фактов: цвет, форма, расположение, количество. Затем добавьте вопрос, требующий сравнения.

Не используйте компактную vision-модель как самостоятельный источник медицинских, юридических, охранных или финансовых выводов. Фото может быть неполным, а визуальный ответ может звучать убедительно при ошибочном распознавании.

При сравнении двух изображений заранее установите порядок файлов и попросите модель ссылаться на первый и второй кадр. Если выбранная версия не поддерживает несколько изображений, отправляйте их отдельными запросами и не приписывайте системе способность сопоставлять общий контекст.

Документы, чеки и таблицы

Для документа полезна последовательность из четырёх шагов: улучшить читаемость изображения, разделить страницу на крупные фрагменты, извлечь текст, сверить ключевые значения с оригиналом.

Кроп помогает увеличить мелкие строки, но не исправляет размытые символы и потерянную часть страницы. Для чека проверьте дату, итоговую сумму, налог, артикулы и количество позиций по отдельности. Для таблицы сравните заголовки колонок, порядок строк и десятичные разделители.

При работе с многостраничным документом сохраняйте номер страницы и исходный фрагмент рядом с каждым извлечённым значением. Ответ на вопрос по одному скану не доказывает, что модель корректно прочитала весь документ.

Локальный помощник для разработки и автоматизации

Vision-модель можно встроить в рабочий процесс для разбора скриншотов ошибок, чтения диаграмм, подготовки описаний изображений для RAG и создания черновиков структурированных записей. Перед автоматизацией проверьте стабильность формата ответа на десяти или более похожих заданиях из собственного набора.

В цепочке автоматизации обработайте минимум три ошибки: повреждённый файл, пустой ответ и ответ с нарушенной структурой. Для каждого случая задайте понятное действие, например повторить запрос, передать задачу человеку или записать ошибку в журнал.

Локальная обработка снижает риск отправки изображения во внешний API, но сама по себе не доказывает отсутствие сетевых обращений. Проверьте настройки интерфейса, плагины, прокси и журнал соединений.

Ограничения компактных vision-моделей, о которых часто забывают

Мелкие детали и низкое качество исходного изображения

Мелкий текст, блики, сжатие JPEG, низкий контраст и сложный фон повышают вероятность пропуска объекта или символа. Изображение может выглядеть понятным человеку, но содержать недостаточно пикселей для точного распознавания.

Кропы, поворот, повышение контраста и разбиение страницы на части помогают подготовить вход. Эти операции не возвращают сведения, которых нет в исходном кадре. Сравнивайте ответ на полном изображении и на кропе, чтобы увидеть, какие детали теряются.

Ошибки OCR и уверенные галлюцинации

Самый опасный сценарий выглядит правдоподобно: модель выдаёт гладкий ответ с неверной цифрой, символом или названием. Для OCR просите её цитировать видимый фрагмент, ставить отметку неопределённости и разделять извлечённый текст с интерпретацией.

Оцените минимум три вида ошибок:

  • пропуск строки или объекта;
  • замена похожих символов, например 0 и O;
  • добавление текста, которого на изображении нет.

Если ошибка меняет смысл платежа, команды или конфигурации, результат должен пройти ручную сверку. Автоматическая цепочка не должна считать уверенный тон признаком точности.

Длинные документы и несколько изображений

Поддержка одного изображения не гарантирует корректную обработку пачки страниц. Проверяйте максимальное число изображений, порядок страниц, повторение заголовков, ссылки на конкретные фрагменты и сохранение контекста после длинного запроса.

Тест на многостраничном документе должен содержать вопрос по первой странице, вопрос по последней странице и вопрос, требующий сопоставить два фрагмента. Если модель путает страницы или смешивает строки, используйте раздельную обработку с последующей проверкой.

Как самостоятельно сравнить модели на своём ПК

Соберите тестовый набор из реальных задач

Соберите изображения из будущего рабочего процесса. В наборе могут быть фотографии, скриншоты, документы, таблицы и кадры с мелкими деталями. Пропорции должны соответствовать реальному использованию: если модель нужна для чеков, демонстрационные фотографии почти ничего не скажут о её пригодности.

Для каждого файла запишите ожидаемый результат. Для фотографии это список объектов и их положение. Для скриншота, точный текст ошибки. Для таблицы, значения выбранных ячеек и порядок колонок. Эталон не обязан быть длинным, но должен позволять посчитать ошибки.

Одинаковые промпты и понятная шкала оценки

Используйте одинаковые изображения, промпты, параметры генерации, формат весов и порядок заданий. Сохраните исходный файл, текст запроса и полный ответ каждой модели.

Удобная шкала содержит четыре оценки:

  • точность фактов, от 0 до 2 баллов;
  • полнота ответа, от 0 до 2 баллов;
  • следование заданному формату, от 0 до 2 баллов;
  • штраф за выдуманные детали, от 0 до 2 баллов.

Для OCR добавьте количество ошибок в символах, строках и числах. Для визуального рассуждения отдельно считайте неверные пространственные отношения. Средняя оценка не должна скрывать провал на критичной категории.

Фиксируйте скорость, память и стабильность

Качество ответа имеет смысл только вместе с эксплуатационными показателями. Записывайте время загрузки, время до первого токена, скорость генерации, пиковую VRAM, пиковую RAM и длительность полного запроса.

Повторите каждый сценарий минимум дважды после перезапуска runtime. Зафиксируйте зависания, ошибки загрузки, сброс контекста, различия в ответах и необходимость CPU-offload. Результат должен включать конфигурацию ПК: GPU, объём VRAM, RAM, формат весов, runtime и параметры контекста.

Не смешивайте результаты разных уровней квантизации в одной строке рейтинга. Сжатая сборка может занимать меньше памяти, но давать другой уровень ошибок на числах, OCR и следовании формату.

Как принять итоговое решение

Сначала выделите критичный критерий. Для документов это точность чисел и сохранение структуры, для ассистента, русский диалог и инструкции, для домашнего ПК, стабильность и доступная память.

Затем задайте веса критериям. Например:

  • качество ответа, 40 процентов;
  • OCR и документы, 25 процентов;
  • скорость, 15 процентов;
  • потребление памяти, 15 процентов;
  • стабильность и удобство запуска, 5 процентов.

Проценты нужно изменить под свой сценарий. Если модель не проходит критичный тест, средний балл не должен превращать её в подходящий вариант. В таком случае выбирайте другую модель, отдельный OCR-инструмент или разделяйте рабочую цепочку на несколько компонентов.

Локальный стек: что проверить до запуска Qwen 3.5 4B или MiniCPM-V-4.6

Совместимость модели и runtime

Совместимость проверяется на уровне связки, а не одного файла. Нужны совместимые языковые веса, vision-компонент, шаблон чата, загрузчик изображений, формат токенов и поддержка архитектуры выбранным runtime.

Перед установкой пройдите последовательность:

  1. Откройте карточку конкретной версии модели.
  2. Проверьте формат весов и наличие связанных файлов vision-компонента.
  3. Сверьте поддерживаемую архитектуру с документацией runtime.
  4. Уточните формат передачи изображения и требования к chat template.
  5. Проверьте драйвер GPU и возможность CPU-offload.
  6. Запустите тест с изображением, а не только пустой текстовый запрос.
  7. Сохраните журнал ошибок и параметры запуска.

Практические нюансы локального vision-запуска, включая роль формата весов и GGUF-сборок, разобраны в материале о локальном запуске vision-модели. Принцип применим к проверке любой другой мультимодальной сборки, но конкретные команды и требования нужно сверять отдельно.

Приватность и локальная обработка изображений

Локальный запуск снижает зависимость от внешнего API, но приватность определяется всей конфигурацией. Проверьте, куда обращается интерфейс, какие плагины активны, включено ли журналирование запросов и не отправает ли прокси изображения наружу.

Для рабочего компьютера зафиксируйте:

  • путь к локальным весам и место хранения временных файлов;
  • сетевые настройки интерфейса и runtime;
  • наличие внешних интеграций;
  • срок хранения изображений и ответов в журналах;
  • права доступа к каталогу с документами.

Только после такой проверки можно говорить о пригодности конфигурации для персональных или рабочих данных. Сам факт запуска модели на домашнем ПК не подтверждает абсолютную приватность.

Итоговый выбор: какая модель подойдёт именно вам

Что должно войти в финальную сравнительную таблицу

Перед установкой сведите результаты в одну таблицу. Для каждой модели укажите:

  • название, версию и дату проверки;
  • подтверждённое число параметров и архитектуру;
  • поддерживаемые изображения и режимы работы;
  • результаты русского диалога и следования инструкциям;
  • результаты описания сцен и визуального рассуждения;
  • ошибки OCR, работу с документами и таблицами;
  • форматы весов и доступные уровни квантизации;
  • совместимые runtime и способы передачи изображений;
  • пиковые VRAM и RAM на одинаковом тесте;
  • скорость, стабильность, ограничения и необходимость ручной проверки;
  • тип пользователя и задачу, для которой модель прошла критичный тест.

Пустое поле помечайте как требует проверки. Такая отметка полезнее предположения о поддержке функции или точном объёме VRAM.

Источники и границы актуальности данных

Дата подготовки этой статьи, 9 сентября 2026 года. Характеристики моделей и runtime нужно сверять по актуальной карточке модели, репозиторию авторов, документации движка и датированному релизу конкретной сборки.

В доступной фактуре нет подтверждённых чисел для Qwen 3.5 4B и MiniCPM-V-4.6: неизвестны сопоставимые результаты OCR, фактический расход памяти, поддерживаемые форматы и универсальный набор совместимых runtime. Поэтому статья не объявляет одну модель лучшей и не переносит характеристики одной сборки на другую.

Обсуждение пределов малых моделей и связи между параметрами, VRAM и качеством дополнительно помогает отделить размер весов от реальной производительности. Практический контекст собран в разборе возможностей компактных моделей.

Для выбора по профилям используйте такую схему:

  • Нужен общий локальный ассистент с изображениями: сравните Qwen 3.5 4B и MiniCPM-V-4.6 на русском диалоге, инструкциях и скриншотах.
  • Главные задачи связаны с фотографиями и интерфейсами: начните с тестов описания сцен, объектов и пространственных отношений.
  • Основной сценарий, документы и OCR: проверьте числа, таблицы и мелкий текст; при провале критичного теста подключите отдельный OCR.
  • VRAM ограничена: сравните конкретные квантизированные сборки, запас памяти, CPU-offload и скорость полного запроса.
  • Нужна автоматизация: проверьте стабильность структуры ответа, обработку ошибок и отсутствие нежелательных сетевых обращений.

Финальный чек-лист короткий: задача, набор изображений, промпты, формат весов, память, runtime, результаты качества, скорость, стабильность, ограничения и ручная проверка. Если обе модели не проходят критичный тест, проблема не решается выбором более агрессивной квантизации. Нужен другой vision-инструмент, отдельный OCR или более крупная мультимодальная система.

Подписаться на канал