Почему мультимодальные модели не справляются с чисто текстовыми задачами: урок Qwen3.5-2B
Задача выглядела стандартно: обработать 90 млн текстов с уровнем галлюцинаций ниже 10%. Выбор пал на Qwen3.5-2B - компактную модель с открытыми весами, которая обещала хорошую производительность. После тонкой настройки на текстовом корпусе результат оказался нулевым. Модель не выдавала ничего осмысленного. Этот провал - не случайность, а следствие архитектурного компромисса, заложенного в мультимодальные системы.
Корень проблемы: мультимодальные LLM распределяют параметры между текстовыми и визуальными представлениями. При сжатии до 2B параметров этот баланс становится критичным. Модель учится связывать пиксели с токенами, а не выстраивать глубокие текстовые связи. Когда вы отключаете визуальный вход и дообучаете её на тексте, вы боретесь с уже сформированной структурой весов, оптимизированной под кросс-модальное взаимодействие.
Архитектурные компромиссы мультимодальных LLM
Мультимодальная архитектура требует проекционных слоёв для выравнивания эмбеддингов изображений и текста в общем пространстве. В Qwen3.5-2B эти слои занимают заметную долю параметров. При инференсе на чистом тексте проекционные веса остаются в памяти, но не активируются - это мёртвый груз, который не помогает текстовой задаче, но ограничивает эффективную ёмкость модели.
Вторая проблема - предобучение на смешанных данных. Модель видит пары «изображение-описание» и учится генерировать текст, опираясь на визуальные признаки. Текстовые представления размываются: модель привыкает, что часть информации всегда приходит из другой модальности. Без визуального якоря она теряет контекстную устойчивость. Отсюда рост галлюцинаций при переходе на чистый текст.
Третий фактор - fine-tuning не перестраивает фундаментальные представления. Он адаптирует выходной слой и немного сдвигает веса, но не может «забыть» кросс-модальные связи, впечатанные за миллионы шагов предобучения. Модель продолжает ожидать визуальный сигнал, которого нет.
Qwen3.5-2B: почему тонкая настройка не спасла
Эксперимент ставился на выборке из 500 тысяч текстов, репрезентативной для основного корпуса в 90 млн. Использовался стандартный подход: LoRA-адаптеры с рангом 64, learning rate 2e-4, три эпохи. Метрики на валидации показывали снижение loss, но на тестовой выборке модель генерировала бессвязные последовательности токенов. Hallucination Rate достиг 94% - модель выдумывала факты, не соответствующие входному тексту.
Анализ активаций показал: внутренние представления текста в средних слоях модели не формировали устойчивых кластеров для фактологической информации. Модель опиралась на поверхностные паттерны языка, но не выстраивала семантические связи, необходимые для точной генерации. Это прямое следствие мультимодального предобучения: текстовая ветка не развила достаточную глубину.
Вывод однозначен: для текстового пайплайна с жёсткими требованиями к точности мультимодальные модели непригодны. Нужны чистые языковые архитектуры, где каждый параметр работает на понимание и генерацию текста.
Ключевые критерии выбора компактной текстовой LLM для промышленного пайплайна
После исключения мультимодальных моделей круг кандидатов сужается. Добавляем ограничение: отказ от квантизации. Это принципиальное требование кейса - точность важнее скорости и памяти. Квантизация INT8 или INT4 снижает битность весов и активаций, что экономит ресурсы, но вносит шум в вычисления. Для задачи с порогом галлюцинаций 10% этот шум неприемлем.
Три критерия формируют фильтр: чисто текстовая архитектура, размер до 3B параметров для возможности инференса на потребительском оборудовании без квантизации, наличие открытых весов для дистилляции. Дополнительно важна стабильность инференса - модель должна выдавать детерминированные результаты при одинаковых входных данных.
Почему отказ от квантизации меняет правила игры
Квантизация INT8 снижает точность весов с 16 до 8 бит. Для больших моделей (13B+) потери незаметны на общих бенчмарках. Для компактных моделей (до 3B) каждый бит на счету. Исследования показывают: при переходе на INT8 у моделей размером 1-2B hallucination rate вырастает на 3-7 процентных пунктов. При целевом пороге 10% это критично.
Отказ от квантизации означает, что модель должна помещаться в память целевого оборудования в FP16. Для 2B-модели это около 4 GB VRAM плюс память под KV-кэш и батч. На GPU с 16-24 GB можно запустить инференс с комфортным размером батча. На CPU потребуется 8-16 GB RAM и терпимость к latency в 2-5 секунд на запрос.
Метрики галлюцинаций: как измерить и удержать ниже 10%
Hallucination Rate измеряется на размеренной выборке с эталонными ответами. Каждый выход модели проверяется на фактическое соответствие входному тексту. Используются две метрики: Factual Consistency (доля утверждений в ответе, которые подтверждаются источником) и Hallucination Rate (доля ответов, содержащих хотя бы одно вымышленное утверждение).
Для кейса с 90 млн текстов методика такая: случайная выборка из 10 000 примеров, ручная разметка 500 из них для калибровки автоматического детектора галлюцинаций, затем автоматическая оценка остальных. Детектор на основе NLI (Natural Language Inference) проверяет каждое утверждение в ответе на следование из входного текста. Порог acceptance: Hallucination Rate < 10%, Factual Consistency > 90%.
Обзор кандидатов: компактные текстовые LLM для дистилляции
На основе критериев отобраны пять моделей. Все - чистые текстовые архитектуры decoder-only с открытыми весами. Размер от 1.5B до 3B параметров. Контекстное окно от 2048 до 8192 токенов - для задачи обработки текстов средняя длина входа составляет 1200 токенов, так что минимальные 2048 достаточны.
Сравнительная таблица характеристик
| Модель | Параметры | Контекст | Архитектура | Предобучение | Открытые веса |
|---|---|---|---|---|---|
| Phi-2 | 2.7B | 2048 | Decoder-only | 1.4T токенов (текст + код) | Да (MIT) |
| Gemma-2B | 2B | 8192 | Decoder-only | 2T токенов (преимущественно текст) | Да (Gemma Terms) |
| Qwen1.5-1.8B | 1.8B | 32768 | Decoder-only | 2.2T токенов (текст) | Да (Apache 2.0) |
| StableLM-2-1.6B | 1.6B | 4096 | Decoder-only | 2T токенов (текст + код) | Да (CC BY-SA 4.0) |
| TinyLlama-1.1B | 1.1B | 2048 | Decoder-only | 3T токенов (текст) | Да (Apache 2.0) |
Phi-2 выделяется качеством генерации на коротких и средних текстах благодаря обучению на синтетических данных высокого качества. Gemma-2B даёт лучшую фактическую согласованность - её предобучение на тщательно отфильтрованном текстовом корпусе снижает baseline hallucination rate. Qwen1.5-1.8B привлекает большим контекстным окном и стабильностью инференса. StableLM-2-1.6B показывает хороший баланс скорости и качества. TinyLlama - минимальный вариант для задач, где критично время обработки.
Почему не Qwen3.5-2B и другие мультимодальные: выводы для списка
Qwen3.5-2B, LLaVA-1.5-1.5B, Fuyu-2B и аналоги исключены по результатам эксперимента. Мультимодальное предобучение создаёт неустранимый перекос в представлениях. Даже если модель показывает приемлемые результаты на общих текстовых бенчмарках, при тонкой настройке на узкий домен она деградирует. Риск получить нулевой результат на специфической задаче слишком высок.
Методика дистилляции на 90 млн текстов: от учителя к ученику
Дистилляция - процесс переноса знаний от большой модели-учителя к компактному ученику. В отличие от стандартных сценариев, где дистилляция снижает затраты в 25-30 раз, здесь цель - сохранить точность при ограничении на размер и отсутствие квантизации. Учитель генерирует выходы на обучающей выборке, ученик учится их воспроизводить.
Важный нюанс: дистилляция переносит стиль, а не знания. Ученик копирует распределение ответов учителя, но не обязательно усваивает фактологическую основу. Поэтому критичен аудит учителя перед началом дистилляции: если учитель галлюцинирует на 5% примеров, ученик унаследует эти ошибки и добавит свои.
Подготовка данных: обеспечение репрезентативности выборки
Из 90 млн текстов формируется обучающая выборка в 2-5 млн примеров. Критерии отбора: покрытие всех доменов корпуса, исключение дубликатов, фильтрация текстов с высоким уровнем шума (разметка, артефакты парсинга). Разбиение: 80% train, 10% validation, 10% test. Validation и test стратифицированы по доменам для unbiased оценки.
Очистка включает удаление текстов короче 100 токенов (недостаточно контекста для оценки галлюцинаций), фильтрацию по перплексии (выбросы с аномально высокой или низкой перплексией исключаются), дедупликацию на уровне абзацев. Для задачи с требованием к фактической точности качество данных важнее количества.
Выбор модели-учителя и настройка процесса дистилляции
Учитель - большая текстовая LLM с низким собственным hallucination rate. Подходят Qwen2.5-14B, Llama-3.1-8B-Instruct, DeepSeek-V2-Lite. Выбор зависит от доступных ресурсов: 14B-модель требует 28 GB VRAM в FP16, 8B - 16 GB. Дистилляция идёт на уровне логитов: ученик учится воспроизводить распределение вероятностей следующего токена, которое выдаёт учитель.
Температура учителя - 0.7 для обучения (мягкие метки несут больше информации о неопределённости) и 0.0 для генерации эталонных ответов на test set. Функция потерь - KL-дивергенция между распределениями учителя и ученика. Гиперпараметры: learning rate 1e-4, batch size 32, градиентный аккумулятор на 4 шага, косинусное затухание learning rate, 3-5 эпох.
Результаты тестирования: производительность и галлюцинации на реальной выборке
Тестирование проводилось на отложенной выборке из 50 000 текстов, не участвовавших в обучении. Оборудование: NVIDIA A6000 (48 GB VRAM), инференс в FP16, batch size 8. Измерялись hallucination rate, factual consistency, latency на один пример и throughput в текстах в секунду.
Сравнение уровня галлюцинаций до и после дистилляции
| Модель | Hallucination Rate (учитель) | Hallucination Rate (ученик) | Factual Consistency (ученик) |
|---|---|---|---|
| Phi-2 (ученик Qwen2.5-14B) | 4.2% | 7.8% | 91.3% |
| Gemma-2B (ученик Llama-3.1-8B) | 5.1% | 8.3% | 90.7% |
| Qwen1.5-1.8B (ученик Qwen2.5-14B) | 4.2% | 9.1% | 89.5% |
| StableLM-2-1.6B (ученик DeepSeek-V2-Lite) | 5.8% | 9.7% | 88.2% |
| TinyLlama-1.1B (ученик Llama-3.1-8B) | 5.1% | 11.2% | 86.1% |
Четыре модели из пяти уложились в порог 10%. Phi-2 показал лучший результат - 7.8% при 91.3% factual consistency. TinyLlama-1.1B не прошёл по hallucination rate (11.2%), что подтверждает: для задачи с жёсткими требованиями к точности 1.1B параметров недостаточно без квантизации. Порог входа - 1.6B параметров.
Эффективность инференса: скорость и память без квантизации
| Модель | VRAM (FP16) | Latency (сек/текст) | Throughput (текстов/сек) |
|---|---|---|---|
| Phi-2 | 5.4 GB | 0.34 | 23.5 |
| Gemma-2B | 4.0 GB | 0.28 | 28.6 |
| Qwen1.5-1.8B | 3.6 GB | 0.31 | 25.8 |
| StableLM-2-1.6B | 3.2 GB | 0.22 | 36.4 |
| TinyLlama-1.1B | 2.2 GB | 0.18 | 44.4 |
Все модели помещаются в 6 GB VRAM, что позволяет запускать инференс на GPU среднего уровня. StableLM-2-1.6B лидирует по throughput (36.4 текстов/сек), но уступает по качеству. Phi-2 даёт лучший баланс: 23.5 текстов/сек при hallucination rate 7.8%. Для обработки 90 млн текстов на одном GPU A6000 потребуется около 44 дней непрерывной работы - приемлемо для промышленного пайплайна.
Практические рекомендации и типичные ошибки при внедрении
Первое: проверяйте архитектуру модели до начала экспериментов. Мультимодальные версии часто маскируются под текстовые в названиях - читайте model card. Второе: тестируйте на своих данных, а не полагайтесь на общие бенчмарки. Evaluation awareness завышает метрики в model card на 20+ процентных пунктов - реальная производительность на специфическом домене может быть значительно ниже.
Третье: планируйте ресурсы под полную точность. Отказ от квантизации увеличивает требования к памяти в 2-4 раза, но это плата за hallucination rate <10%. Четвёртое: аудит учителя обязателен. Если учитель систематически ошибается на определённых типах входных данных, ученик воспроизведёт эти ошибки. Пятое: размер выборки для дистилляции важнее размера модели. 2 млн качественных примеров дают лучший результат, чем 10 млн зашумлённых.
Типичные ошибки: использование мультимодальных моделей для текстовых задач (нулевой результат гарантирован), игнорирование очистки данных (шум в обучающей выборке прямо коррелирует с hallucination rate ученика), недооценка влияния размера выборки (менее 500 тысяч примеров - риск переобучения и роста галлюцинаций), применение квантизации без замера влияния на точность (для компактных моделей потери значимы).