Введение: почему запуск Qwen3.8 2.4T локально - это вызов
Qwen3.8 2.4T - модель с 2.4 триллиона параметров. Открытые веса дают сообществу доступ к архитектуре, которая ещё недавно существовала только внутри крупных лабораторий. Энтузиаст попытался запустить её на связке из двух RTX 5090, трёх RTX 3090 и 96 ГБ системной памяти. Результат - 0.25 токена в секунду. Модель полностью непригодна для практического использования на таком железе.
Квантизация UD-Q1_0 уменьшила размер модели до 397 ГБ. Это на 115 ГБ меньше стандартного IQ1_S. Даже с таким агрессивным сжатием требования к памяти превысили доступные объёмы вдвое без учёта контекста в 64K токенов. Локальный инференс моделей с триллионами параметров на потребительском оборудовании остаётся недостижимым.
В статье разбираем архитектурные ограничения, требования к VRAM и RAM, специфику форка llama.cpp для UD-Q1_0 и делаем выводы о реальной границе локального запуска. Если вы оцениваете целесообразность инвестиций в железо под гигантские модели, этот разбор даст конкретные цифры для решения. Похожий анализ для моделей с 2+ триллионами параметров мы уже делали в материале о Kimi K3.
Что такое квантизация UD-Q1_0 и зачем она нужна
UD-Q1_0 - экстремальный метод сжатия весов. Он снижает точность представления чисел до уровня, при котором модель занимает минимально возможный объём на диске и в памяти. Для Qwen3.8 2.4T это 397 ГБ вместо нескольких терабайт в исходном виде.
Цель такой квантизации - попытаться втиснуть модель в доступное железо. Стандартные методы вроде IQ1_S дают размер около 512 ГБ. UD-Q1_0 экономит 115 ГБ, но ценой дальнейшего падения качества ответов. Для теста производительности это не критично: важнее было проверить, запустится ли модель вообще.
Сравнение UD-Q1_0 с IQ1_S: размер и качество
Разница в 115 ГБ выглядит привлекательно, когда каждый гигабайт на счету. IQ1_S даёт файл примерно 512 ГБ. UD-Q1_0 сжимает до 397 ГБ. Потери качества при таком переходе значительные, но точных бенчмарков для модели такого масштаба пока нет: слишком мало людей могут её запустить даже в тестовом режиме.
Для работы с UD-Q1_0 требуется специальный форк llama.cpp. Стандартная сборка не поддерживает этот формат квантизации. Форк добавляет необходимые декодеры и оптимизации, но не решает фундаментальную проблему: модель всё равно не помещается в память.
Оборудование для теста: RTX 5090, RTX 3090 и системная память
Конфигурация теста: две RTX 5090, три RTX 3090 и 96 ГБ системной памяти. Суммарный объём VRAM - 2×32 ГБ + 3×24 ГБ = 136 ГБ. Плюс 96 ГБ RAM. Итого 232 ГБ быстрой памяти и 96 ГБ медленной.
Модель в квантизации UD-Q1_0 занимает 397 ГБ. Это превышает суммарный объём VRAM и RAM почти вдвое. Даже если бы вся память была доступна без накладных расходов, модель не поместилась бы целиком. А ведь нужен ещё контекст.
Требования к VRAM и RAM: почему памяти не хватает вдвое
397 ГБ весов плюс контекст 64K токенов. KV-кэш для такого контекста добавляет десятки гигабайт. Точные цифры зависят от архитектуры, но даже консервативная оценка даёт 450-500 ГБ суммарных требований. Доступно 232 ГБ VRAM и 96 ГБ RAM. Дефицит - более чем двукратный.
Единственный способ запустить модель - оффлоадинг части слоёв на CPU. Системная память работает на порядок медленнее VRAM. Обмен данными через PCIe добавляет задержки. Результат предсказуем: скорость упирается в пропускную способность самого медленного звена.
Результаты запуска: 0.25 токена в секунду
Модель загрузилась. Генерация пошла. Скорость - 0.25 токена в секунду. Это один токен за четыре секунды. Для сравнения: комфортное чтение требует хотя бы 10-15 токенов в секунду. Даже фоновые ночные задачи не имеют смысла при такой производительности.
Практический опыт с меньшими моделями показывает, насколько критична скорость. Qwen3.5 122B на 64 ГБ RAM даёт 2.9 токена в секунду, и это уже считается катастрофически медленным для агентских задач. 0.25 токена в секунду - это на порядок хуже.
Почему скорость такая низкая: анализ узких мест
Модель не помещается в VRAM. Часть слоёв обрабатывается на CPU. Каждый токен требует прохода через все слои, и данные постоянно перемещаются между GPU и системной памятью. Пропускная способность PCIe становится бутылочным горлышком.
Квантизация UD-Q1_0 добавляет вычислительные накладные расходы. Декодирование весов в таком формате требует дополнительных операций. На CPU это особенно болезненно. Итог: даже теоретический максимум производительности ограничен самым медленным компонентом системы.
Другой пример из нашей практики: Qwen3.6-27B на M4 Ultra выдаёт 20 токенов в секунду. Это модель в 90 раз меньше, чем Qwen3.8 2.4T. Разница в скорости - три порядка.
Практические выводы: граница локального инференса для моделей с триллионами параметров
Модели с 2.4 триллиона параметров не предназначены для потребительского оборудования. Даже экстремальная квантизация не спасает: требования к памяти превышают возможности топовых сборок вдвое. Скорость 0.25 токена в секунду исключает любое практическое применение.
Реальная граница локального инференса в 2026 году проходит в районе 100-200 миллиардов параметров с агрессивной квантизацией. Подборка моделей для систем до 256 ГБ ОЗУ показывает, что работоспособные варианты находятся именно в этом диапазоне. Для гигантов нужны кластеры или облачные сервисы.
Инвестиции в потребительское железо под будущие модели с триллионами параметров не окупаются. Даже топовые конфигурации с несколькими GPU не дают приемлемой производительности. Фокус смещается на гибридные решения: локально запускаются модели среднего размера, тяжёлые задачи уходят в облако.
Заключение: открытые веса как шаг для сообщества, но не для локального запуска
Открытие весов Qwen3.8 2.4T - значимый шаг для исследований. Сообщество получает доступ к архитектуре, которую можно изучать, дистиллировать, анализировать. Это ускоряет разработку новых методов сжатия и оптимизации.
Практическое использование на текущем потребительском железе невозможно. 0.25 токена в секунду - это не медленно, это неработоспособно. Для реальных задач используйте облачные платформы или модели меньшего размера. Технологии развиваются, но разрыв между гигантскими моделями и доступным железом пока только растёт.