Перейти к содержанию
Публикация AiManual

Границы локального запуска Qwen3.8 2.4T: реалии квантизации UD-Q1_0 и требования к оборудованию в 2026 году

Энтузиаст запустил Qwen3.8 2.4T на двух RTX 5090 и трёх RTX 3090 с квантизацией UD-Q1_0. Итог — 0.25 токена в секунду и дефицит памяти вдвое. Разбираем, почему

Коротко

Что будет в материале

  1. 01

    Введение: почему запуск Qwen3.8 2.4T локально - это вызов

  2. 02

    Что такое квантизация UD-Q1_0 и зачем она нужна

  3. 03

    Оборудование для теста: RTX 5090, RTX 3090 и системная память

  4. 04

    Результаты запуска: 0.25 токена в секунду

Введение: почему запуск Qwen3.8 2.4T локально - это вызов

Qwen3.8 2.4T - модель с 2.4 триллиона параметров. Открытые веса дают сообществу доступ к архитектуре, которая ещё недавно существовала только внутри крупных лабораторий. Энтузиаст попытался запустить её на связке из двух RTX 5090, трёх RTX 3090 и 96 ГБ системной памяти. Результат - 0.25 токена в секунду. Модель полностью непригодна для практического использования на таком железе.

Квантизация UD-Q1_0 уменьшила размер модели до 397 ГБ. Это на 115 ГБ меньше стандартного IQ1_S. Даже с таким агрессивным сжатием требования к памяти превысили доступные объёмы вдвое без учёта контекста в 64K токенов. Локальный инференс моделей с триллионами параметров на потребительском оборудовании остаётся недостижимым.

В статье разбираем архитектурные ограничения, требования к VRAM и RAM, специфику форка llama.cpp для UD-Q1_0 и делаем выводы о реальной границе локального запуска. Если вы оцениваете целесообразность инвестиций в железо под гигантские модели, этот разбор даст конкретные цифры для решения. Похожий анализ для моделей с 2+ триллионами параметров мы уже делали в материале о Kimi K3.

Что такое квантизация UD-Q1_0 и зачем она нужна

UD-Q1_0 - экстремальный метод сжатия весов. Он снижает точность представления чисел до уровня, при котором модель занимает минимально возможный объём на диске и в памяти. Для Qwen3.8 2.4T это 397 ГБ вместо нескольких терабайт в исходном виде.

Цель такой квантизации - попытаться втиснуть модель в доступное железо. Стандартные методы вроде IQ1_S дают размер около 512 ГБ. UD-Q1_0 экономит 115 ГБ, но ценой дальнейшего падения качества ответов. Для теста производительности это не критично: важнее было проверить, запустится ли модель вообще.

Сравнение UD-Q1_0 с IQ1_S: размер и качество

Разница в 115 ГБ выглядит привлекательно, когда каждый гигабайт на счету. IQ1_S даёт файл примерно 512 ГБ. UD-Q1_0 сжимает до 397 ГБ. Потери качества при таком переходе значительные, но точных бенчмарков для модели такого масштаба пока нет: слишком мало людей могут её запустить даже в тестовом режиме.

Для работы с UD-Q1_0 требуется специальный форк llama.cpp. Стандартная сборка не поддерживает этот формат квантизации. Форк добавляет необходимые декодеры и оптимизации, но не решает фундаментальную проблему: модель всё равно не помещается в память.

Оборудование для теста: RTX 5090, RTX 3090 и системная память

Конфигурация теста: две RTX 5090, три RTX 3090 и 96 ГБ системной памяти. Суммарный объём VRAM - 2×32 ГБ + 3×24 ГБ = 136 ГБ. Плюс 96 ГБ RAM. Итого 232 ГБ быстрой памяти и 96 ГБ медленной.

Модель в квантизации UD-Q1_0 занимает 397 ГБ. Это превышает суммарный объём VRAM и RAM почти вдвое. Даже если бы вся память была доступна без накладных расходов, модель не поместилась бы целиком. А ведь нужен ещё контекст.

Требования к VRAM и RAM: почему памяти не хватает вдвое

397 ГБ весов плюс контекст 64K токенов. KV-кэш для такого контекста добавляет десятки гигабайт. Точные цифры зависят от архитектуры, но даже консервативная оценка даёт 450-500 ГБ суммарных требований. Доступно 232 ГБ VRAM и 96 ГБ RAM. Дефицит - более чем двукратный.

Единственный способ запустить модель - оффлоадинг части слоёв на CPU. Системная память работает на порядок медленнее VRAM. Обмен данными через PCIe добавляет задержки. Результат предсказуем: скорость упирается в пропускную способность самого медленного звена.

Результаты запуска: 0.25 токена в секунду

Модель загрузилась. Генерация пошла. Скорость - 0.25 токена в секунду. Это один токен за четыре секунды. Для сравнения: комфортное чтение требует хотя бы 10-15 токенов в секунду. Даже фоновые ночные задачи не имеют смысла при такой производительности.

Практический опыт с меньшими моделями показывает, насколько критична скорость. Qwen3.5 122B на 64 ГБ RAM даёт 2.9 токена в секунду, и это уже считается катастрофически медленным для агентских задач. 0.25 токена в секунду - это на порядок хуже.

Почему скорость такая низкая: анализ узких мест

Модель не помещается в VRAM. Часть слоёв обрабатывается на CPU. Каждый токен требует прохода через все слои, и данные постоянно перемещаются между GPU и системной памятью. Пропускная способность PCIe становится бутылочным горлышком.

Квантизация UD-Q1_0 добавляет вычислительные накладные расходы. Декодирование весов в таком формате требует дополнительных операций. На CPU это особенно болезненно. Итог: даже теоретический максимум производительности ограничен самым медленным компонентом системы.

Другой пример из нашей практики: Qwen3.6-27B на M4 Ultra выдаёт 20 токенов в секунду. Это модель в 90 раз меньше, чем Qwen3.8 2.4T. Разница в скорости - три порядка.

Практические выводы: граница локального инференса для моделей с триллионами параметров

Модели с 2.4 триллиона параметров не предназначены для потребительского оборудования. Даже экстремальная квантизация не спасает: требования к памяти превышают возможности топовых сборок вдвое. Скорость 0.25 токена в секунду исключает любое практическое применение.

Реальная граница локального инференса в 2026 году проходит в районе 100-200 миллиардов параметров с агрессивной квантизацией. Подборка моделей для систем до 256 ГБ ОЗУ показывает, что работоспособные варианты находятся именно в этом диапазоне. Для гигантов нужны кластеры или облачные сервисы.

Инвестиции в потребительское железо под будущие модели с триллионами параметров не окупаются. Даже топовые конфигурации с несколькими GPU не дают приемлемой производительности. Фокус смещается на гибридные решения: локально запускаются модели среднего размера, тяжёлые задачи уходят в облако.

Заключение: открытые веса как шаг для сообщества, но не для локального запуска

Открытие весов Qwen3.8 2.4T - значимый шаг для исследований. Сообщество получает доступ к архитектуре, которую можно изучать, дистиллировать, анализировать. Это ускоряет разработку новых методов сжатия и оптимизации.

Практическое использование на текущем потребительском железе невозможно. 0.25 токена в секунду - это не медленно, это неработоспособно. Для реальных задач используйте облачные платформы или модели меньшего размера. Технологии развиваются, но разрыв между гигантскими моделями и доступным железом пока только растёт.

Подписаться на канал