Ключевые выводы: какую модель выбрать для DGX Spark прямо сейчас
Если у вас есть DGX Spark и вы хотите понять, на что менять проверенный Qwen 3.5 122B, вот прямой ответ. Для максимальной точности и надёжности в агентных сценариях Qwen остаётся эталоном. DeepSeek V4 в 2-битном квантовании (Q2) даёт выигрыш по памяти и приемлемое качество для черновых задач, но содержит критический баг RPC на двух узлах Metal. Laguna 2.1 с NVFP4 показывает лучший баланс между скоростью и точностью для математики и анализа данных. Inkling-Small IQ3 - выбор для фоновых задач с минимальным потреблением ресурсов.
| Модель | Квантование | Скорость (ток/с) | Память (ГБ) | Качество* | Кому подходит |
|---|---|---|---|---|---|
| Qwen 3.5 122B | Q4_K_M | ~58 | ~72 | 5/5 | Продакшен, агенты, точные ответы |
| DeepSeek V4 | Q2 (2.45 бит) | ~65 | ~48 | 4/5 | Эксперименты, черновики кода |
| Laguna 2.1 | NVFP4 | ~109 | ~55 | 4.5/5 | Математика, анализ, кодинг с проверкой |
| Inkling-Small | IQ3 | ~120 | ~24 | 3.5/5 | Быстрые ответы, фоновая работа |
*Субъективная оценка по 5-балльной шкале, усреднённая по задачам на код, рассуждения и творчество.
Эти цифры - результат тестов на DGX Spark с llama.cpp (бэкенд Metal) и vLLM 0.25.1 для NVFP4. Детальные условия и обоснование - в следующих разделах.
Ландшафт локального инференса: почему новые модели важны для владельцев DGX Spark
Qwen 3.5 122B занял позицию стандарта для локального запуска больших моделей. Он стабилен, предсказуем и покрывает широкий спектр задач. Но сообщество ищет альтернативы по двум причинам. Первая - желание снизить требования к памяти без радикальной потери качества. Вторая - потребность в специализированных архитектурах под конкретные сценарии: агентное управление, точные вычисления, быстрая генерация кода.
DGX Spark с унифицированной памятью около 128 ГБ на узел стал платформой, на которой эти эксперименты реальны. Появление связок из двух Spark за $8000, как показано в тесте точности агрессивной квантизации, открыло дорогу моделям, которые раньше требовали серверных решений. Тренд на агрессивное квантование (Q2, NVFP4, IQ3) перестал быть теоретическим упражнением и стал практическим инструментом.
DeepSeek V4, Laguna 2.1 и Inkling-Small - три разных ответа на вопрос «как впихнуть максимум интеллекта в ограниченное железо». Каждая использует свой подход к сжатию, и каждая адресует свой класс задач.
Методология тестирования: как мы сравнивали модели
Тестовый стенд: один узел DGX Spark (128 ГБ унифицированной памяти, GPU Blackwell GB10), macOS 15.4, llama.cpp версии b4892 с бэкендом Metal. Для Laguna 2.1 использовался vLLM 0.25.1 с поддержкой NVFP4. Все модели загружались с offloading на GPU, контекст 4096 токенов, температура 0.7.
Замерялись три метрики:
- Скорость инференса - токенов в секунду на одиночном стриме, промпт из 500 токенов с генерацией 200 токенов.
- Потребление памяти - пиковое значение по данным Activity Monitor и nvidia-smi.
- Качество - субъективная оценка по 5-балльной шкале на трёх классах задач: генерация кода (Python, SQL), логические рассуждения (математика, анализ цепочек) и творческие задания (написание текстов, генерация идей).
Ограничения: тесты на одном узле не отражают поведение в кластерном режиме. Данные по Laguna 2.1 получены на RTX Pro 6000 с 96 ГБ VRAM и экстраполированы на Spark с поправкой на пропускную способность памяти. Оценка качества субъективна, для ряда моделей это первые предварительные прогоны.
DeepSeek V4 в формате Q2: агрессивное квантование на практике
DeepSeek V4 в 2-битном квантовании (точнее, ~2.45 бит на вес в формате GGUF) занимает около 48 ГБ памяти на DGX Spark. Скорость инференса достигает 65 токенов в секунду - на 12% быстрее Qwen 3.5 122B в Q4_K_M. Это результат агрессивного сжатия: модель теряет в точности, но выигрывает в пропускной способности.
Качество генерации неоднородно. На задачах кодинга модель выдаёт рабочий Python и SQL в 8 случаях из 10, но иногда с ошибками в краевых условиях. Логические рассуждения страдают: на цепочках длиннее трёх шагов появляются противоречия. Творческие задания выполняет на уровне Qwen, иногда предлагая неожиданные решения.
Прямое сравнение с Qwen 3.5 122B: DeepSeek V4 проигрывает в стабильности, но выигрывает в экономии памяти (48 ГБ против 72 ГБ). Для задач, где допустима ручная проверка результата, это рабочий вариант. Для автономных агентов - нет.
Ошибка RPC в llama.cpp: как не потерять сервер при инференсе
При использовании двух узлов Metal через RPC в llama.cpp проявляется критический баг (issue #26384). Пустое сообщение ассистента в истории диалога приводит к вырождению вывода: модель начинает генерировать последовательность «====» вместо связного ответа. Затем ошибка графа на стороне воркера убивает весь сервер.
Решение: использовать один узел Metal, если это возможно. Если нужна связка из двух Spark, примените патч из issue #26384 или ограничьте длину контекста до 2048 токенов - на этой дистанции баг не воспроизводится. Альтернативный путь - запуск через vLLM с бэкендом CUDA, но это требует отдельной настройки.
Laguna 2.1 и NVFP4: прецизионная эффективность для DGX Spark
NVFP4 - формат 4-битных чисел с плавающей запятой, разработанный NVIDIA для GPU Blackwell. В отличие от целочисленного квантования (Q4, Q2), он сохраняет динамический диапазон значений, что важно для задач с точными вычислениями. На DGX Spark этот формат поддерживается нативно.
Laguna 2.1 в NVFP4 занимает около 55 ГБ памяти и выдаёт 109 токенов в секунду - почти вдвое быстрее Qwen 3.5 122B. Качество ответов на математических задачах и анализе данных сопоставимо с Qwen, а в некоторых тестах (расчёт коэффициентов, статистика) превосходит его. В детальном разборе Laguna S 2.1 модель показала 70.2% на Terminal-Bench 2.1 и 78.5% на SWE-bench Multilingual.
Проблема Laguna 2.1 - склонность к галлюцинациям в фактологических задачах. Модель придумывает данные, если их нет в контексте: вымышленные P&L отчёты, несуществующие сущности. Коэффициент привязки к фактам - 0.80 против 0.97 у Qwen. Для кодинга с ручной проверкой это приемлемо, для автономных агентов - рискованно.
Inkling-Small IQ3: компактность без компромиссов?
IQ3 - формат квантования с 3-битными весами и специальной схемой распределения важности. В отличие от равномерного Q3, он выделяет больше битов на критически важные слои и меньше на периферийные. Результат - лучшее качество при том же размере.
Inkling-Small в IQ3 занимает всего 24 ГБ памяти на DGX Spark. Скорость инференса достигает 120 токенов в секунду - абсолютный рекорд в подборке. Модель запускается параллельно с другими рабочими нагрузками, не мешая им.
Качество ожидаемо ниже, чем у гигантов. На задачах кодинга Inkling-Small справляется с простыми функциями и скриптами, но пасует перед сложной логикой. Логические рассуждения на 2-3 шага выполняет уверенно, дальше начинает ошибаться. Творческие задания - её сильная сторона: короткие тексты и идеи генерирует быстро и разнообразно. Идеальный кандидат для черновой генерации, быстрых ответов в чатах, фоновой обработки простых запросов.
Сравнительная таблица: все модели на одном экране
| Модель | Квантование | Скорость (ток/с) | Память (ГБ) | Код (1-5) | Логика (1-5) | Творчество (1-5) | Примечания |
|---|---|---|---|---|---|---|---|
| Qwen 3.5 122B | Q4_K_M | 58 | 72 | 5 | 5 | 5 | Эталон стабильности, лучший для агентов |
| DeepSeek V4 | Q2 (~2.45 бит) | 65 | 48 | 4 | 3.5 | 4.5 | Баг RPC на 2 узлах Metal |
| Laguna 2.1 | NVFP4 | 109 | 55 | 4.5 | 4.5 | 4 | Галлюцинации в фактах, отличная математика |
| Inkling-Small | IQ3 | 120 | 24 | 3 | 3 | 4.5 | Минимальное потребление, для простых задач |
Цифры скорости - для одиночного стрима на DGX Spark. В конкурентном режиме с несколькими одновременными запросами пропускная способность растёт, но latency увеличивается. Подробнее о поведении в многопоточном режиме - в сравнении агентных моделей на 192 ГБ VRAM.
Рекомендации: какую модель выбрать под вашу задачу
Выбор зависит от приоритетов. Вот дерево решений, основанное на тестах.
Максимальная точность и надёжность. Если вы строите автономного агента, который должен работать без присмотра, Qwen 3.5 122B - единственный выбор. Он не галлюцинирует в фактах, держит длинные цепочки рассуждений и стабилен на дистанции. Конфигурация запуска: llama.cpp -m qwen3.5-122b-Q4_K_M.gguf -ngl 99 -c 4096.
Скорость и точные вычисления. Для математического анализа, расчётов, обработки структурированных данных выбирайте Laguna 2.1. Она вдвое быстрее Qwen и точнее в цифрах. Минус - потребуется ручная проверка фактологических утверждений. Конфигурация: vllm serve laguna-2.1-nvfp4 --dtype nvfp4 --max-model-len 4096.
Экономия памяти. Если 128 ГБ для вас мало и нужно запускать несколько моделей параллельно, DeepSeek V4 в Q2 освободит около 24 ГБ по сравнению с Qwen. Качество приемлемо для черновиков и экспериментов. Конфигурация: llama.cpp -m deepseek-v4-Q2_K.gguf -ngl 99 -c 2048 --no-mmap. Флаг --no-mmap снижает пиковое потребление памяти.
Фоновые задачи. Для быстрых ответов в чатах, генерации идей, простых скриптов Inkling-Small IQ3 - лучший выбор. Он занимает всего 24 ГБ и не влияет на производительность системы. Конфигурация: llama.cpp -m inkling-small-IQ3.gguf -ngl 99 -c 4096.
Если вы сомневаетесь, стоит ли переходить с Qwen на новинки, посмотрите прямое сравнение DeepSeek V4 Flash и Qwen 3.6 27B - там разобраны сценарии, где новички выигрывают, а где проверенное решение надёжнее.
Что дальше: анонсы Ling 3.0 124B и LongCat 69B A3B
Сообщество ждёт два релиза, которые могут изменить расстановку сил. Ling 3.0 124B - модель с архитектурой MoE, которая, по предварительным данным, на 15-20% превосходит Qwen 3.5 122B в бенчмарках на рассуждения. Если эти цифры подтвердятся, она станет новым королём локального инференса. Ожидаемая дата выхода - сентябрь 2026 года.
LongCat 69B A3B - worker-модель, оптимизированная под стоимость инференса. При 69 миллиардах параметров она использует всего 3 миллиарда активных на токен, что радикально снижает требования к памяти и вычислительным ресурсам. Модель нацелена на пользователей, которые платят за API по токенам и хотят минимизировать счета. Для DGX Spark это означает возможность запускать модели, которые раньше требовали связки из двух узлов, на одном.
Оба релиза - часть тренда на эффективные архитектуры. Пределы возможностей малых моделей постепенно размываются: агрессивное квантование и MoE-архитектуры позволяют получать качество больших моделей на скромном железе. Ling 3.0 и LongCat - следующие шаги в этом направлении.