Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Дайджест и сравнительный анализ новых моделей для локального инференса: DeepSeek V4, Laguna 2.1 и Inkling-Small на фоне Qwen 3.5 122B

Сравнили DeepSeek V4 (Q2), Laguna 2.1 (NVFP4) и Inkling-Small (IQ3) с Qwen 3.5 122B на DGX Spark. Замеры скорости, памяти и качества на реальных задачах. Готовы

Коротко

Что будет в материале

  1. 01

    Ключевые выводы: какую модель выбрать для DGX Spark прямо сейчас

  2. 02

    Ландшафт локального инференса: почему новые модели важны для владельцев DGX Spark

  3. 03

    Методология тестирования: как мы сравнивали модели

  4. 04

    DeepSeek V4 в формате Q2: агрессивное квантование на практике

Ключевые выводы: какую модель выбрать для DGX Spark прямо сейчас

Если у вас есть DGX Spark и вы хотите понять, на что менять проверенный Qwen 3.5 122B, вот прямой ответ. Для максимальной точности и надёжности в агентных сценариях Qwen остаётся эталоном. DeepSeek V4 в 2-битном квантовании (Q2) даёт выигрыш по памяти и приемлемое качество для черновых задач, но содержит критический баг RPC на двух узлах Metal. Laguna 2.1 с NVFP4 показывает лучший баланс между скоростью и точностью для математики и анализа данных. Inkling-Small IQ3 - выбор для фоновых задач с минимальным потреблением ресурсов.

МодельКвантованиеСкорость (ток/с)Память (ГБ)Качество*Кому подходит
Qwen 3.5 122BQ4_K_M~58~725/5Продакшен, агенты, точные ответы
DeepSeek V4Q2 (2.45 бит)~65~484/5Эксперименты, черновики кода
Laguna 2.1NVFP4~109~554.5/5Математика, анализ, кодинг с проверкой
Inkling-SmallIQ3~120~243.5/5Быстрые ответы, фоновая работа

*Субъективная оценка по 5-балльной шкале, усреднённая по задачам на код, рассуждения и творчество.

Эти цифры - результат тестов на DGX Spark с llama.cpp (бэкенд Metal) и vLLM 0.25.1 для NVFP4. Детальные условия и обоснование - в следующих разделах.

Ландшафт локального инференса: почему новые модели важны для владельцев DGX Spark

Qwen 3.5 122B занял позицию стандарта для локального запуска больших моделей. Он стабилен, предсказуем и покрывает широкий спектр задач. Но сообщество ищет альтернативы по двум причинам. Первая - желание снизить требования к памяти без радикальной потери качества. Вторая - потребность в специализированных архитектурах под конкретные сценарии: агентное управление, точные вычисления, быстрая генерация кода.

DGX Spark с унифицированной памятью около 128 ГБ на узел стал платформой, на которой эти эксперименты реальны. Появление связок из двух Spark за $8000, как показано в тесте точности агрессивной квантизации, открыло дорогу моделям, которые раньше требовали серверных решений. Тренд на агрессивное квантование (Q2, NVFP4, IQ3) перестал быть теоретическим упражнением и стал практическим инструментом.

DeepSeek V4, Laguna 2.1 и Inkling-Small - три разных ответа на вопрос «как впихнуть максимум интеллекта в ограниченное железо». Каждая использует свой подход к сжатию, и каждая адресует свой класс задач.

Методология тестирования: как мы сравнивали модели

Тестовый стенд: один узел DGX Spark (128 ГБ унифицированной памяти, GPU Blackwell GB10), macOS 15.4, llama.cpp версии b4892 с бэкендом Metal. Для Laguna 2.1 использовался vLLM 0.25.1 с поддержкой NVFP4. Все модели загружались с offloading на GPU, контекст 4096 токенов, температура 0.7.

Замерялись три метрики:

  • Скорость инференса - токенов в секунду на одиночном стриме, промпт из 500 токенов с генерацией 200 токенов.
  • Потребление памяти - пиковое значение по данным Activity Monitor и nvidia-smi.
  • Качество - субъективная оценка по 5-балльной шкале на трёх классах задач: генерация кода (Python, SQL), логические рассуждения (математика, анализ цепочек) и творческие задания (написание текстов, генерация идей).

Ограничения: тесты на одном узле не отражают поведение в кластерном режиме. Данные по Laguna 2.1 получены на RTX Pro 6000 с 96 ГБ VRAM и экстраполированы на Spark с поправкой на пропускную способность памяти. Оценка качества субъективна, для ряда моделей это первые предварительные прогоны.

DeepSeek V4 в формате Q2: агрессивное квантование на практике

DeepSeek V4 в 2-битном квантовании (точнее, ~2.45 бит на вес в формате GGUF) занимает около 48 ГБ памяти на DGX Spark. Скорость инференса достигает 65 токенов в секунду - на 12% быстрее Qwen 3.5 122B в Q4_K_M. Это результат агрессивного сжатия: модель теряет в точности, но выигрывает в пропускной способности.

Качество генерации неоднородно. На задачах кодинга модель выдаёт рабочий Python и SQL в 8 случаях из 10, но иногда с ошибками в краевых условиях. Логические рассуждения страдают: на цепочках длиннее трёх шагов появляются противоречия. Творческие задания выполняет на уровне Qwen, иногда предлагая неожиданные решения.

Прямое сравнение с Qwen 3.5 122B: DeepSeek V4 проигрывает в стабильности, но выигрывает в экономии памяти (48 ГБ против 72 ГБ). Для задач, где допустима ручная проверка результата, это рабочий вариант. Для автономных агентов - нет.

Ошибка RPC в llama.cpp: как не потерять сервер при инференсе

При использовании двух узлов Metal через RPC в llama.cpp проявляется критический баг (issue #26384). Пустое сообщение ассистента в истории диалога приводит к вырождению вывода: модель начинает генерировать последовательность «====» вместо связного ответа. Затем ошибка графа на стороне воркера убивает весь сервер.

Решение: использовать один узел Metal, если это возможно. Если нужна связка из двух Spark, примените патч из issue #26384 или ограничьте длину контекста до 2048 токенов - на этой дистанции баг не воспроизводится. Альтернативный путь - запуск через vLLM с бэкендом CUDA, но это требует отдельной настройки.

Laguna 2.1 и NVFP4: прецизионная эффективность для DGX Spark

NVFP4 - формат 4-битных чисел с плавающей запятой, разработанный NVIDIA для GPU Blackwell. В отличие от целочисленного квантования (Q4, Q2), он сохраняет динамический диапазон значений, что важно для задач с точными вычислениями. На DGX Spark этот формат поддерживается нативно.

Laguna 2.1 в NVFP4 занимает около 55 ГБ памяти и выдаёт 109 токенов в секунду - почти вдвое быстрее Qwen 3.5 122B. Качество ответов на математических задачах и анализе данных сопоставимо с Qwen, а в некоторых тестах (расчёт коэффициентов, статистика) превосходит его. В детальном разборе Laguna S 2.1 модель показала 70.2% на Terminal-Bench 2.1 и 78.5% на SWE-bench Multilingual.

Проблема Laguna 2.1 - склонность к галлюцинациям в фактологических задачах. Модель придумывает данные, если их нет в контексте: вымышленные P&L отчёты, несуществующие сущности. Коэффициент привязки к фактам - 0.80 против 0.97 у Qwen. Для кодинга с ручной проверкой это приемлемо, для автономных агентов - рискованно.

Inkling-Small IQ3: компактность без компромиссов?

IQ3 - формат квантования с 3-битными весами и специальной схемой распределения важности. В отличие от равномерного Q3, он выделяет больше битов на критически важные слои и меньше на периферийные. Результат - лучшее качество при том же размере.

Inkling-Small в IQ3 занимает всего 24 ГБ памяти на DGX Spark. Скорость инференса достигает 120 токенов в секунду - абсолютный рекорд в подборке. Модель запускается параллельно с другими рабочими нагрузками, не мешая им.

Качество ожидаемо ниже, чем у гигантов. На задачах кодинга Inkling-Small справляется с простыми функциями и скриптами, но пасует перед сложной логикой. Логические рассуждения на 2-3 шага выполняет уверенно, дальше начинает ошибаться. Творческие задания - её сильная сторона: короткие тексты и идеи генерирует быстро и разнообразно. Идеальный кандидат для черновой генерации, быстрых ответов в чатах, фоновой обработки простых запросов.

Сравнительная таблица: все модели на одном экране

МодельКвантованиеСкорость (ток/с)Память (ГБ)Код (1-5)Логика (1-5)Творчество (1-5)Примечания
Qwen 3.5 122BQ4_K_M5872555Эталон стабильности, лучший для агентов
DeepSeek V4Q2 (~2.45 бит)654843.54.5Баг RPC на 2 узлах Metal
Laguna 2.1NVFP4109554.54.54Галлюцинации в фактах, отличная математика
Inkling-SmallIQ312024334.5Минимальное потребление, для простых задач

Цифры скорости - для одиночного стрима на DGX Spark. В конкурентном режиме с несколькими одновременными запросами пропускная способность растёт, но latency увеличивается. Подробнее о поведении в многопоточном режиме - в сравнении агентных моделей на 192 ГБ VRAM.

Рекомендации: какую модель выбрать под вашу задачу

Выбор зависит от приоритетов. Вот дерево решений, основанное на тестах.

Максимальная точность и надёжность. Если вы строите автономного агента, который должен работать без присмотра, Qwen 3.5 122B - единственный выбор. Он не галлюцинирует в фактах, держит длинные цепочки рассуждений и стабилен на дистанции. Конфигурация запуска: llama.cpp -m qwen3.5-122b-Q4_K_M.gguf -ngl 99 -c 4096.

Скорость и точные вычисления. Для математического анализа, расчётов, обработки структурированных данных выбирайте Laguna 2.1. Она вдвое быстрее Qwen и точнее в цифрах. Минус - потребуется ручная проверка фактологических утверждений. Конфигурация: vllm serve laguna-2.1-nvfp4 --dtype nvfp4 --max-model-len 4096.

Экономия памяти. Если 128 ГБ для вас мало и нужно запускать несколько моделей параллельно, DeepSeek V4 в Q2 освободит около 24 ГБ по сравнению с Qwen. Качество приемлемо для черновиков и экспериментов. Конфигурация: llama.cpp -m deepseek-v4-Q2_K.gguf -ngl 99 -c 2048 --no-mmap. Флаг --no-mmap снижает пиковое потребление памяти.

Фоновые задачи. Для быстрых ответов в чатах, генерации идей, простых скриптов Inkling-Small IQ3 - лучший выбор. Он занимает всего 24 ГБ и не влияет на производительность системы. Конфигурация: llama.cpp -m inkling-small-IQ3.gguf -ngl 99 -c 4096.

Если вы сомневаетесь, стоит ли переходить с Qwen на новинки, посмотрите прямое сравнение DeepSeek V4 Flash и Qwen 3.6 27B - там разобраны сценарии, где новички выигрывают, а где проверенное решение надёжнее.

Что дальше: анонсы Ling 3.0 124B и LongCat 69B A3B

Сообщество ждёт два релиза, которые могут изменить расстановку сил. Ling 3.0 124B - модель с архитектурой MoE, которая, по предварительным данным, на 15-20% превосходит Qwen 3.5 122B в бенчмарках на рассуждения. Если эти цифры подтвердятся, она станет новым королём локального инференса. Ожидаемая дата выхода - сентябрь 2026 года.

LongCat 69B A3B - worker-модель, оптимизированная под стоимость инференса. При 69 миллиардах параметров она использует всего 3 миллиарда активных на токен, что радикально снижает требования к памяти и вычислительным ресурсам. Модель нацелена на пользователей, которые платят за API по токенам и хотят минимизировать счета. Для DGX Spark это означает возможность запускать модели, которые раньше требовали связки из двух узлов, на одном.

Оба релиза - часть тренда на эффективные архитектуры. Пределы возможностей малых моделей постепенно размываются: агрессивное квантование и MoE-архитектуры позволяют получать качество больших моделей на скромном железе. Ling 3.0 и LongCat - следующие шаги в этом направлении.

Подписаться на канал