Перейти к содержанию
Публикация AiManual

llama-halo-hybrid: гибридный запуск LLM на Strix Halo и Radeon R9700 обходит DGX Spark

Открытый проект llama-halo-hybrid объединяет APU Strix Halo и Radeon R9700 в одну систему для локальных LLM: по словам автора, больше 60 tok/s на декодировании,

Коротко

Что будет в материале

  1. 01

    Что такое llama-halo-hybrid и как он работает

  2. 02

    Производительность: 60+ tok/s на декодировании и 2000+ tok/s на prefill

  3. 03

    Как подключить вторую GPU: PCIe, OcuLink, Thunderbolt

  4. 04

    Стоимость сборки: $5 тыс. за Strix 128GB + R9700 32GB против Gorgon Halo

Что такое llama-halo-hybrid и как он работает

llama-halo-hybrid от разработчика sixvolts - это модифицированный llama.cpp, который собирает из двух устройств одну систему для запуска больших языковых моделей. На дискретной видеокарте размещаются плотные части модели, KV-кэш и часть слоёв, остаток модели считает APU Strix Halo. В роли GPU-«сайдкара» в описании фигурирует Radeon R9700, но подойдут и аналогичные карты.

Смысл схемы в том, чтобы задействовать память и вычислители обоих устройств, а не упираться в лимиты одного. Объём unified memory у Strix Halo позволяет держать крупную модель, дискретная карта берёт на себя ту часть, где нужна скорость. В обновлении проекта автор уже приводит рабочие цифры, о которых речь ниже.

Чем это отличается от обычного llama.cpp

Нового движка здесь нет. Это тот же llama.cpp с изменённым механизмом распределения слоёв между APU и GPU. Автор формулирует прямо: проект запускает что угодно и не требует специального кванта, но заточен в основном под семейства Qwen и GLM. Обычные кванты, которые вы и так качаете под llama.cpp, остаются рабочими; меняется раскладка вычислений между устройствами.

Лицензия MIT, код полностью открыт, автор ничего не продаёт. Это упрощает проверку и снимает вопрос о скрытых платных уровнях.

Как распределяются слои между APU и GPU

Схема такая: плотные части модели, KV-кэш и часть слоёв уезжают на GPU, остаток модели тянет APU. Вычислительно тяжёлые куски получают дискретную карту, большой объём памяти APU держит то, что не требует пиковой пропускной способности. Как именно выбирается граница между устройствами, автор в посте не раскрывает; подбирать параметры придётся по документации проекта и под свою модель.

Производительность: 60+ tok/s на декодировании и 2000+ tok/s на prefill

Заявленные показатели: более 60 tok/s на декодировании, свыше 2000 tok/s на prefill и поддержка полного контекста 256k. Цифры приводит автор проекта (пост с обновлением), независимых замеров в этом материале нет. Проверять их стоит на своей машине, своей модели и своей длине контекста.

Prefill - это обработка промпта перед генерацией. 2000+ tok/s означают, что длинный контекст не превращает запрос в ожидание на десятки секунд. На больших документах и длинных системных промптах разница между сборками проявляется заметнее всего.

Другой пример узкой настройки под конкретное железо - движок Strata: на RTX 5070 с 12 ГБ VRAM он разгоняет Qwen3.8-Flash-Next примерно до 65 ток/с вместо 15 в обычном llama.cpp. Логика похожая: выжать больше из имеющегося железа за счёт того, как раскладываются вычисления.

Сравнение с DGX Spark на моделях Qwen

По словам sixvolts, после доработок связка работает лучше DGX Spark на Qwen-3.8-flash-next, причём обходится дешевле, а на варианте Swift-1.5 отрыв немного больше (источник заявления). Сравнение делает сам автор, стенд и методику он не описывает. Воспринимайте результат как ориентир, а не как независимый бенчмарк.

Какие кванты использовались в тестах

Большая часть тестирования шла на Q4/Q4_K_XL: автор выбрал этот уровень для баланса размера и качества. Практический вывод: 60+ tok/s и 2000+ tok/s prefill относятся в первую очередь к четырёхбитным квантам. На Q8 или на предельно сжатых квантах числа будут другими, и заранее неизвестно, в какую сторону они сдвинутся.

Как подключить вторую GPU: PCIe, OcuLink, Thunderbolt

Карту можно подключить тремя способами: PCIe-удлинитель (так это сделано у Framework Desktop), OcuLink или Thunderbolt-док. Выбор зависит от того, какая у вас машина и что в ней свободно.

У этих интерфейсов разная пропускная способность и разное поведение при постоянной нагрузке. PCIe-удлинитель даёт самый предсказуемый канал, OcuLink часто используют для внешних карт, Thunderbolt-док удобен, если корпус не позволяет держать карту внутри. KV-кэш и часть слоёв живут на GPU, поэтому обмен между устройствами идёт постоянно, а не только при загрузке модели.

Если карт планируется больше одной, заранее смотрите, как раскладываются линии PCIe. В разборе двух Radeon 7900 XT/XTX на X570/X870 Taichi разобрано, как схемы x8/x8, питание и выбор бэкенда влияют на такую сборку. Для гибрида это тоже актуально: от канала зависит подкачка слоёв.

Стоимость сборки: $5 тыс. за Strix 128GB + R9700 32GB против Gorgon Halo

Автор приводит оценку: сборка Strix 128 ГБ плюс R9700 32 ГБ обходится примерно в $5 тыс. целиком. Альтернатива с 192 ГБ памяти - материнская плата Gorgon Halo за $6469, и это цена только платы.

КонфигурацияПамятьЦенаЦена за ГБ
Strix 128 ГБ128 ГБ$3149$24.60
Gorgon Halo (только материнская плата)192 ГБ$6469$33.70

Расчёт цены за гигабайт памяти

Считаем по данным автора: $3149 за 128 ГБ Strix дают $24.60 за гигабайт, $6469 за 192 ГБ Gorgon Halo дают $33.70 за гигабайт. Gorgon Halo выходит дороже примерно в 1.3 раза. Автор отдельно отмечает, что дополнительные 64 ГБ памяти дают едва заметный прирост производительности. Если задача - получить максимум скорости и объёма за разумные деньги, гибридная сборка по этим цифрам выглядит выгоднее. Если нужен именно максимальный объём памяти на одной плате, вывод будет другим, и цена тут не единственный критерий.

Отдельная статья расходов - оплата зарубежных площадок, если компоненты или сервисы вы заказываете не в России. В таких случаях выручает виртуальная карта зарубежного банка: её выпускают дистанционно, пополняют рублями через СБП, а управление идёт через мессенджер.

Кому подходит llama-halo-hybrid, а кому нет

Главное ограничение озвучивает сам автор: для одиночного Strix Halo без внешней GPU инструмент, вероятно, не подходит. Если Strix Halo у вас уже есть и вы готовы добавить дискретную карту, схема становится осмысленной. Если карты нет и не планируется, смотрите в сторону других решений.

Ограничения и предостережения

  • Нужна вторая GPU. Без неё гибрид теряет смысл.
  • Заточка под Qwen и GLM. На других семействах моделей поведение не гарантировано, хотя запустить можно что угодно.
  • Тесты шли в основном на Q4/Q4_K_XL. Скорость на других квантах придётся измерять самому.
  • Все цифры производительности и сравнение с DGX Spark - заявления автора проекта, независимой проверки в этом материале нет.
  • Поддержка других «сайдкар» GPU пока не обещана: автор готов заняться тюнингом при наличии спроса и доступа к железу.
  • Контекст 256k расходует память под KV-кэш, поэтому запас стоит считать под свою модель, длину промпта и число одновременных сессий.

Альтернатива для одиночного Strix Halo: gufo

Тем, у кого только Strix Halo, автор советует gufo. Деталей по этому инструменту в источнике нет, так что держите его в списке кандидатов и проверяйте под свою задачу. Общие соображения о том, брать ли Strix Halo сейчас и чего ждать от новых платформ, собраны в материале стоит ли покупать Strix Halo сейчас.

Как запустить llama-halo-hybrid: практические шаги

Проект открыт под MIT, код доступен для сборки. Логика запуска: собрать модифицированный llama.cpp под свою связку, взять обычные кванты уровня Q4/Q4_K_XL, выставить нужную длину контекста (вплоть до 256k) и распределить слои между APU и GPU.

Конкретные команды, версии зависимостей и параметры сборки зависят от вашей ОС, драйверов и модели, а в исходном посте их нет. Ориентируйтесь на документацию проекта. Если работаете именно со Strix Halo, пригодится разбор запуска Qwen3.8-Flash-Next через Vulkan в llama.cpp: unified memory, AMDGPU и сборка нужного форка разобраны по шагам и с ограничениями.

Начинайте с модели и кванта, на которых автор получал свои цифры: семейство Qwen и Q4/Q4_K_XL. Так вы хотя бы воспроизводите известную конфигурацию, а не ищете вслепую.

Перспективы: поддержка других GPU и развитие проекта

sixvolts готов разбираться с тюнингом под другие «сайдкар» GPU, кроме R9700, если будет спрос и доступ к железу. Сроков и конкретных планов он не называет. Проект открытый, поэтому на приоритеты влияет сообщество: запросы и тесты на другой карте - реальный рычаг.

Практический итог. Если у вас есть Strix Halo и вы рассматриваете вторую карту, посчитайте три числа: цену связки (ориентир $5 тыс. за 128 ГБ плюс R9700 32 ГБ), цену за гигабайт против Gorgon Halo ($24.60 против $33.70) и скорость на вашей модели в Q4. Когда модель из семейства Qwen или GLM и вы готовы собирать llama.cpp из исходников, гибрид стоит попробовать на своих задачах. Если нет, начните с gufo и других инструментов под одиночный Strix Halo.

Подписаться на канал