Сравнение производительности LLM на домашнем ПК: короткий ответ
На домашнем ПК с RTX 5090 и 192 ГБ RAM скорость локальной LLM определяется связкой из нескольких факторов: поколением архитектуры, движком инференса, квантованием, размещением модели в памяти и режимом драфтинга. Практический тест Qwen3.8-27B, DeepSeek-V4-Flash, GLM-5.3-Flash и Qwen3.8-Flash-Next показал, что номинальный размер модели не позволяет заранее выстроить надежный рейтинг скорости.
В сравнении использовались llama.cpp, Ninfer и FreeToken. Один и тот же класс настроек может дать разный результат в зависимости от выбранного движка и поддержки конкретной архитектуры. Драфтеры MTP и DSpark тоже не дают гарантированного ускорения: в одной связке они сокращают время генерации, в другой добавляют накладные расходы и замедляют ответ.
Точные значения скорости в токенах в секунду, версии движков и полный набор параметров запуска в доступном описании теста не приведены. Поэтому материал позволяет зафиксировать инженерные выводы и порядок выбора, но не дает универсального рейтинга моделей по одной цифре.
Почему размер модели не дает полного прогноза скорости
Номинальное число параметров описывает масштаб модели, но не показывает всю цепочку вычислений при генерации. На итог влияют архитектура, активная часть модели, формат весов, работа конкретного движка и то, где находятся данные во время инференса.
Поколение модели в этом тесте оказалось более информативным ориентиром, чем простое сравнение размеров. Более новая архитектура может генерировать быстрее сопоставимой по классу модели, если движок хорошо ее поддерживает и выбран подходящий формат квантования. Обратная ситуация тоже возможна.
Сравнение двух файлов модели без фиксации движка, квантования и режима памяти смешивает несколько разных причин. Полученная разница в скорости тогда не показывает, что именно повлияло на результат.
Главный вывод для владельца мощного домашнего ПК
Перед локальным запуском LLM полезно пройти короткую последовательность выбора:
- Определить задачу: чат, генерация кода, суммаризация, работа с длинным контекстом или агентный сценарий.
- Задать приемлемую скорость ответа и понять, нужна ли максимальная скорость decode.
- Выбрать модель с учетом поколения и архитектуры, а не только числа параметров.
- Проверить доступные варианты квантования и нагрузку на VRAM и RAM.
- Сравнить одну и ту же связку в llama.cpp, Ninfer или FreeToken, если модель поддерживается несколькими движками.
- Измерить режим без драфтера, затем отдельно проверить MTP или DSpark.
Практический разбор запуска Qwen3.8-27B на одной RTX 5090 помогает дополнить эту методику конкретными вопросами к замерам: где выполняется prefill, где проходит decode, как учитываются KV-кэш и offload. Отдельный разбор Qwen3.8-27B на RTX 5090 посвящен именно такой проверке условий.
Тестовый стенд и методика запуска LLM на RTX 5090
Конфигурация домашнего компьютера
Известная конфигурация теста состоит из двух компонентов:
- графический процессор RTX 5090;
- оперативная память объемом 192 ГБ.
В исходных материалах не указаны процессор, накопители, операционная система, версии драйверов и точный объем VRAM. Эти параметры нельзя восстанавливать по названию видеокарты или заменять типовыми характеристиками. Они способны повлиять на prefill, загрузку весов, стабильность и поведение моделей с большим контекстом.
Тест относится к мощному домашнему ПК, но его результаты не переносятся на любую систему с похожим названием видеокарты. Разница в объеме доступной памяти, фоновой нагрузке и версии движка способна изменить итоговую скорость.
Какие модели и движки вошли в сравнение
В набор моделей вошли четыре участника:
- Qwen3.8-27B, базовая точка сравнения для крупной локальной модели;
- DeepSeek-V4-Flash, вариант для проверки влияния квантования и общей производительности;
- GLM-5.3-Flash, модель для сравнения режима с MTP и без него;
- Qwen3.8-Flash-Next, отдельное поколение, которое нужно оценивать с учетом архитектуры.
Программная часть включала llama.cpp, Ninfer и FreeToken. Модель и движок здесь нужно считать одной экспериментальной связкой. Если поменять движок, меняются поддержка формата, распределение нагрузки, работа с памятью и доступность драфтера.
Полный список пар в формате модель плюс движок в переданном описании не указан. Поэтому нельзя приписывать конкретную скорость Qwen3.8-27B, DeepSeek-V4-Flash, GLM-5.3-Flash или Qwen3.8-Flash-Next одному движку без отдельной записи замера.
Какие показатели нужно сопоставлять
Скорость генерации важна, но одной цифры недостаточно. Результат нужно читать вместе с моделью, форматом весов, размещением в памяти и режимом драфтинга.
| Показатель | Что известно по тесту | Как интерпретировать |
|---|---|---|
| Скорость генерации | Скорость сравнивалась, точные значения не переданы | Без числа токенов в секунду нельзя строить абсолютный рейтинг |
| Движок | Использовались llama.cpp, Ninfer и FreeToken | Разницу нужно связывать с поддержкой модели и настройками запуска |
| Квантование | Его влияние входило в анализ | Название каждого проверенного формата и его численный эффект не указаны |
| Размещение в памяти | Учитывалось размещение модели в VRAM и RAM | Точная доля данных в каждом типе памяти не приведена |
| Драфтер | Проверялись MTP и DSpark | Режим с драфтером нужно сопоставлять с запуском без него на той же модели |
| Качество и стабильность | Формальные оценки не переданы | Скорость нельзя выдавать за показатель качества ответа |
Такая таблица показывает границу доступных данных. Она фиксирует направления сравнения, но не подменяет журнал эксперимента с запросами, контекстом, версиями программ и численными результатами.
Qwen3.8-27B vs DeepSeek-V4-Flash vs GLM-5.3-Flash: результаты сравнения моделей
Все четыре модели вошли в общий практический разбор, однако одинаковые условия для каждой пары в доступном описании не зафиксированы. Без этого корректнее говорить о наблюдаемых направлениях теста, а не о строгом месте каждой модели в рейтинге.
| Модель | Главный вопрос теста | Подтвержденный вывод |
|---|---|---|
| Qwen3.8-27B | Базовая скорость и поведение в локальном запуске | Модель использовалась как отправная точка, численная скорость не приведена |
| DeepSeek-V4-Flash | Влияние квантования на практический результат | Квантование нужно оценивать вместе с движком и памятью, конкретные варианты не названы |
| GLM-5.3-Flash | Сравнение MTP и режима без драфтера | Проверка драфтинга проводилась, точная разница в скорости не передана |
| Qwen3.8-Flash-Next | Влияние нового поколения архитектуры | Поколение модели нужно учитывать отдельно от номинального размера |
Qwen3.8-27B: базовая точка сравнения
Qwen3.8-27B удобно использовать как отправную точку, потому что вокруг этой модели можно разложить влияние движка, квантования и памяти. Само обозначение 27B не говорит, какую скорость получит пользователь на конкретном компьютере.
Для корректного сравнения Qwen3.8-27B нужно запускать в сопоставимом режиме с другими моделями: одинаковый тип нагрузки, близкий размер контекста, один и тот же подход к замеру decode и одинаковое правило учета драфтера. В противном случае итоговая цифра смешивает свойства модели с настройками программного стека.
По доступному описанию точное значение скорости Qwen3.8-27B не приведено. Поэтому модель можно использовать как базовую позицию методики, но нельзя назвать ее лидером или аутсайдером без исходной таблицы замеров.
DeepSeek-V4-Flash: влияние квантования на практический результат
DeepSeek-V4-Flash вошла в сравнение как пример, на котором нужно отдельно смотреть на формат весов. Квантование уменьшает объем представления модели и меняет требования к памяти, но итоговая скорость зависит от того, как конкретный формат обрабатывает выбранный движок.
В доступных материалах не названы варианты квантования DeepSeek-V4-Flash, точные значения скорости и результаты проверки качества. Поэтому нельзя утверждать, что конкретный формат обязательно дает лучший баланс или обязательно ухудшает ответы.
Практическая схема проверки выглядит так: выбрать несколько доступных форматов, оставить неизменными запрос, контекст, движок и режим памяти, затем измерить скорость и отдельно проверить качество на рабочих примерах. Одна цифра decode не заменяет оценку полезности модели.
GLM-5.3-Flash: поведение с драфтером и без него
Для GLM-5.3-Flash проверялся режим с MTP и запуск без MTP. Это полезное сопоставление, поскольку драфтер предлагает основной модели кандидаты продолжения, а затем основная модель проверяет принятые токены.
Ускорение зависит от согласованности драфтера с архитектурой, стоимости проверки кандидатов и поддержки этой схемы в движке. Если кандидаты часто отклоняются или дополнительные вычисления оказываются дорогими, режим с MTP способен замедлить генерацию.
Точная скорость GLM-5.3-Flash в обоих режимах в переданном описании отсутствует. Поэтому нельзя честно заявить конкретный прирост или конкретное замедление. Подтвержденный вывод ограничен самим наблюдением: MTP нужно измерять рядом с базовым запуском, а не включать автоматически.
Qwen3.8-Flash-Next: почему новое поколение важно учитывать отдельно
Qwen3.8-Flash-Next нужно сравнивать с Qwen3.8-27B через фактическую производительность связки, а не через название и номинальный размер. Новое поколение архитектуры может изменить требования к движку, памяти и драфтеру.
Отдельный материал о поведении Qwen3.8-Flash-Next на сервере с большим объемом RAM помогает сформулировать правильные вопросы к такому запуску: где выполняется prefill, как меняется decode при росте контекста и насколько чувствительна модель к ограниченной GPU. Разбор Qwen3.8-Flash-Next на сервере с большой RAM рассматривает эти условия отдельно.
Архитектурные особенности модели тоже требуют отдельного контекста. Материал об устройстве Qwen3.8-Flash-Next помогает не смешивать обсуждение поколения модели с формальным рейтингом скорости.
Численная скорость Qwen3.8-Flash-Next в переданном описании не указана. Поэтому корректный вывод звучит так: новую архитектуру нужно включать в сравнение отдельной строкой и проверять на том же железе, но универсальное превосходство над другими моделями из этих данных не следует.
Движки инференса: llama.cpp, Ninfer и FreeToken
llama.cpp как точка практического сравнения
llama.cpp вошел в набор проверяемых движков и может служить отправной точкой для локального запуска, если выбранная модель и формат поддерживаются. Его присутствие в тесте не делает полученные цифры универсальным эталоном для Ninfer или FreeToken.
Для сравнения через llama.cpp нужно зафиксировать модель, квантование, размер контекста, режим размещения и наличие драфтера. Полный набор этих параметров в исходном описании не передан, поэтому конкретные значения скорости через llama.cpp нельзя восстановить.
Связка Qwen3.8-27B и llama.cpp полезна как пример методически аккуратного замера: меняется один фактор, а остальные остаются постоянными. Если одновременно сменить модель и движок, результат перестает показывать влияние одного изменения.
Ninfer и FreeToken: что меняется при специализированном запуске
Ninfer и FreeToken были включены в практическое сравнение как отдельные движки. Их результат зависит от того, какую архитектуру, квантование, схему памяти и драфтер поддерживает конкретный запуск.
Разница между движками может появиться из-за формата весов, способа распределения вычислений, работы с VRAM и RAM или накладных расходов драфтинга. Приписывать весь выигрыш одной функции движка без одинакового набора условий нельзя.
Для каждого запуска полезно записывать модель, формат квантования, тип памяти, режим с драфтером или без него, вид нагрузки и единицы измерения. Такая запись отделяет реальное преимущество связки от разницы в настройках.
Почему цифры разных движков нельзя сравнивать без контекста
Строки с одинаковой единицей измерения еще не делают два результата сопоставимыми. Для честного сравнения рядом с числом нужны следующие данные:
- точное название модели и ее вариант;
- формат квантования;
- движок и его версия;
- расположение модели в VRAM и RAM;
- размер и заполненность контекста;
- наличие MTP, DSpark или другого драфтера;
- тип нагрузки, например prefill или decode;
- единицы измерения и правило подсчета скорости.
В исходном тесте зафиксировано влияние этих факторов, но полный журнал значений не передан. Поэтому сравнение движков здесь показывает направление анализа, а не чистый рейтинг программ.
Квантование и память: что влияет на скорость локального запуска
Квантование: не только способ уменьшить размер модели
Квантование меняет представление весов и требования к памяти. При этом один формат может лучше подходить конкретному движку, а другой потребует иной схемы загрузки или даст другой баланс между объемом данных и скоростью обработки.
В случае DeepSeek-V4-Flash квантование вынесено в отдельный вопрос теста. Названия проверенных вариантов и численные различия между ними в доступном описании не указаны. По этой причине нельзя приписывать конкретному формату определенный прирост скорости или потерю качества.
Вопросы к квантованию особенно важны для моделей с дополнительными слоями или нестандартными компонентами. Разбор точечной замены N-gram-слоя Qwen3.8-Next на Q8 показывает, почему изменение одного компонента нужно оценивать через память, скорость и поведение offload одновременно. Материал о замене N-gram-слоя Qwen3.8-Next посвящен этому типу проверки.
Размещение модели в VRAM и RAM
В тесте использовался ПК с RTX 5090 и 192 ГБ RAM, а размещение модели в памяти рассматривалось как отдельный фактор. Точная доля весов в VRAM и RAM не передана, поэтому нельзя восстановить, какие компоненты каждой модели находились на видеокарте.
Когда часть вычислений или данных уходит в оперативную память, скорость может зависеть от обмена между компонентами системы. Полное размещение в VRAM и смешанный режим отвечают разным ограничениям: первый требует достаточного объема видеопамяти, второй позволяет загрузить более крупную модель, но может изменить темп генерации.
Большой объем RAM помогает запускать тяжелые модели, но сам по себе не гарантирует скорость, сопоставимую с полностью локальным размещением на GPU. Этот вывод переносится как инженерное правило, а конкретный эффект нужно замерять для каждой модели.
Как читать компромисс между скоростью, памятью и качеством
| Приоритет | Практическое действие | Ограничение |
|---|---|---|
| Максимальная скорость | Сравнить модель и движок в одинаковом режиме, затем проверить драфтер | Самый быстрый режим может требовать больше VRAM или подходить одному поколению хуже другого |
| Экономия памяти | Проверить доступные варианты квантования и смешанное размещение в VRAM и RAM | Точная цена по скорости зависит от формата и движка |
| Качество ответа | Проверить модель на собственных рабочих запросах рядом с замером скорости | В исходном тесте нет формальной оценки качества |
| Стабильность | Повторить запуск с одинаковым контекстом и нагрузкой | Доступное описание не содержит длительных тестов стабильности |
Для локального запуска LLM на RTX 5090 этот компромисс нужно оценивать под конкретный сценарий. Чат с короткими запросами, генерация кода и работа с длинным контекстом создают разную нагрузку, поэтому одна настройка не подходит всем задачам.
Драфтеры MTP и DSpark: ускорение зависит от архитектуры
Что именно сравнивается в режиме с драфтером
Драфтер предлагает несколько кандидатов продолжения, после чего основная модель проверяет их. Если кандидаты часто принимаются, генерация может ускориться. Если проверка стоит дорого или кандидаты плохо совпадают с продолжением основной модели, дополнительные вычисления способны снизить скорость.
Сравнение должно проходить на одной модели, с одним движком, тем же контекстом и одинаковым типом запроса. Менять сразу модель и режим драфтинга нельзя: результат не покажет, что именно повлияло на decode.
MTP: где ожидание ускорения не подтвердилось
Для GLM-5.3-Flash проверялся MTP в сравнении с режимом без драфтера. Сам факт включения MTP не подтверждает ускорение. Его эффект зависит от архитектуры GLM-5.3-Flash, качества кандидатов и того, как движок обрабатывает проверку.
В переданном описании нет конкретных значений скорости для двух режимов. Поэтому нельзя указывать процент ускорения или замедления и нельзя объявлять MTP обязательной настройкой для GLM-5.3-Flash.
Практический вывод для пользователя простой: сначала измерить базовый запуск без MTP, затем включить MTP и сравнить среднюю скорость на одинаковых запросах. Если результат хуже, базовый режим остается более рациональным для этой связки.
DSpark: отдельный результат, а не универсальная настройка
DSpark упоминается среди драфтеров, которые влияли на итоговую скорость тестируемых моделей. Точная модель, режим запуска и численный эффект DSpark в доступных материалах не указаны.
DSpark и MTP нельзя считать взаимозаменяемыми переключателями с одинаковым поведением. Для каждого режима нужно отдельно проверить совместимость с архитектурой, поддержку движка и результат без драфтера.
Отсутствие конкретной цифры не позволяет назвать DSpark лучшим или худшим подходом. Подтверждено другое: драфтинг нужно измерять на связке модель плюс движок плюс настройки памяти.
Какую LLM выбрать для локального запуска на своем ПК
Если приоритетом является скорость генерации
Доступные материалы не содержат численной таблицы, поэтому назвать одну модель самым быстрым вариантом нельзя. Выбор нужно делать по фактическому замеру конкретной связки, а не по размеру Qwen3.8-27B, DeepSeek-V4-Flash, GLM-5.3-Flash или Qwen3.8-Flash-Next.
Начните с запуска без драфтера. Затем отдельно проверьте MTP или DSpark на той же модели. Для каждого результата сохраните движок, квантование, режим памяти и тип нагрузки. Такой порядок быстро показывает, дает ли драфтер реальную пользу.
Если важнее вместить модель в доступную память
Сначала нужно определить, какой вариант квантования и какое размещение реально поддерживает выбранный движок. В тесте влияние этих параметров подтверждено, но конкретные форматы и их численные потери скорости в переданном описании не указаны.
Если модель помещается только при использовании RAM, сравните ее с режимом, где доступная часть весов находится в VRAM. При этом фиксируйте скорость генерации отдельно от факта успешной загрузки. Запущенная модель не обязательно дает приемлемый темп ответа.
Если нужен баланс скорости и качества
Формальной оценки качества ответов для четырех моделей не передано. Поэтому выбор по качеству нельзя выдавать за результат этого теста.
Для рабочего баланса используйте двухэтапную проверку: сначала отберите связки, которые укладываются в доступную память и дают приемлемую скорость, затем прогоните одинаковый набор собственных запросов. В него стоит включить генерацию кода, суммаризацию и задачи, ради которых запускается локальная LLM. Скорость без полезности ответа мало помогает в реальной работе.
Что проверить перед запуском другой модели
- Поддерживает ли выбранный движок архитектуру модели и нужный формат весов.
- Какие варианты квантования доступны для этой связки.
- Хватает ли VRAM и RAM для загрузки модели с нужным контекстом.
- Как модель ведет себя при полном размещении на GPU и при смешанном режиме, если оба варианта доступны.
- Есть ли совместимый MTP или DSpark и можно ли отключить драфтер для контрольного замера.
- Какова скорость без драфтера на том же запросе.
- Сохраняется ли приемлемое качество ответов на собственных задачах.
Этот список переносит методику теста на другой компьютер, но не переносит конкретные цифры. Результаты относятся к стенду с RTX 5090 и 192 ГБ RAM.
Ограничения теста и как не переоценить результаты
Какие выводы можно переносить на другие системы
На другой компьютер можно перенести несколько инженерных правил:
- модель нужно сравнивать вместе с движком, а не отдельно от него;
- квантование нужно оценивать с учетом памяти и формата;
- размещение в VRAM и RAM нужно фиксировать рядом со скоростью;
- драфтер нужно проверять в сравнении с режимом без него;
- поколение и архитектура могут сильнее влиять на скорость, чем номинальный размер.
Эти правила относятся к методике. Место Qwen3.8-27B, DeepSeek-V4-Flash, GLM-5.3-Flash и Qwen3.8-Flash-Next в рейтинге, равно как и конкретные значения скорости, зависят от тестового стенда.
Каких данных не хватает для универсального рейтинга
Для воспроизводимого сравнения нужны сведения, которых нет в доступном описании:
- численные результаты скорости генерации для каждой модели;
- точные варианты квантования;
- версии llama.cpp, Ninfer и FreeToken;
- полный набор параметров запуска;
- размер и содержимое тестового контекста;
- распределение модели между VRAM и RAM;
- точные режимы MTP и DSpark;
- отдельные оценки качества и стабильности.
Поэтому этот материал корректно читать как разбор личного практического опыта на конкретном домашнем компьютере, а не как академический бенчмарк. Он помогает выбрать, что измерять перед локальным запуском новой LLM, но не заменяет собственную проверку на рабочей нагрузке.
Главное практическое действие после чтения, собрать для выбранной модели короткую таблицу с движком, квантованием, памятью, драфтером и скоростью без него. Такой замер даст больше пользы, чем сравнение номинальных размеров моделей по паспорту.