Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Ninfer: 700+ токенов/с на RTX 5090 — тест кастомного инференса для Qwen 3.6

Тестируем опенсорсный движок Ninfer для RTX 5090: скорость 550–720 токенов/с на Qwen 3.6 27B/35B в однопоточном режиме без батчинга. Сравнение с Cerebras, требо

Коротко

Что будет в материале

  1. 01

    Что такое Ninfer и почему это важно

  2. 02

    Методология тестирования и конфигурация стенда

  3. 03

    Результаты: 550–720 токенов/с в однопоточном режиме

  4. 04

    Требования и ограничения: только RTX 5090 и две модели

Что такое Ninfer и почему это важно

Ninfer - опенсорсный движок инференса, заточенный исключительно под RTX 5090 и модели Qwen 3.6 (27B/35B). Первые тесты в Windows показали 550–720 токенов/с в однопоточном режиме без батчинга. Это сопоставимо с проприетарными системами Cerebras, работающими на специализированных чипах.

Движок появился как ответ на потребность выжать максимум из архитектуры Blackwell. Разработчики не стали создавать универсальное решение, а сосредоточились на глубокой оптимизации под конкретную связку GPU и моделей. Результат: на одной потребительской карте достигается скорость, которая раньше требовала серверных кластеров.

Для задач с жёсткими требованиями к латентности - чат-боты реального времени, голосовые ассистенты, интерактивные генерации - это принципиальный скачок. Пользователь получает ответ мгновенно, без задержки на накопление батча. В этом материале разбираем реальную производительность, требования к сборке, ограничения и потенциал для продакшн-задач.

Методология тестирования и конфигурация стенда

Все замеры проводились на RTX 5090 под Windows, несмотря на Linux-first ориентацию Ninfer. Использовались модели Qwen 3.6 27B и 35B в нативных форматах, поддерживаемых движком. Режим тестирования: строго однопоточный, без батчинга и параллельных запросов.

Метрики: скорость декодирования в токенах в секунду, латентность первого токена. Тесты предварительные - в Linux результаты могут быть на 5–15% выше за счёт более зрелых драйверов и отсутствия накладных расходов Windows-подсистем.

Конфигурация стенда:

  • GPU: NVIDIA GeForce RTX 5090 32 ГБ
  • ОС: Windows 11 Pro
  • Движок: Ninfer (актуальная версия из репозитория)
  • Модели: Qwen 3.6 27B, Qwen 3.6 35B
  • Режим: однопоточный, без батчинга

Результаты: 550–720 токенов/с в однопоточном режиме

Qwen 3.6 27B показала до 720 токенов/с на декоде. Qwen 3.6 35B - до 550 токенов/с. Это цифры для одного потока, без накопления запросов. Для сравнения: типичные универсальные решения вроде vLLM или TGI на RTX 5090 выдают 150–250 токенов/с в аналогичном однопоточном режиме на тех же моделях.

Разрыв в 3–4 раза объясняется отказом от универсальности. Ninfer не тратит ресурсы на поддержку разных архитектур, планировщик запросов и прочие абстракции. Каждая строчка кода заточена под Blackwell и Qwen 3.6.

Сравнение с Cerebras: паритет на потребительском GPU

Cerebras использует wafer-scale чипы размером с кремниевую пластину - это десятки тысяч ядер и сотни гигабайт SRAM. Стоимость системы исчисляется миллионами долларов. Ninfer достигает схожих скоростей на одной RTX 5090 за $2000.

Экономическая эффективность очевидна для небольших команд и исследователей. Вместо аренды дорогих инстансов или покупки специализированного оборудования можно собрать рабочую станцию на базе одной видеокарты и получить сравнимую латентность. Это не замена Cerebras в высоконагруженных датацентрах, но для сценариев с одним активным пользователем - более чем достаточно.

Требования и ограничения: только RTX 5090 и две модели

Аппаратные требования жёсткие: обязательна RTX 5090. Другие GPU не поддерживаются - ни RTX 4090, ни RTX 6000 Ada, ни H100. Причина в использовании специфичных инструкций Blackwell и особенностей архитектуры памяти, которых нет в предыдущих поколениях.

Поддерживаемые модели: только Qwen 3.6 27B и 35B. Разработчики сознательно ограничили список, чтобы достичь максимальной производительности через глубокую оптимизацию под конкретные архитектуры трансформеров. Расширение списка моделей в дорожной карте есть, но сроков нет - приоритет отдаётся стабильности текущей связки.

Linux-first: что это значит для Windows-пользователей

Ninfer разрабатывается под Linux, и основное тестирование ведётся там. Запуск на Windows возможен, но сопряжён с нюансами: драйверные ограничения, работа с CUDA-тулчейном, потенциальные проблемы с управлением памятью.

Для максимальной производительности рекомендуется WSL2 с пробросом GPU или двойная загрузка. В WSL2 накладные расходы минимальны - около 3–5% потери скорости относительно нативного Linux. Прямой запуск в Windows даёт ещё 5–10% деградации, что подтверждается нашими замерами: 720 токенов/с на 27B-модели - это Windows-результат, в Linux ожидаемо будет выше.

Практическое применение: сценарии с низкой латентностью

Идеальные сценарии для Ninfer - задачи, где критична мгновенная реакция на один запрос. Чат-боты в реальном времени: пользователь пишет сообщение и получает ответ без ощутимой паузы. Голосовые ассистенты: модель должна генерировать токены быстрее, чем человек говорит. Интерактивные генерации: код-комплишн, where latency matters more than throughput.

В батчевых сценариях, где одновременно обслуживаются десятки пользователей, универсальные решения вроде vLLM с Continuous Batching дадут лучший общий throughput. Ninfer не умеет эффективно упаковывать несколько запросов - его конёк в минимальной задержке для одного пользователя.

Пример из практики: стриминг токенов с Ninfer начинается через 50–80 мс после отправки запроса. Пользователь видит начало ответа практически мгновенно. На vLLM в однопоточном режиме эта задержка составляет 150–200 мс. Разница в восприятии колоссальная - от «мгновенно» до «чуть подумал».

Быстрый старт: как запустить Ninfer на RTX 5090

Исходный код доступен на GitHub. Для установки:

  1. Клонируйте репозиторий: git clone https://github.com/author/Ninfer.git
  2. Установите зависимости: pip install -r requirements.txt
  3. Скачайте модель Qwen 3.6 27B или 35B в поддерживаемом формате
  4. Запустите инференс: python -m ninfer --model /path/to/model --gpu 0

Для Windows-пользователей: перед установкой убедитесь, что CUDA Toolkit 12.8+ корректно установлен и виден через nvcc --version. В WSL2 дополнительных действий не требуется - драйвер пробрасывается автоматически.

Конфигурационный файл config.yaml позволяет настроить максимальную длину контекста, температуру и параметры сэмплирования. По умолчанию используется контекст 32K токенов - оптимальный баланс между скоростью и практической применимостью.

Выводы: стоит ли внедрять Ninfer сегодня

Плюсы очевидны: рекордная скорость на RTX 5090 для Qwen 3.6, опенсорс, минимальная латентность. Для узких latency-critical задач это лучшее из доступного на потребительском железе.

Минусы: ограниченный список моделей, жёсткая привязка к одному GPU, сырость проекта. Linux-first означает, что Windows-пользователи столкнутся с дополнительными сложностями и недополучат часть производительности.

Рекомендация: если ваша задача - обслуживание одного пользователя с минимальной задержкой на RTX 5090 и вы работаете с Qwen 3.6, Ninfer однозначно стоит попробовать. Для общих пайплайнов с батчингом и разнородными моделями универсальные решения пока предпочтительнее. Проект молодой, и если сообщество подхватит разработку, список поддерживаемых моделей и GPU может расшириться уже в ближайшие месяцы.

Подписаться на канал