Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Сборка на 4× RTX 3080 20 ГБ для кода: реальные бенчмарки Qwen3.6-27B и сравнение с 4× RTX 5060 Ti

4× RTX 3080 20 ГБ выдают 69 токенов/с на Qwen3.6-27B с контекстом 256K. Сборка за $2000 против гипотетических RTX 5060 Ti: сравниваем память, скорость и точност

Коротко

Что будет в материале

  1. 01

    Ключевые результаты: 69 токенов/с на Qwen3.6-27B с контекстом 256K

  2. 02

    Почему 4× RTX 3080 20 ГБ? Преимущества перед новыми картами

  3. 03

    Тестовая конфигурация: железо, платформа и софт

  4. 04

    Настройка инференса: MTP, KV-кэш и полный контекст

Практическое тестирование на Vast AI показало: четыре RTX 3080 с 20 ГБ видеопамяти выдают 69 токенов в секунду на декодинге Qwen3.6-27B. Префилл достигает 893 токенов в секунду. Контекст - почти полные 256 тысяч токенов с включённым Multi-Token Prediction (MTP). Сборка обходится примерно в $2000, что делает её прямой альтернативой гипотетической конфигурации из четырёх RTX 5060 Ti с 16 ГБ памяти.

Ключевые результаты: 69 токенов/с на Qwen3.6-27B с контекстом 256K

Инференс 27-миллиардной модели с полноценным KV-кэшем и минимальным квантованием - задача, которая ломает большинство бюджетных конфигураций. Тест на Vast AI с четырьмя RTX 3080 20 ГБ даёт конкретные цифры:

  • Скорость декодирования: 69 токенов/с с включённым MTP.
  • Скорость префилла: 893 токена/с при выключенном кэше промптов.
  • Контекст: 256 тыс. токенов, почти максимальный для Qwen3.6-27B.
  • Точность: модель загружена с минимальным квантованием, KV-кэш хранится полностью.

Для генерации кода 69 токенов/с - это комфортная скорость. Метод класса или функция появляются за секунду-две. Полный скрипт на 200 строк генерируется за 10-15 секунд. Префилл в 893 токена/с обрабатывает 10 тысяч строк кода за 11 секунд - быстрее, чем вы пролистаете файл глазами.

Результат получен на облачной платформе Vast AI, что важно: цифры воспроизводимы, конфигурация не привязана к конкретному «золотому» экземпляру железа. Локальная сборка с теми же компонентами даст сравнимые показатели при условии адекватного охлаждения и настройки окружения.

Почему 4× RTX 3080 20 ГБ? Преимущества перед новыми картами

Четыре карты дают 80 ГБ суммарной видеопамяти. Модель Qwen3.6-27B в точности BF16 занимает около 54 ГБ. Оставшиеся 26 ГБ уходят на KV-кэш для контекста в 256 тыс. токенов. RTX 5060 Ti с 16 ГБ на борту даже в конфигурации 4× даёт только 64 ГБ - модель придётся квантовать агрессивнее, а KV-кэш сжимать или выгружать в оперативную память. Потеря точности при генерации кода критична: модель начинает путать синтаксис, пропускать закрывающие скобки, выдумывать несуществующие API. Разбор memory-bound архитектуры RTX 5060 Ti подтверждает: узкое место новых карт - именно объём и пропускная способность памяти, а не вычислительные ядра.

Пропускная способность памяти RTX 3080 составляет 760 ГБ/с. Четыре карты в параллели дают агрегированную полосу около 3 ТБ/с. Инференс LLM - memory-bound операция, где каждый токен требует чтения всей модели из памяти. 80 ГБ с быстрым доступом решают задачу радикально эффективнее, чем 64 ГБ с offloading'ом.

Сравнение стоимости: $2000 за всю сборку против гипотетической цены RTX 5060 Ti

Раскладка затрат на сборку:

  • 4× RTX 3080 20 ГБ по $400 = $1600.
  • Материнская плата X99 с четырьмя слотами PCIe 3.0 x16, процессор, 64 ГБ ОЗУ = $275.
  • Блок питания, корпус, накопитель = $125.
  • Итого: ~$2000.

RTX 5060 Ti на старте продаж ожидаются по цене от $450 до $550 за штуку. Четыре карты - $1800-2200 только за видеоускорители. Добавьте материнскую плату с поддержкой PCIe 5.0, более дорогой процессор и DDR5 - полная сборка уйдёт за $2800-3200. При этом вы получите на 16 ГБ меньше суммарной памяти и неизвестную реальную производительность. Опыт сборки на двух RTX 3080 20GB показывает: цена за гигабайт памяти у старших карт прошлого поколения остаётся лучшей на рынке.

Тестовая конфигурация: железо, платформа и софт

Точные компоненты тестового стенда:

  • GPU: 4× NVIDIA RTX 3080 20 ГБ (модифицированные версии с удвоенным объёмом памяти).
  • Материнская плата: X99 с четырьмя слотами PCIe 3.0 x16 (электрически x16 на каждый слот).
  • Процессор: Intel Xeon E5-2600 v3/v4, 8-12 ядер.
  • ОЗУ: 64 ГБ DDR4 ECC Registered.
  • Платформа: Vast AI (облачная аренда).
  • Софт: vLLM, драйверы NVIDIA 550+, CUDA 12.4.

Vast AI использован для чистоты эксперимента. Аренда изолирует тест от проблем локальной сборки: кривого райзера, перегрева VRM, нестабильного блока питания. Код запуска и конфигурационные файлы выложены в открытом доступе, ссылка - в разделе выводов.

Почему PCIe 3.0 x16 не стал узким местом

Тензорный параллелизм при инференсе передаёт между картами только активации и градиенты внимания - единицы мегабайт на слой. Полоса PCIe 3.0 x16 составляет 16 ГБ/с. Этого достаточно для синхронизации четырёх карт с запасом в 20-30 раз. Узкое место - память каждой отдельной карты и её пропускная способность, а не межсоединения. Для обучения ситуация обратная: градиенты весов гоняются на каждом шаге, и PCIe 3.0 становится бутылочным горлышком. Но для инференса 27B-модели - нет.

Настройка инференса: MTP, KV-кэш и полный контекст

Multi-Token Prediction - техника, при которой модель предсказывает не один следующий токен, а сразу несколько (в случае Qwen3.6 - до трёх). Это снижает количество итераций декодирования и поднимает скорость на 30-50%. Бенчмарк MTP на RTX 5090 детально разбирает, когда технология даёт прирост, а когда её лучше отключить. В нашем тесте MTP включён и стабильно работает на всём диапазоне контекста.

KV-кэш хранится полностью, без квантования. Это принципиально: сжатие KV-кэша экономит память, но снижает точность на длинных последовательностях. Модель начинает «забывать» начало кодовой базы, путать имена переменных, нарушать логику программы. 80 ГБ суммарной памяти позволяют держать полный кэш для 256 тыс. токенов без компромиссов.

Ключевые параметры запуска vLLM:

tensor_parallel_size = 4
max_model_len = 262144
enable_chunked_prefill = True
max_num_batched_tokens = 32768
gpu_memory_utilization = 0.92
enforce_eager = False
speculative_model = "mtp"
num_speculative_tokens = 3

Контекст в 256 тыс. токенов достигнут нативной поддержкой Qwen3.6-27B - модель из коробки поддерживает 256K через YaRN-масштабирование RoPE. Никаких хаков с позиционным кодированием не потребовалось.

Влияние MTP на скорость: 69 токенов/с - это много или мало?

Одна RTX 3090 с 24 ГБ на Qwen3.6-27B с тернарной квантизацией выдаёт около 60 токенов/с, но с урезанным до 100 тыс. токенов KV-кэшем и потерей точности. Облачные API вроде Together AI или Fireworks дают 40-55 токенов/с на моделях класса 27B при оплате за токен. 69 токенов/с на собственной сборке с полным контекстом - это уровень премиальных облачных инстансов за $3-5 в час, но с фиксированной стоимостью владения.

Сравнение с 4× RTX 5060 Ti: предположения и риски

На июль 2026 года RTX 5060 Ti ещё не вышли на рынок. Все сравнения строятся на спецификациях и архитектурных предположениях. Известно: карты получат 16 ГБ GDDR7, шину 128 бит, пропускную способность около 448 ГБ/с. Четыре карты - 64 ГБ суммарно и 1.8 ТБ/с агрегированной полосы.

Модель Qwen3.6-27B в BF16 требует 54 ГБ. На 64 ГБ остаётся 10 ГБ под KV-кэш - этого хватит на контекст в 40-50 тыс. токенов, а не 256 тыс. Для полного контекста придётся либо квантовать модель до 4 бит (потеря точности на коде), либо квантовать KV-кэш (деградация на длинных последовательностях), либо выгружать кэш в CPU (падение скорости в 3-5 раз). Каждый вариант бьёт по качеству генерации кода.

Цена RTX 5060 Ti ожидается в диапазоне $450-550. Четыре карты - $1800-2200. Добавьте платформу с PCIe 5.0 и DDR5 - полная сборка перевалит за $2800. При этом реальные бенчмарки инференса отсутствуют, а ранние тесты двух RTX 5060 Ti показывают утилизацию всего 50% из-за memory-bound ограничений. Ставка на проверенную конфигурацию с RTX 3080 20 ГБ выглядит рациональнее.

Ограничения и подводные камни: что нужно знать перед сборкой

RTX 3080 20 ГБ - редкая модификация. Стандартная RTX 3080 имеет 10 или 12 ГБ. Версии на 20 ГБ выпускались ограниченными партиями для китайского рынка и майнинговых ферм. Найти четыре штуки в хорошем состоянии - квест. Карты с Alibaba или вторичного рынка часто приходят с изношенными вентиляторами и высохшей термопастой. Бюджет на обслуживание - ещё $50-100 на карту.

Энергопотребление: каждая RTX 3080 потребляет до 320 Вт под нагрузкой. Четыре карты - 1280 Вт только на GPU. Добавьте процессор и потери - блок питания нужен на 1600-2000 Вт с качественной многоканальной линией 12V. Охлаждение: четыре карты в одном корпусе требуют либо открытого стенда, либо серверного шасси с продуваемыми перегородками и промышленными вентиляторами. Шум - 60-70 дБ, в жилой комнате некомфортно.

Для обучения моделей сборка неоптимальна. PCIe 3.0 x16 даёт 16 ГБ/с на карту, в то время как обучение с data parallel или model parallel гоняет гигабайты градиентов на каждом шаге. Для инференса - работает. Для файнтюнинга - ищите платформу с NVLink или PCIe 4.0/5.0.

Где найти RTX 3080 20 ГБ и стоит ли игра свеч?

Основные каналы: Alibaba (продавцы с рейтингом выше 95% и Physical Inspection), локальные майнинговые площадки, eBay с фильтром по региону. Средняя цена - $350-450 за штуку с учётом доставки. Перед покупкой запрашивайте скриншоты GPU-Z с объёмом памяти и температурой под нагрузкой. Альтернатива - RTX 3090 с 24 ГБ по $600-700. Две RTX 3090 дают 48 ГБ, чего хватит на Qwen3.6-27B с квантованием 4 бита и урезанным KV-кэшем. Но цена уже $1200-1400 только за карты, а памяти всё равно меньше, чем 80 ГБ у четырёх RTX 3080. Тест Qwen3.6 35B на бюджетной RX 6600 XT показывает, что даже на слабом железе можно получить 300 t/s префилла при грамотной настройке - вопрос всегда в компромиссе между ценой, памятью и точностью.

Выводы: оптимальная бюджетная сборка для инференса LLM

Четыре RTX 3080 20 ГБ за $2000 дают 80 ГБ видеопамяти и 69 токенов/с на Qwen3.6-27B с контекстом 256 тыс. токенов. Это конфигурация для тех, кто генерирует код в больших объёмах и не хочет терять точность на агрессивном квантовании. Прямая альтернатива - аренда облачных GPU за $3-5 в час, которая за 400-600 часов работы сравняется по стоимости с собственной сборкой. Дальше - чистая экономия.

Сборка не для обучения. Не для файнтюнинга. Не для тихой комнаты. Но для инференса больших моделей с полным контекстом - это лучшее соотношение цены и производительности на июль 2026 года. Код запуска, конфиги vLLM и полные логи бенчмарков доступны в репозитории проекта. Опыт оптимизации инференса DeepSeek-V4-Flash подтверждает: грамотный подбор железа под конкретную модель даёт кратный выигрыш по сравнению с типовыми облачными конфигурациями.

Подписаться на канал