RTX 5060 Ti 16GB закрывает главный вопрос локального инференса: запуск моделей уровня 27B без покупки профессиональных карт. В этой статье собраны проверенные пресеты для Qwen3.8 27B на одной и двух картах, измеренные скорости декодирования и префилла, а также методика проверки длинного контекста без кэширования промптов. Вы получите готовые конфигурации, которые можно применять сразу, и понимание ограничений этих замеров.
Проект club-5060ti переформатирован вокруг практики: вместо ленты сырых результатов теперь публикуются только проверенные пресеты. Это означает, что каждая конфигурация прошла запуск, замер скорости и проверку качества ответов на реальном оборудовании. Диагностические запуски и нестабильные варианты вынесены отдельно, чтобы не смешивать их с рабочими решениями.
Почему RTX 5060 Ti 16GB - интересный вариант для локальных LLM
Карта получила 16 ГБ видеопамяти GDDR7 и пропускную способность около 448 ГБ/с. Этого достаточно для загрузки модели Qwen3.8 27B в квантизации IQ3_XXS на одной карте или в Q6_K на двух. Цена за гигабайт VRAM здесь ниже, чем у RTX 5090, а энергопотребление умеренное, что делает сборку из двух карт реальной альтернативой одной топовой.
Для сравнения: RTX 5090 с 32 ГБ VRAM позволяет запускать Qwen 3.6 27B в Q6_K на одной карте со скоростью 80-100 токенов/с на коротких запросах, но стоит заметно дороже. Две RTX 5060 Ti дают суммарно 32 ГБ, но с ограничением по пропускной способности каждой карты. Подробнее о том, почему две карты не дают двукратного прироста скорости, разобрано в разборе memory-bound архитектуры и сплитинга.
Переформатирование проекта club-5060ti: от сырых данных к проверенным пресетам
Раньше в проекте публиковались результаты любых запусков, включая промежуточные и неоптимальные. Это создавало шум: читателю было сложно понять, какая конфигурация действительно работает. Теперь подход другой: сырые данные и диагностические запуски отделены от готовых конфигураций. Публикуется только то, что прошло валидацию.
Что такое проверенный пресет и как он создается
Пресет - это набор параметров: квантизация модели, размер контекста, настройки загрузчика и распределение слоев между GPU. Проверка пресета проходит три этапа. Первый - запуск на целевом оборудовании. Второй - замер скорости декодирования и префилла при фиксированных частотах ядер. Третий - проверка качества ответов на коротких и длинных промптах, включая retrieval из середины контекста.
Отличие от сырых результатов принципиальное: сырой результат может быть получен при случайных настройках, с нестабильной работой или без проверки качества. Проверенный пресет воспроизводим и применим на практике.
Референсные пресеты для Qwen3.8 27B на одной и двух RTX 5060 Ti
Ниже - два основных пресета. Они протестированы на реальном оборудовании, цифры получены при фиксированных частотах ядер, поэтому сравнимы между собой. Контекст в обоих случаях установлен на 8192 токена, что покрывает большинство практических задач без деградации скорости.
Пресет для одной RTX 5060 Ti: Qwen3.8 27B IQ3_XXS
Квантизация IQ3_XXS сжимает модель до размера, который помещается в 16 ГБ VRAM с запасом под KV-кэш. Скорость декодирования составляет около 18-22 токенов/с, скорость префилла - 350-400 токенов/с. Это рабочий вариант для экспериментов, чат-ботов и задач, где допустимо небольшое снижение качества из-за агрессивной квантизации.
Параметры запуска: модель Qwen3.8 27B в GGUF IQ3_XXS, контекст 8192, батч 512, KV-кэш q8_0. Модель целиком загружается на одну карту, offloading не требуется.
Пресет для двух RTX 5060 Ti: Qwen3.8 27B Q6_K
Две карты позволяют поднять квантизацию до Q6_K, что заметно улучшает качество ответов по сравнению с IQ3_XXS. Модель распределяется между GPU послойно, суммарный объем VRAM 32 ГБ дает запас для увеличения контекста до 16384 токенов. Скорость декодирования - 25-30 токенов/с, скорость префилла - 500-550 токенов/с.
Прирост скорости относительно одной карты ограничен пропускной способностью каждой GPU. Генерация одного токена требует чтения всей модели из памяти, поэтому две карты не дают двукратного ускорения. Подробный разбор этого эффекта есть в статье про утилизацию двух RTX 5060 Ti.
Ограничения замеров производительности при фиксированных частотах ядер
Все цифры в этой статье получены при фиксированных частотах ядер GPU. Это сделано для воспроизводимости: без фиксации частоты результаты зависят от температуры, драйверов и конкретного экземпляра карты. В реальных условиях частоты меняются динамически, поэтому скорость может отклоняться на 5-10% в обе стороны.
Система охлаждения влияет на результат сильнее, чем кажется. При длительной нагрузке карта может сбрасывать частоту из-за нагрева, что снижает скорость декодирования. Рассматривайте приведенные цифры как ориентир, а не абсолютную истину. Для вашей сборки реальные показатели могут отличаться.
Высококонтекстный харнесс: проверка реального retrieval и устойчивой генерации
Загрузка модели с большим контекстом не гарантирует, что модель этот контекст использует. Харнесс проекта club-5060ti проверяет именно это: подает длинный документ с фактами и задает вопросы по разным его частям. Модель должна извлечь информацию из середины и конца промпта, а не только из начала.
Почему валидация контекста - это не только загрузка модели
Модель может загрузиться с контекстом 16384 токена и при этом игнорировать факты из второй половины промпта. Это типичный провал, который не виден при обычном тестировании. Харнесс выявляет такие случаи: вопросы формулируются так, чтобы ответ требовал обращения к конкретной части длинного документа. Если модель отвечает неточно или теряет связность, пресет не проходит валидацию.
Методика тестирования: без кэширования промптов
Кэширование промптов ускоряет повторные запросы, но искажает картину при тестировании длинного контекста. Если промпт закэширован, модель не обрабатывает его полностью, а использует сохраненные состояния. Харнесс отключает кэширование, чтобы каждый запрос проходил полную обработку. Это дает честную оценку способности модели к retrieval на длинных промптах.
Для пресетов Qwen3.8 27B харнесс показал устойчивое извлечение фактов из контекста 8192 токенов. На контексте 16384 токенов качество retrieval у IQ3_XXS немного снижается, у Q6_K остается стабильным. Это еще один аргумент в пользу двух карт, если ваша задача требует длинного контекста.
Практические рекомендации по использованию пресетов
Для экспериментов и чат-ботов достаточно одной RTX 5060 Ti с пресетом IQ3_XXS. Если нужна более высокая точность ответов или длинный контекст, собирайте две карты и используйте Q6_K. Перед запуском обновите драйверы NVIDIA и используйте актуальную версию llama.cpp, так как поддержка Blackwell улучшается с каждым релизом.
Следите за нагревом: при длительной генерации карты могут сбрасывать частоты. Для двух карт обеспечьте достаточный зазор между слотами или используйте райзеры. Если вы только подбираете конфигурацию, посмотрите гайд по сборке AI-лаборатории на RTX 5070 Ti - там разобраны принципы выбора моделей под разные задачи.
Для тех, кто хочет выжать максимум из llama.cpp на RTX 5090, полезен разбор параметров запуска Qwen 3.6 27B. Проект club-5060ti продолжает публиковать обновленные пресеты по мере выхода новых версий моделей и библиотек.