Перейти к содержанию
Публикация AiManual

Abliterated Qwen3.6-35B на двух RTX 4060 Ti: реальность, компромиссы и риски

Разбираем, реально ли поднять abliterated-версию Qwen3.6-35B на двух RTX 4060 Ti: считаем требования к VRAM, выбираем между Q4_K_M и Q5_K_M, оцениваем скорость

Коротко

Что будет в материале

  1. 01

    Что такое abliterated-модель и зачем её запускать

  2. 02

    Поместится ли Qwen3.6-35B в 32 ГБ VRAM двух RTX 4060 Ti

  3. 03

    Квантизация 35B-модели для двух GPU: выбор и последствия

  4. 04

    Скорость генерации: чего ожидать от двух RTX 4060 Ti

Тема запуска abliterated-версии Qwen3.6-35B на двух RTX 4060 Ti появилась в сообществе LocalLLaMA. Публикация с заголовком «Extra Big Ass Intelligence - Abliterated qwen3.6-35b on 2 4060ti's» была размещена на Reddit, но технических деталей о самой сборке в открытом доступе нет: ни требований к VRAM, ни параметров запуска, ни замеров скорости. Обсуждать тему приходится через расчёт и общие принципы локального инференса, отделяя подтверждённое от предполагаемого.

Важное уточнение по названию: на Hugging Face в организации Qwen опубликована модель Qwen3.6-35B-A3B — первый открытый вариант серии Qwen3.6, а в коллекции Qwen3.6 есть также Qwen3.6-35B-A3B-FP8. Существование именно abliterated-версии этой модели и её запуск на двух RTX 4060 Ti подтверждены только заголовком публикации на Reddit; независимого подтверждения самой сборки в доступных источниках нет.

Короткий ответ на главный вопрос: 35B-модель размещается на паре 4060 Ti только в агрессивной квантизации. Итог зависит от двух неизвестных. Первая: карта выпускалась в версиях на 8 и 16 ГБ, поэтому суммарный объём пары равен либо 16, либо 32 ГБ. Вторая: сколько слоёв придётся отдать в системную память и насколько это ударит по скорости. Пока эти параметры не заданы, любые конкретные обещания по токенам в секунду будут выдумкой.

Отдельно стоит держать в голове, что abliterated-сборка не имеет официальной поддержки. Это эксперимент с реальными рисками по стабильности и качеству, а не готовый продукт.

Что такое abliterated-модель и зачем её запускать

Abliterated-модель - это версия обученной LLM, из которой удалили так называемые направления отказа. Базовая модель после выравнивания через RLHF и инструктаж учится отклонять часть запросов: на чувствительные, провокационные или потенциально опасные темы она отвечает «не могу помочь». Abliteration снимает этот поведенческий слой.

Как получают abliterated-версии

Метод опирается на идею, что отказ модели соответствует определённому направлению в пространстве её внутренних активаций. Сначала собирают наборы «вредных» и «безобидных» запросов, прогоняют их через модель и сравнивают активации на средних слоях. Разница между двумя группами даёт вектор отказа. Затем этот вектор вычитают из весов или из активаций, убирая склонность отказывать.

Процесс требует доступа к модели, вычислительных ресурсов и аккуратной настройки силы воздействия. Слишком слабое удаление не сработает, слишком сильное повредит остальные способности сети. Готовые abliterated-сборки выкладывают в открытый доступ в формате GGUF и подобных, чтобы их можно было запускать локально.

Чем abliterated отличается от обычной Qwen3.6-35B

Практическая разница проявляется на пограничных запросах. Обычная Qwen3.6-35B, как и большинство выровненных моделей, на провокационную или чувствительную просьбу ответит отказом либо уклончиво. Abliterated-вариант на тот же запрос даст прямой ответ. Всё остальное - знание фактов, стиль, качество кода - зависит от базовой модели и сохраняется настолько, насколько аккуратно прошла модификация.

Abliteration не делает модель умнее и не улучшает её на общих задачах. Она только снимает ограничения. Официальной поддержки у такой сборки нет: это неофициальная модификация, которую разработчик модели не сопровождает.

Поместится ли Qwen3.6-35B в 32 ГБ VRAM двух RTX 4060 Ti

Объём модели в памяти определяется числом параметров и точностью их хранения. Веса 35B в разных форматах занимают очень разный объём.

Сколько VRAM нужно для 35B-модели в разных форматах

Точных опубликованных размеров файлов именно для Qwen3.6-35B-A3B в форматах FP16, Q8_0, Q6_K, Q5_K_M и Q4_K_M в доступных источниках нет. Поэтому ниже — не измеренные значения, а ориентировочная арифметика: 35 млрд параметров, умноженные на типичное число байт на параметр для каждого формата. Реальный размер файла зависит от архитектуры, доли экспертных слоёв и версии инструмента квантизации.

ФорматБайт на параметр (ориентир)Оценка объёма весов для 35B
FP162~70 ГБ
INT8 / Q8_0~1~35-37 ГБ
Q6_K~0.8~29 ГБ
Q5_K_M~0.7~24 ГБ
Q4_K_M~0.6~21 ГБ

Цифры в таблице - расчёт только для весов. KV-кэш, буферы и служебные расходы сюда не входят и добавляют ещё несколько гигабайт в зависимости от длины контекста.

Расклад становится ясен сразу. FP16 и INT8 на паре 4060 Ti не помещаются в принципе. Q6_K даёт около 29 ГБ и упирается в лимит даже 32 ГБ, почти не оставляя места на контекст. Реалистичные варианты - Q4_K_M и Q5_K_M.

Распределение слоёв между GPU: как это работает

llama.cpp и совместимые инструменты умеют раскладывать слои модели по нескольким GPU флагом tensor split. Каждая карта держит свою часть слоёв, а активации по очереди передаются между ними. При генерации одного токена данные проходят всю цепочку слоёв, поэтому карты работают последовательно, а не одновременно.

Если задать неравномерное распределение, одна карта переполнится и часть слоёв уйдёт в CPU. Тогда узким местом станет уже не GPU, а пропускная способность PCIe и системной памяти. Выравнивание нагрузки по картам критично: перекос в одну сторону роняет скорость всей конфигурации.

Вывод по памяти: без квантизации Qwen3.6-35B на двух 4060 Ti не запускается. При 16 ГБ суммарно (две 8-гигабайтные карты) даже Q4 уходит на грань и требует выгрузки на CPU. При 32 ГБ (две 16-гигабайтные) Q4 помещается целиком, но запас под контекст остаётся скромным. Какую именно версию карт имеет в виду автор публикации, не указано, поэтому вывод приходится держать в двух вариантах.

Квантизация 35B-модели для двух GPU: выбор и последствия

Q4_K_M vs Q5_K_M: что выбрать для 16 ГБ VRAM

Q4_K_M - компромиссный вариант, который чаще всего берут, когда памяти мало. Для 35B он даёт около 21 ГБ весов по ориентировочному расчёту. Q5_K_M прибавляет примерно 3-4 ГБ и повышает точность. На паре карт с 16 ГБ суммарно оба формата требуют выгрузки части слоёв в CPU. На паре с 32 ГБ Q4_K_M садится целиком, а Q5_K_M подбирается к границе и оставляет мало места под длинный контекст.

Практический ориентир: начинать стоит с Q4_K_M и небольшого контекста, а к Q5_K_M переходить только если после загрузки остаётся запас VRAM. Про более агрессивные форматы вроде IQ1_S и их влияние на качество отдельный разбор есть в материале об ультранизкой квантизации.

Как квантизация влияет на качество ответов

Квантизация понижает точность хранения весов, и на сложных задачах это заметно. Проявляется по-разному: модель путает факты, которые уверенно воспроизводит в старших форматах, начинает повторяться, теряет связность длинных рассуждений, чаще ошибается в коде и математике. Чем ниже разрядность, тем сильнее эффект.

Для abliterated-сборок риск деградации выше, потому что модификация весов уже смещает поведение модели от исходного. Наложение двух возмущений, правки под удаление отказов и потерь от низкой точности, может дать менее предсказуемый результат, чем у обычной квантизованной модели. Точные проценты потерь приводить нельзя: подтверждённых замеров именно для этой конфигурации нет.

Скорость генерации: чего ожидать от двух RTX 4060 Ti

Генерация токена языковой моделью упирается в пропускную способность памяти, а не в вычислительную мощность GPU. На каждом шаге из памяти считываются все активные веса модели. Поэтому объём весов делится на пропускную способность карт, и это задаёт верхнюю границу скорости.

Факторы, влияющие на скорость

На результат влияют уровень квантизации, длина контекста, размер батча, равномерность распределения слоёв и наличие выгрузки на CPU. Готовых замеров именно для abliterated-сборки на двух 4060 Ti нет, поэтому любые точные токены в секунду здесь были бы выдумкой. Можно обозначить порядок величины: при удачной раскладке, когда модель целиком лежит на картах, счёт обычно идёт на единицы, реже на первые десятки токенов в секунду. Это оценка по принципу работы, а не измерение.

У 4060 Ti 128-битная шина памяти. По данным NVIDIA, ширина шины сама по себе не является достаточным показателем производительности подсистемы памяти: в архитектуре Ada Lovelace кэш L2 увеличен в 16 раз, а эффективность использования пропускной способности памяти повышена. Это значит, что 128-битную шину нельзя напрямую пересчитывать в потолок скорости генерации без учёта кэша и характера нагрузки. Главное правило остаётся простым: как только часть слоёв уходит в системную память, скорость падает в разы, потому что CPU и оперативная память на порядок медленнее GPU.

Риски abliterated-моделей: нестабильность, искажения, отсутствие поддержки

Разбор будет неполным без минусов. Abliterated-сборки - экспериментальный формат, и вот что нужно учитывать до запуска.

Почему abliterated-модели могут работать хуже

Удаление направления отказа затрагивает ту же сеть, что отвечает за рассуждения, стиль и следование инструкциям. Веса взаимосвязаны, поэтому правка под удаление отказов может задеть и другие способности. Аналогия простая: вынуть из машины тормоза, чтобы она не тормозила, и обнаружить, что управляемость тоже изменилась. На практике это выражается в менее стабильных ответах, редких срывах логики и неожиданных реакциях на нейтральные запросы.

Прямо скажем: подтверждённых данных о степени снижения стабильности именно у этой сборки в доступных источниках нет. Это ожидаемый риск метода, а не измеренный факт. Отсутствие официальной поддержки - свойство любой неофициальной модификации: найденные баги исправляет не разработчик модели, а автор сборки, если вообще исправляет.

Юридические и этические аспекты

Лицензия Qwen разрешает создание производных работ и модификаций. В тексте лицензии Qwen (на примере Qwen2.5-72B-Instruct-GGUF) указано, что предоставляется неисключительная, всемирная, непередаваемая, безвозмездная ограниченная лицензия на использование, воспроизведение, копирование, создание производных работ и внесение модификаций. Это означает, что сама по себе модификация весов не запрещена, но лицензия требует включать уведомление об атрибуции в копии или производные работы: «Qwen is licensed under the Qwen LICENSE AGREEMENT, Copyright (c) Alibaba Cloud. All Rights Reserved.»

Ограничение здесь в другом: текст лицензии подтверждён на примере Qwen2.5-72B-Instruct-GGUF, а для Qwen3.6-35B-A3B в доступных источниках отдельного текста лицензии нет. Поэтому нельзя утверждать, что условия для этой модели идентичны — это нужно проверять отдельно на странице конкретной модели. Отдельно стоит вопрос контента: снятые ограничения открывают путь к генерации нежелательного или незаконного материала, а ответственность за это лежит на пользователе. Юридических советов здесь нет, но риски нужно осознавать до запуска, а не после.

Кому и зачем нужен запуск abliterated Qwen3.6-35B на двух RTX 4060 Ti

Сценарии использования

Такая конфигурация интересна узкому кругу. Исследователям безопасности, которые изучают, как модели сопротивляются обходам фильтров и насколько устойчивы их механизмы отказа. Разработчикам, которым нужны ответы на нестандартные запросы в контролируемой среде. Энтузиастам локальных LLM, которые хотят увидеть поведение модели без выравнивания. Для продуктивных рабочих задач официальные модели остаются более предсказуемым выбором.

Альтернативы, если конфигурация не тянет

Если двух 4060 Ti не хватает, есть несколько путей. Взять меньшую модель: 7B или 13B уверенно живут на одной карте и оставляют место под контекст. Арендовать GPU в облаке, если задача разовая. Пойти на более агрессивную квантизацию, помня про падение качества. Про пределы малых моделей и то, когда они упираются в память, а когда в число параметров, подробнее в отдельном разборе. А если сравнивать локальный запуск с API по затратам, полезен материал о рисках локального запуска.

Практические шаги по запуску: софт и настройка

Универсальной пошаговой инструкции под эту сборку в открытых данных нет, поэтому ниже опорные параметры, с которых стоит начинать. Точные значения зависят от версии инструмента.

llama.cpp: базовые параметры для двух GPU

Основные инструменты для локального запуска GGUF-моделей: llama.cpp и его сервер llama-server, Ollama, а также интерфейсы вроде text-generation-webui. Для раскладки по двум картам используют флаг --tensor_split с двумя значениями, например 0.5 0.5 для равной нагрузки. Число слоёв, отправляемых на GPU, задаёт --n-gpu-layers; остальные уйдут в CPU. Размер окна задаёт --ctx-size. У vLLM подход другой: там распределение работает через tensor parallel при запуске.

Разумная отправная точка: формат Q4_K_M, контекст 4096 токенов, равный tensor split, затем постепенное увеличение контекста до появления признаков нехватки памяти.

Мониторинг и отладка

За памятью удобно следить через nvidia-smi: он показывает занятый объём VRAM по каждой карте и помогает понять, есть ли запас. Логи загрузки показывают, сколько слоёв реально легло на GPU, а сколько ушло в CPU. При нехватке памяти модель либо падает с ошибкой, либо заметно замедляется из-за выгрузки. Если пошли повторы и обрывы, стоит проверить, не переполнен ли контекст.

Если цель - получить рабочий локальный ассистент, начинать с 35B на двух 4060 Ti не стоит: сборка упирается в память и не имеет официальной поддержки. Если интерес исследовательский, порядок такой: взять Q4_K_M abliterated-сборки, выставить равный tensor split, стартовать с контекста 4096 и следить за VRAM через nvidia-smi. И держать рядом официальную модель той же размерности для сравнения качества.

Подписаться на канал