Перейти к содержанию
Публикация AiManual

Swift 1.5 Qwen3.8 27b от UkisAI: дообученная Qwen 27B для экономии токенов и локального запуска

Swift 1.5 Qwen3.8 27b - дообученная Qwen 27B от UkisAI с акцентом на экономию токенов. Разбираем, чем IQ4_XS отличается от Q4_K_S от Unsloth, как ведут себя реж

Коротко

Что будет в материале

  1. 01

    Что такое Swift 1.5 Qwen3.8 27b и зачем UkisAI её выпустила

  2. 02

    Квантование Swift 1.5 Qwen3.8 27b: IQ4_XS против Q4_K_S от Unsloth

  3. 03

    Low-thinking и high-thinking: когда какой режим использовать

  4. 04

    Практический кейс: скрипт для Directory Opus за 6 минут на RTX 3090

Что такое Swift 1.5 Qwen3.8 27b и зачем UkisAI её выпустила

Swift 1.5 Qwen3.8 27b - обновлённая версия модели Qwen 27B от лаборатории UkisAI, дообученная под эффективный расход токенов. Релиз сторонний: UkisAI дообучает открытые веса базовой Qwen 27B под свои цели, официального отношения к команде Qwen он не имеет.

Дообучение, или fine-tuning, означает, что готовые веса дополнительно тренируют, чтобы модель лучше решала целевой класс задач. В случае Swift акцент заявлен на одном: ответ должен получаться при меньшем числе сгенерированных токенов.

Описание релиза и пользовательский тест опубликованы на r/LocalLLaMA: Swift 1.5 Qwen3.8 27b (A must-have for low thinking!). Указанный там результат - 6 минут на практическую задачу против 40 минут и исчерпанного недельного лимита у облачной модели.

Индекс 1.5 говорит об итерации, а не о первом выпуске. Ранний релиз лаборатории разбирался отдельно: Swift Qwen 3.8 27B и штраф за избыточное «переосмысление». Новая версия продолжает ту же линию.

Чем Swift 1.5 Qwen3.8 27b отличается от базовой Qwen 27B

Ключевое отличие - работа над расходом токенов. Reasoning-модели тратят заметную часть генерации на внутренние рассуждения перед финальным ответом. Если этот блок сокращается без потери качества, выигрывают два параметра: время до ответа и объём вычислений.

Порядок экономии виден по связанной модели семейства: Swift-1.5-Qwen3.8-Flash-Next прошёл Aider с 41,1% против 40,2% у базовой версии, потратив около 40% токенов и времени (разбор теста). Это данные по Flash Next, а не по 27B, но они показывают масштаб экономии, на который делается ставка.

Деталей обучения UkisAI в источнике нет: ни состава датасета, ни метода (LoRA, QLoRA или полный fine-tune), ни числа шагов. Сравнить версии по заявленным характеристикам не получится. Рабочий способ оценки один: прогнать свои задачи на обеих моделях.

Почему экономия токенов важна при локальном запуске

Локально токен не стоит денег, он стоит времени. Каждый сгенерированный токен - это проход по сети, нагрузка на GPU, нагрев и шум вентиляторов. Ответ в 2000 токенов вместо 5000 на ту же задачу означает, что вы ждёте меньше, а карта работает в более щадящем режиме.

Эффект накапливается. Если в день через модель проходит десяток задач по кодингу, разница между 2 и 4 минутами на задачу превращается в получасовую разницу по рабочему дню.

В облаке токены конвертируются в деньги и лимиты. Кейс с Gemini Flash это показывает: модель ушла в 40-минутный цикл, перебрала варианты и выела недельную квоту, не решив задачу. Пример говорит о цене неэффективного расхода, а не о превосходстве локального запуска как класса.

Квантование Swift 1.5 Qwen3.8 27b: IQ4_XS против Q4_K_S от Unsloth

Квантование сжимает веса: числа хранятся с меньшей точностью, файл весит меньше, генерация идёт быстрее. Потери качества при 4 битах на потребительских задачах обычно невелики, но проявляются на длинных цепочках рассуждений.

В тесте сравнивались два конкретных представления весов: квант IQ4_XS модели Swift 1.5 Qwen3.8 27b и Q4_K_S от Unsloth. Это не чистое сравнение «модель против модели», потому что схема квантования тоже влияет на результат.

По размеру варианты близки. 27 млрд параметров в 4 битах - это примерно 13,5 ГБ только на веса (27 × 4 ÷ 8), плюс служебные данные и KV-кэш контекста. Практический ориентир для 4-битного кванта такой модели - 14-17 ГБ VRAM в зависимости от длины контекста. Это расчётная оценка, а не измерение из источника.

Что такое IQ4_XS и почему он важен для 27B-модели

IQ4_XS - i-quant из семейства llama.cpp. Приставка IQ означает importance quantization: веса квантуются с учётом их вклада в результат, а XS указывает на самый компактный вариант внутри семейства. Смысл подхода в том, чтобы получить меньший файл при качестве, близком к обычным 4-битным схемам.

У метода есть практическое ограничение: i-quants поддерживают не все движки и не все версии. Перед скачиванием проверьте, умеет ли ваш бэкенд читать такой файл, иначе модель просто не загрузится. Как разные схемы квантования ведут себя на одной карте, мы разбирали в тесте IQ3_XXS против Bonsai Ternary PQ2 на 16 ГБ VRAM.

Утверждать, что IQ4_XS лучше Q4_K_S всегда, нельзя. В high-thinking пользовательского теста вперёд вышел как раз конкурент.

Q4_K_S от Unsloth: чем отличается и когда выигрывает

Q4_K_S - k-quant, более распространённая схема. Её поддерживает практически любой движок, а Unsloth публикует кванты для популярных моделей, и именно её Q4_K_S использовался в тесте как альтернатива IQ4_XS.

В тесте пользователя Q4_K_S от Unsloth выиграл в режиме high-thinking. Формулировка «выиграл» относится к конкретному набору задач и конкретному железу, а не к универсальному рейтингу. Разница между двумя 4-битными квантами обычно невелика, и на ней легко поймать случайный результат.

Low-thinking и high-thinking: когда какой режим использовать

Режимы рассуждений задают бюджет токенов на внутреннюю работу. В low-thinking модель отвечает почти сразу, в high-thinking она выстраивает длинную цепочку шагов перед финальным ответом. Цена глубины - токены и время.

Главный практический результат теста в том, что режим меняет расстановку сил между квантами. В low-thinking квант IQ4_XS от UkisAI стабильно выигрывал у Q4_K_S от Unsloth в большинстве тестов пользователя. В high-thinking вперёд выходил уже Unsloth.

Почему low-thinking выигрывает в большинстве практических задач

Рабочий пример - скрипт для Directory Opus, решённый за 6 минут. Задача понятная, контекст ограниченный, требования сформулированы. Для таких случаев длинная цепочка рассуждений не даёт прибавки, она только добавляет минуты ожидания.

Написание скриптов, правка конфигов, разбор логов, генерация регулярных выражений: здесь low-thinking часто закрывает задачу целиком. Если результат не устроил, режим можно поднять, потеряв всего несколько минут.

Утверждать, что low-thinking всегда эффективнее, неправильно. В том же тесте нашлись задачи, где вперёд выходил high-thinking в паре с другим квантом.

Когда high-thinking действительно нужен

Поднимать бюджет рассуждений имеет смысл на задачах с несколькими зависимыми шагами: отладка, математика, разбор чужого кода со сложной архитектурой, планирование изменений. Здесь модели приходится держать в уме несколько условий сразу, и короткий ответ часто оказывается неполным.

В облаке high-thinking бьёт по лимитам напрямую, потому что оплачиваются именно сгенерированные токены. Локально ограничение другое: время. Практический совет простой - начинайте с low-thinking и переключайтесь на high, только если результат не устроил.

Практический кейс: скрипт для Directory Opus за 6 минут на RTX 3090

Пользователь писал кастомный скрипт в Directory Opus, файловом менеджере для Windows. Задача сначала ушла в Gemini Flash в режиме medium thinking на бесплатном тарифе Antigravity. Облачная модель зациклилась на 40 минут, перепробовала много вариантов, исчерпала все недельные лимиты токенов и не решила задачу.

Та же формулировка ушла в Swift 1.5 Qwen3.8 27b в кванте IQ4_XS на старой RTX 3090. Модель закрыла задачу полностью за 6 минут при скорости около 67 токенов в секунду. Автор теста отмечает, что не ожидал такого результата от IQ4_XS-кванта 27B-модели в режиме low-thinking (обсуждение на r/LocalLLaMA).

Что именно делала модель и почему облако не справилось

Специфика задачи в узком контексте: у Directory Opus собственный scripting API, и нестандартные вызовы требуют точного синтаксиса. Модель, которая не может выйти из неудачной гипотезы, начинает перебирать варианты по кругу. Сорок минут цикла и исчерпанная квота как раз описывают такое поведение.

Из этого не следует, что Gemini Flash плохая модель. Условия её запуска в кейсе описаны не полностью: бесплатный тариф, medium thinking, ограничения Antigravity. Прямое сравнение с локальным запуском по одному эпизоду корректным не назвать.

Скорость 67 токенов в секунду на RTX 3090: что это значит на практике

Человек читает примерно 200-300 слов в минуту. При грубом пересчёте это единицы токенов в секунду, то есть 67 t/s идут заметно быстрее чтения, и текст появляется раньше, чем вы успеваете его освоить. Для интерактивной работы с кодом такая скорость комфортна.

RTX 3090 вышла в 2020 году, но 24 ГБ VRAM оставляют её рабочей картой для 27B-моделей в 4-битном кванте. Скорость 67 t/s не является потолком или нормой: она зависит от кванта, длины контекста, движка и вспомогательных техник вроде спекулятивного декодирования.

Локальный запуск Swift 1.5 Qwen3.8 27b: требования и инструменты

Модель распространяется в формате GGUF, то есть в виде файлов, которые читают локальные движки. Это стандартный путь для потребительского железа: скачали файл, выбрали длину контекста, получили работающую модель без сборки чего-либо из исходников.

Сколько VRAM нужно для 27B в 4-битном кванте

Ориентир по памяти: около 13,5 ГБ на веса 27 млрд параметров в 4 битах плюс несколько гигабайт на KV-кэш и служебные буферы. В сумме это 14-17 ГБ в зависимости от контекста. Карта на 24 ГБ (RTX 3090, RTX 4090) закрывает задачу с запасом, 16 ГБ требуют аккуратной настройки, а 12 ГБ почти неизбежно означают частичную выгрузку слоёв на CPU и падение скорости.

Насколько сильно конфигурация меняет картину, видно по тестам на разном железе: 9 моделей на одной RTX 3060 12 ГБ и запуск Qwen 3.8 27B на RTX 5090 с NVFP4. Оба материала полезны, если вы прикидываете, влезет ли модель в вашу карту.

Какой софт использовать: llama.cpp, Ollama, LM Studio

llama.cpp - референсная реализация, i-quants вроде IQ4_XS поддерживаются здесь в первую очередь. Вы получаете максимальный контроль над параметрами и предсказуемое поведение, платя за это работой с командной строкой.

Ollama удобнее в запуске и управлении моделями, но набор поддерживаемых схем квантования у неё уже, чем у llama.cpp. LM Studio даёт графический интерфейс и понятна новичку, хотя тонкая настройка там ограничена.

Практический вывод: для IQ4_XS проверьте поддержку i-quants в конкретной версии вашего движка. Если файл не читается, дело обычно в этом, а не в самой модели.

Ограничения теста и почему это не бенчмарк

Все описанные результаты - единичный пользовательский опыт из одного поста (источник теста). Воспроизводимым бенчмарком назвать его нельзя: нет повторных прогонов, нет набора задач, нет фиксации параметров генерации.

Почему один кейс не доказывает превосходство модели

Одна задача, одна конфигурация, один пользователь. Модель могла удачно попасть в знакомый паттерн, а облачная - упереться в ограничения бесплатного тарифа. Статистика из этого не собирается: для выводов нужны десятки разнородных задач и хотя бы несколько повторов каждой.

Из кейса нельзя вывести правило «локальная 27B лучше облачной Gemini Flash». Корректная формулировка: в одной конкретной задаче локальный запуск дал рабочий результат, а облачный не дал.

Какие факторы могли повлиять на результат

Перечислим то, что делает сравнение ограниченным:

  • конкретная задача (скрипт для Directory Opus) с нетипичным API;
  • конкретная карта (RTX 3090) и её драйверы;
  • конкретный квант (IQ4_XS) и версия движка;
  • режим low-thinking с коротким бюджетом рассуждений;
  • условия Gemini Flash: бесплатный тариф, medium thinking, лимиты Antigravity.

Ни один из этих факторов не отменяет результат, но каждый сужает область, на которую его можно распространить. Сравнение квантов к тому же касалось только двух вариантов из множества существующих.

Кому подходит Swift 1.5 Qwen3.8 27b и стоит ли пробовать

На модель имеет смысл смотреть, если у вас карта на 24 ГБ VRAM и есть задачи по кодингу или автоматизации, которые вы хотите решать без облака. На 16 ГБ она тоже доступна, но потребует настройки и даст меньшую скорость.

Сценарии, где модель показывает себя лучше всего

По описанному кейсу и логике релиза лучше всего подходят задачи с чётким контекстом и проверяемым результатом: скрипты для конкретных приложений, автоматизация рутины, правка конфигов, генерация небольших функций. Режим low-thinking закрывает их быстрее всего, а быстрый ответ снижает цену ошибки: результат не устроил, переформулировали запрос и получили новый за минуту.

Данных, чтобы утверждать, что модель одинаково хороша в длинных цепочках рассуждений или при большом контексте, у нас нет. Эти сценарии проверяйте самостоятельно.

Когда лучше остаться на облачных моделях

Облако выигрывает, когда нет подходящего железа, когда нужен очень длинный контекст или максимально свежие знания, когда задача разовая и настраивать локальный стек ради неё нерационально. Подписка снимает вопросы по обслуживанию, но добавляет лимиты, и кейс с исчерпанной недельной квотой показывает, чем это заканчивается в неудачный день.

Разумный порядок действий: скачать IQ4_XS, прогнать его на своих типовых задачах в low-thinking, затем сравнить с Q4_K_S в high-thinking там, где первый вариант не справился. Свои замеры скажут о модели больше, чем любое описание в интернете, включая это.

Подписаться на канал