Swift Qwen 3.8 27B - первая открытая модель небольшой лаборатории UkisAI. Это файнтюн базовой Qwen 3.8 27B на 27 млрд параметров, который собрал больше 100 тысяч загрузок на Hugging Face, занял первое место среди файнтюнов и девятое в общем рейтинге Trending.
Идея авторов в том, чтобы штрафовать патологические паттерны «переосмысления» во время обучения, а не требовать от модели коротких ответов. По заявлению команды, это даёт минус 58,3% по расходу токенов и ускорение в 1,95 раза без потери точности.
Все эти цифры взяты из публикации авторов, независимых замеров в открытых источниках пока нет. Модель при этом открытая: веса лежат на Hugging Face, сообщество уже сделало несколько квантизаций, и запустить её локально реально. Дальше разберём, что именно изменили в обучении, как оценивать заявленные метрики, сколько нужно VRAM и что обещают в следующих релизах.
Что такое Swift Qwen 3.8 27B и почему она попала в Trending на Hugging Face
Размер 27B - это класс, который уже не влезает в 8 ГБ VRAM без квантизации, но остаётся реалистичным для одной карты на 24 ГБ. База, Qwen 3.8 27B, относится к reasoning-моделям: она тратит токены на цепочку рассуждений перед финальным ответом.
Позиционирование простое: та же Qwen 3.8, но с меньшим числом лишних шагов в рассуждении. Авторы не обещают прироста в знаниях или в логике, обещают экономию вычислений. Для локального инференса это часто важнее пары процентов на абстрактных бенчмарках, потому что напрямую переводится в секунды ответа и в число параллельных запросов на одной карте.
Ключевые характеристики и позиционирование
Что известно из публичных данных:
- 27 млрд параметров, открытые веса;
- база - Qwen 3.8 27B, reasoning-модель со склонностью к длинным цепочкам рассуждений;
- первый открытый релиз лаборатории UkisAI;
- заявленная цель: меньше токенов и выше скорость без потери точности.
Остальные детали в доступных материалах не раскрыты: ни лицензия, ни точная длина контекста, ни объём обучающих данных, ни конфигурация RL. Если эти параметры критичны для проекта, их стоит смотреть в карточке модели перед скачиванием.
История с базовой Qwen 3.8 27B сама по себе была шумной: страница модели на ModelScope в какой-то момент отдавала 404, и до сих пор неясно, был это технический сбой или перенос релиза. Мы разбирали обе версии событий отдельно. Для Swift это важно в одном смысле: сравнивать файнтюн имеет смысл с той ревизией базовой модели, на которой он обучался, а её идентификатор стоит смотреть в карточке релиза.
Реакция сообщества: загрузки, файнтюны, квантизации
Больше 100 тысяч загрузок, первое место среди файнтюнов и девятое в общем Trending на Hugging Face - это цифры, которые владелец проекта приводит как показатель спроса. Основатель лаборатории отдельно поблагодарил сообщество за файнтюны, квантизации и улучшения: именно они помогли модели получить внимание и поддержку для дальнейшей разработки.
Такая реакция типична для открытых релизов в нише локальных LLM. Люди быстро собирают GGUF-кванты, добавляют модели в LM Studio и Ollama, публикуют собственные доработки, и репозиторий начинает жить своей жизнью. Для пользователя это плюс: чем больше форматов и сборок, тем выше шанс подобрать вариант под конкретную видеокарту.
Стоит держать в голове, что скачивания считаются по репозиторию и включают автоматические сборки и повторные загрузки. 100 тысяч загрузок говорят об интересе, но не заменяют проверку качества на собственных задачах.
Как работает борьба с «переосмыслением»: штраф вместо прямого сокращения
Reasoning-модели обучены тратить токены на размышления, и на сложных задачах это оправдано. Проблема начинается там, где модель перепроверяет уже полученный вывод, ходит по кругу, повторяет одну и ту же мысль разными словами и сомневается в собственных промежуточных шагах. На простом вопросе такая цепочка легко растягивается на тысячи токенов, хотя ответ был очевиден после первого абзаца рассуждений.
Классический способ борьбы - резать бюджет размышлений: ограничивать max_tokens, добавлять в промпт просьбу отвечать кратко, дообучать на коротких цепочках. Приём работает, но бьёт по сложным задачам, где длинная цепочка как раз и приводит к правильному ответу.
Подход UkisAI выворачивает логику: модель не заставляют думать меньше, её штрафуют за конкретные бесполезные паттерны. Нужная длина рассуждения остаётся на усмотрение модели, а наказывается только то, что не приближает к ответу.
Что такое патологическое переосмысление и как его штрафуют
К патологическим паттернам обычно относят зацикливание на одном шаге, повторение уже сделанного вывода, проверку того, что уже проверено, и мета-рассуждения о собственных инструкциях вместо работы с задачей. Выглядит это как бесконечное «подожди, пересмотрю ещё раз».
Технически речь идёт о дообучении с наградой, которая снижается за такие паттерны и растёт за корректный финальный ответ. Точная формула штрафа, набор маркеров и гиперпараметры RL в публичных материалах не раскрыты, так что воспринимать механику стоит на уровне идеи, а не готового рецепта для воспроизведения.
Предыдущая работа команды в этом направлении известна лучше. В прошлой версии файнтюна авторы работали с reasoning-marker токенами, которые провоцировали затянутые цепочки, и штрафовали их через RL. Тот релиз, по описанию, сокращал объём рассуждений на 30-50%: в отдельном тесте через Aider фигурировали 7,3 тыс. completion-токенов против 12,5 тыс. у базовой модели при близком качестве диффов и примерно вдвое меньшем времени на задачу. Swift Qwen 3.8 27B идёт по тем же рельсам, но с более агрессивным штрафом.
Заявленные метрики: 58,3% меньше токенов и 1,95x быстрее
Цифры, которые приводит команда: расход токенов ниже на 58,3%, скорость выше в 1,95 раза, точность не падает. Что это означает на практике:
- меньше вычислений на один ответ, то есть ниже нагрузка на GPU и меньше энергии на задачу;
- короче время до первого осмысленного ответа в чате;
- больше параллельных запросов на той же карте при батчинге;
- дешевле агентные циклы, где каждый лишний шаг умножается на число итераций.
Контекст важен: экономия токенов стала главной темой всей линейки Qwen 3.8. У Qwen 3.8 Max Preview заявляют снижение расхода входных токенов на 35-40% в многошаговых задачах, о чём мы писали в разборе системного анализа и стоимости инференса. Swift решает ту же задачу, но на уровне весов, а не настройки пайплайна.
Оговорка, без которой цифры читать нельзя: это замеры авторов модели. Не раскрыто, на каких задачах считали, с какой длиной контекста, на каком железе и как именно измеряли точность. На коротких диалогах разница в токенах будет куда скромнее, чем на длинных агентных прогонах.
Как запустить Swift Qwen 3.8 27B локально: квантизации и требования
Запуск упирается в железо и формат весов. Все ориентиры ниже считайте приблизительными: KV-кэш на длинном контексте добавляет несколько гигабайт сверху, а конкретный движок может расходовать память чуть иначе.
Доступные квантизации и где их искать
- GGUF - для llama.cpp, Ollama, LM Studio и text-generation-webui, самые ходовые варианты Q4_K_M и Q5_K_M;
- GPTQ и AWQ - для GPU-ориентированных движков вроде vLLM, когда нужна высокая пропускная способность;
- MLX-кванты - если работаете на Apple Silicon;
- агрессивные Q3 и Q2 - компромисс для карт с малым объёмом VRAM.
Искать сборки стоит в репозитории модели на Hugging Face: в списке файлов есть фильтр по тегам gguf, awq и gptq, часть квантов публикуют отдельными репозиториями участники сообщества. Авторы просят делиться пожеланиями по квантизациям, значит, набор форматов ещё пополняется и под редкие конфигурации сборки могут появиться позже.
Минимальные и рекомендуемые требования к железу
| Формат | Примерный размер весов | Комфортный VRAM | Комментарий |
|---|---|---|---|
| Q3_K_M и ниже | 12-14 ГБ | 12-16 ГБ | ощутимая потеря качества на сложных задачах |
| Q4_K_M | около 16-17 ГБ | 16-24 ГБ | рабочий компромисс для домашнего запуска |
| Q5_K_M | около 19-20 ГБ | 24 ГБ | нужен запас под KV-кэш |
| Q8 | около 29 ГБ | 32-48 ГБ | две карты или одна на 48 ГБ |
| FP16 | около 54 ГБ | 64-80 ГБ | серверный сценарий |
Если VRAM меньше объёма весов, часть слоёв можно выгрузить в оперативную память, но скорость упрётся в пропускную способность RAM. На картах с 8-10 ГБ модель целиком не поместится: останутся только агрессивные кванты уровня Q3 и ниже либо гибридный режим с offload и заметным падением скорости. Запуск на CPU тоже возможен, однако генерация будет идти в разы медленнее, и весь смысл в ускорении теряется.
Для GGUF хватит llama.cpp или Ollama, для графического интерфейса подойдёт LM Studio, для серверного инференса и батчинга имеет смысл смотреть в сторону vLLM. Базовый вызов llama.cpp выглядит так:
llama-cli -m path/to/model-Q4_K_M.gguf -c 8192 -ngl 99
Здесь -c задаёт длину контекста, а -ngl указывает, сколько слоёв отдать на GPU. Конкретные значения подбираются под вашу сборку и объём видеопамяти.
Насколько можно доверять заявлениям авторов и какие есть ограничения
Все ключевые цифры Swift Qwen 3.8 27B - 58,3% экономии токенов, 1,95x ускорения, 100 тысяч загрузок - это заявления авторов. Независимых замеров в открытых источниках на момент публикации нет, и это не значит, что кто-то лукавит, но проверять стоит самому.
Почему цифры требуют проверки
- методика замеров не раскрыта: неизвестны набор задач, длина контекста, железо и способ оценки точности;
- сравнение идёт с базовой Qwen 3.8, а не с другими оптимизированными файнтюнами того же класса;
- экономия токенов сильно зависит от типа нагрузки: на коротких вопросах разница будет минимальной, на длинных агентных циклах максимальной;
- авторы сами сообщают об ошибках обучения в текущем чекпоинте, которые собираются исправить в Swift1.5. Для первой версии это нормально, но для продакшна сигнал выждать;
- рейтинг Trending отражает всплеск интереса за короткое окно, а не устойчивое превосходство над конкурентами.
Штраф за «лишние» размышления теоретически может срезать тот шаг, который вёл к правильному ответу. Авторы утверждают, что точность не падает, но проверяется это только на ваших задачах.
Кому модель может не подойти
- задачи, где важна каждая цепочка рассуждений: доказательства, формальная логика, редкие нетиповые условия;
- русскоязычные продакшн-сценарии: как дообучение повлияло на неанглоязычные данные, не сообщается, тестировать надо на своих примерах;
- железо уровня 8 ГБ VRAM и ниже без готовности терпеть медленный offload;
- проекты, где нужна предсказуемость поведения: первая версия с признанными ошибками обучения не лучший кандидат в критичный пайплайн.
Практический способ проверить всё за час: прогоните одинаковый набор своих задач через базовую Qwen 3.8 27B и через Swift, сравните число completion-токенов, время до финального ответа и долю верных ответов. Такой тест заменит любые сторонние бенчмарки, потому что считает именно вашу нагрузку.
Что дальше: Swift1.5 Qwen3.8 27B и Swift Qwen3.8 Flash Next
Команда анонсировала два будущих релиза. Сроки не названы, характеристики предварительные и могут измениться.
Swift1.5: исправление ошибок и дополнительное RL
Улучшенный чекпоинт Swift1.5 Qwen3.8 27B должен получить исправленные ошибки обучения и дополнительный этап RL. Практический смысл понятен: более стабильное поведение и меньше провалов на задачах, где первая версия сбоила. Конкретный список исправлений авторы не публиковали, так что оценивать эффект пока не по чему.
Flash Next: фокус на код и длинный горизонт
Для Swift Qwen3.8 Flash Next сейчас прогоняется расширенный набор бенчмарков, включая задачи по коду и длинному горизонту. Long-horizon означает многошаговые сценарии, где модель удерживает план на десятки действий: правки в репозитории, последовательные вызовы инструментов, длинные исследовательские цепочки. Это тот класс задач, где экономия токенов даёт максимальный эффект, потому что каждая сэкономленная сотня токенов умножается на число итераций.
Базовая модель для этого релиза заслуживает отдельного разбора: о том, что такое Qwen3.8-Flash-Next, почему её не стоит путать с полноценным Qwen4 и что известно про локальный запуск, мы писали в отдельном материале.
Как сообщество может повлиять на развитие Swift Qwen
Авторы прямо просят тех, кто уже попробовал Swift, присылать пожелания по квантизациям и функциям для следующих версий. Для открытого релиза это не формальность: именно запросы пользователей определяют, появятся ли сборки под конкретные движки, кванты под карты на 12 ГБ или поддержка нестандартных форматов.
Основатель лаборатории поблагодарил сообщество за файнтюны, квантизации и улучшения, которые помогли модели получить внимание и поддержку для дальнейшей разработки. Вывод простой: если вам не хватает кванта под вашу видеокарту или формата под ваш движок, об этом стоит написать, потому что такие запросы обычно попадают в план следующего релиза быстрее, чем абстрактные пожелания.
Итог: стоит ли пробовать Swift Qwen 3.8 27B
Модель интересна как эксперимент по снижению стоимости инференса. Если у вас есть карта на 16-24 ГБ и вы гоняете локальные агенты, кодинг-задачи или длинные цепочки запросов, заявленная экономия в 58,3% токенов и ускорение в 1,95 раза окупят вечер на скачивание и настройку. Проверка занимает один прогон: возьмите GGUF-квант Q4, запустите через llama.cpp или Ollama и сравните с базовой Qwen 3.8 27B по числу токенов и времени ответа на ваших задачах.
Если нужна максимальная точность на сложной логике или критична работа с русским языком, сначала тестируйте на своих примерах и держите базовую модель как эталон для сравнения. За обновлениями следите по анонсам Swift1.5 и Flash Next, но закладывать их в план на конкретную дату пока рано.