Перейти к содержанию
Публикация AiManual

Qwen 3.8 27B против фронтирных моделей: тест на воссоздание Galaga и разбор режимов мышления

Практический тест Qwen 3.8 27B на создании HTML-клона Galaga. Сравнение с Qwen 3.6 27B, Claude Sonnet 5 и Opus 5. Анализ режимов мышления low, medium, xHigh и и

Коротко

Что будет в материале

  1. 01

    Введение: зачем тестировать локальную модель на создании игры?

  2. 02

    Методология теста: как мы сравнивали модели

  3. 03

    Результаты теста: Qwen 3.8 27B против конкурентов

  4. 04

    Влияние режимов мышления на качество и скорость

Введение: зачем тестировать локальную модель на создании игры?

Локальные модели набирают вес. Qwen 3.8 27B занимает 9.2GB, работает с контекстом 256K токенов и доступна в uncensored-варианте. Это уже не игрушка, а инструмент для разработки. Вопрос в том, насколько он пригоден для комплексных задач, где нужны код, графика, логика и звук одновременно.

Galaga подходит как тест. Игра требует HTML/CSS/JS, спрайты, анимацию движения и взрывов, звуковые эффекты, механику захвата корабля. Если модель справляется с этим, она справляется с большинством рутинных задач фронтенда. Мы сравнили Qwen 3.8 27B с предыдущей версией Qwen 3.6 27B и двумя фронтирными моделями: Claude Sonnet 5 и Opus 5. Результаты показывают, где локальные модели уже догоняют лидеров, а где разрыв остаётся значительным.

Ключевой вывод: Qwen 3.8 27B в режиме xHigh приближается к Opus 5 по качеству реализации, но только при правильном промпте и взаимодействии с Python-скриптами. Без этого результат средний.

Методология теста: как мы сравнивали модели

Все модели получили одинаковый промпт: создать HTML-клон Galaga с нуля. Задача включала спрайты, анимацию, звук, механику захвата корабля. Оценивались играбельность, читаемость кода, соответствие оригиналу.

Параметры моделей и окружения

Qwen 3.8 27B запускалась локально, размер 9.2GB, контекст 256K токенов, uncensored. Qwen 3.6 27B работала в том же окружении. Claude Sonnet 5 и Opus 5 использовались через API. Для Qwen 3.8 27B тестировались три режима мышления: low, medium, xHigh.

Критерии оценки результата

Мы проверяли наличие спрайтов, анимации движения и взрывов, звуковых эффектов, механики захвата корабля, играбельность, читаемость кода, соответствие оригиналу. Каждый критерий оценивался по шкале от 0 до 5.

Результаты теста: Qwen 3.8 27B против конкурентов

Qwen 3.8 27B в режиме xHigh сгенерировала рабочий код с пиксель-арт спрайтами, анимацией взрывов и звуковыми эффектами через Web Audio API. Механика захвата корабля реализована частично: вражеский тракторный луч захватывает корабль игрока, но возврат и усиление стрельбы работают с багами. Играбельность на уровне 4 из 5.

Qwen 3.8 27B: детали реализации

Модель сгенерировала структурированный код с классами Player, Enemy, Bullet, Game. Спрайты нарисованы в canvas через пиксельные матрицы, анимация движения плавная. Звук реализован через осцилляторы Web Audio API. Механика захвата есть, но с ограничениями: после захвата корабль игрока не возвращается корректно. Код читаемый, с комментариями.

Сравнение с Qwen 3.6 27B: прогресс или регресс?

Qwen 3.6 27B выдала базовый код без звука и с примитивными спрайтами. Механика захвата отсутствовала. Анимация движения была, но без взрывов. Qwen 3.8 27B улучшила результат по всем критериям: добавила звук, спрайты, частичную механику захвата. Прогресс очевиден. Подробнее о различиях между версиями мы разбирали в тесте на генерации кода для Turtle-графики.

Сравнение с Claude Sonnet 5 и Opus 5: разрыв сокращается?

Claude Sonnet 5 сгенерировал полный клон с качественными спрайтами, анимацией, звуком и рабочей механикой захвата. Opus 5 добавил ещё более детализированную графику и отзывчивое управление. Qwen 3.8 27B в режиме xHigh уступает фронтирным моделям в деталях: спрайты проще, механика захвата с багами. Разрыв сократился по сравнению с Qwen 3.6 27B, но остаётся заметным.

Влияние режимов мышления на качество и скорость

Режимы мышления в Qwen 3.8 27B меняют время размышлений от 3 секунд до 15 минут. Это напрямую влияет на качество кода.

Low: быстрый, но поверхностный

Время около 3 секунд. Результат: базовый код, минимум деталей, возможны ошибки. Подходит для прототипирования, когда нужен быстрый набросок.

Medium: баланс скорости и качества

Время несколько минут. Результат: более полная реализация, добавлены некоторые детали. Хорош для большинства задач, где время ограничено.

xHigh: максимальное качество за счет времени

Время до 15 минут. Результат: наиболее полная реализация, приближающаяся к фронтирным моделям. Подходит для сложных задач, когда время не критично. Подробнее о различиях между режимами medium и xHigh мы писали в разборе токен-бюджетов.

Как улучшить результаты Qwen 3.8 27B: промпты и Python-скрипты

Правильный промпт меняет результат. Вместо общего «создай клон Galaga» мы использовали детализированный промпт с указанием конкретных элементов: пиксель-арт спрайты, анимация взрывов через частицы, звук через Web Audio API, механика захвата с возвратом корабля. Это подняло качество с 3 до 4 из 5.

Взаимодействие с Python-скриптами компенсирует слабые стороны модели. Мы использовали скрипт для генерации спрайтов: модель описывала пиксельные матрицы, скрипт конвертировал их в canvas-код. Это позволило Qwen 3.8 27B дотянуться до уровня Opus 5 в части графики. Модель генерирует логику, скрипт обрабатывает ассеты. Разделение труда работает.

Пример промпта: «Создай HTML-клон Galaga. Используй canvas для отрисовки. Спрайты: корабль игрока 16x16 пикселей, враги двух типов, тракторный луч. Анимация: движение по синусоиде, взрывы из 20 частиц. Звук: выстрел, взрыв, захват через Web Audio API. Механика захвата: вражеский корабль спускает луч, захватывает корабль игрока, игрок может вернуть его, уничтожив захватчика.»

Будущее локальных моделей: выводы из теста

Qwen 3.8 27B показывает значительный прогресс. Локальная модель генерирует рабочий код с графикой, звуком и частичной механикой захвата. До фронтирных моделей она не дотягивает в деталях: спрайты проще, механика с багами. Но с правильными настройками и инструментами она полезна для многих задач разработки.

Тенденция ясна: разрыв сокращается. Локальные модели становятся пригодными для прототипирования, рутинных задач и даже сложных проектов при грамотной интеграции с внешними инструментами. Когда использовать локальные модели: задачи с ограниченным бюджетом, офлайн-сценарии, быстрые прототипы. Когда фронтирные: сложные проекты с высокими требованиями к деталям и качеству.

Ограничения локальных моделей связаны с объёмом VRAM и размером параметров. Мы разбирали этот вопрос в анализе пределов возможностей малых моделей. Qwen 3.8 27B вплотную подошла к границе, где локальный запуск становится практичным для реальной разработки.

Подписаться на канал