Введение: зачем тестировать локальную модель на создании игры?
Локальные модели набирают вес. Qwen 3.8 27B занимает 9.2GB, работает с контекстом 256K токенов и доступна в uncensored-варианте. Это уже не игрушка, а инструмент для разработки. Вопрос в том, насколько он пригоден для комплексных задач, где нужны код, графика, логика и звук одновременно.
Galaga подходит как тест. Игра требует HTML/CSS/JS, спрайты, анимацию движения и взрывов, звуковые эффекты, механику захвата корабля. Если модель справляется с этим, она справляется с большинством рутинных задач фронтенда. Мы сравнили Qwen 3.8 27B с предыдущей версией Qwen 3.6 27B и двумя фронтирными моделями: Claude Sonnet 5 и Opus 5. Результаты показывают, где локальные модели уже догоняют лидеров, а где разрыв остаётся значительным.
Ключевой вывод: Qwen 3.8 27B в режиме xHigh приближается к Opus 5 по качеству реализации, но только при правильном промпте и взаимодействии с Python-скриптами. Без этого результат средний.
Методология теста: как мы сравнивали модели
Все модели получили одинаковый промпт: создать HTML-клон Galaga с нуля. Задача включала спрайты, анимацию, звук, механику захвата корабля. Оценивались играбельность, читаемость кода, соответствие оригиналу.
Параметры моделей и окружения
Qwen 3.8 27B запускалась локально, размер 9.2GB, контекст 256K токенов, uncensored. Qwen 3.6 27B работала в том же окружении. Claude Sonnet 5 и Opus 5 использовались через API. Для Qwen 3.8 27B тестировались три режима мышления: low, medium, xHigh.
Критерии оценки результата
Мы проверяли наличие спрайтов, анимации движения и взрывов, звуковых эффектов, механики захвата корабля, играбельность, читаемость кода, соответствие оригиналу. Каждый критерий оценивался по шкале от 0 до 5.
Результаты теста: Qwen 3.8 27B против конкурентов
Qwen 3.8 27B в режиме xHigh сгенерировала рабочий код с пиксель-арт спрайтами, анимацией взрывов и звуковыми эффектами через Web Audio API. Механика захвата корабля реализована частично: вражеский тракторный луч захватывает корабль игрока, но возврат и усиление стрельбы работают с багами. Играбельность на уровне 4 из 5.
Qwen 3.8 27B: детали реализации
Модель сгенерировала структурированный код с классами Player, Enemy, Bullet, Game. Спрайты нарисованы в canvas через пиксельные матрицы, анимация движения плавная. Звук реализован через осцилляторы Web Audio API. Механика захвата есть, но с ограничениями: после захвата корабль игрока не возвращается корректно. Код читаемый, с комментариями.
Сравнение с Qwen 3.6 27B: прогресс или регресс?
Qwen 3.6 27B выдала базовый код без звука и с примитивными спрайтами. Механика захвата отсутствовала. Анимация движения была, но без взрывов. Qwen 3.8 27B улучшила результат по всем критериям: добавила звук, спрайты, частичную механику захвата. Прогресс очевиден. Подробнее о различиях между версиями мы разбирали в тесте на генерации кода для Turtle-графики.
Сравнение с Claude Sonnet 5 и Opus 5: разрыв сокращается?
Claude Sonnet 5 сгенерировал полный клон с качественными спрайтами, анимацией, звуком и рабочей механикой захвата. Opus 5 добавил ещё более детализированную графику и отзывчивое управление. Qwen 3.8 27B в режиме xHigh уступает фронтирным моделям в деталях: спрайты проще, механика захвата с багами. Разрыв сократился по сравнению с Qwen 3.6 27B, но остаётся заметным.
Влияние режимов мышления на качество и скорость
Режимы мышления в Qwen 3.8 27B меняют время размышлений от 3 секунд до 15 минут. Это напрямую влияет на качество кода.
Low: быстрый, но поверхностный
Время около 3 секунд. Результат: базовый код, минимум деталей, возможны ошибки. Подходит для прототипирования, когда нужен быстрый набросок.
Medium: баланс скорости и качества
Время несколько минут. Результат: более полная реализация, добавлены некоторые детали. Хорош для большинства задач, где время ограничено.
xHigh: максимальное качество за счет времени
Время до 15 минут. Результат: наиболее полная реализация, приближающаяся к фронтирным моделям. Подходит для сложных задач, когда время не критично. Подробнее о различиях между режимами medium и xHigh мы писали в разборе токен-бюджетов.
Как улучшить результаты Qwen 3.8 27B: промпты и Python-скрипты
Правильный промпт меняет результат. Вместо общего «создай клон Galaga» мы использовали детализированный промпт с указанием конкретных элементов: пиксель-арт спрайты, анимация взрывов через частицы, звук через Web Audio API, механика захвата с возвратом корабля. Это подняло качество с 3 до 4 из 5.
Взаимодействие с Python-скриптами компенсирует слабые стороны модели. Мы использовали скрипт для генерации спрайтов: модель описывала пиксельные матрицы, скрипт конвертировал их в canvas-код. Это позволило Qwen 3.8 27B дотянуться до уровня Opus 5 в части графики. Модель генерирует логику, скрипт обрабатывает ассеты. Разделение труда работает.
Пример промпта: «Создай HTML-клон Galaga. Используй canvas для отрисовки. Спрайты: корабль игрока 16x16 пикселей, враги двух типов, тракторный луч. Анимация: движение по синусоиде, взрывы из 20 частиц. Звук: выстрел, взрыв, захват через Web Audio API. Механика захвата: вражеский корабль спускает луч, захватывает корабль игрока, игрок может вернуть его, уничтожив захватчика.»
Будущее локальных моделей: выводы из теста
Qwen 3.8 27B показывает значительный прогресс. Локальная модель генерирует рабочий код с графикой, звуком и частичной механикой захвата. До фронтирных моделей она не дотягивает в деталях: спрайты проще, механика с багами. Но с правильными настройками и инструментами она полезна для многих задач разработки.
Тенденция ясна: разрыв сокращается. Локальные модели становятся пригодными для прототипирования, рутинных задач и даже сложных проектов при грамотной интеграции с внешними инструментами. Когда использовать локальные модели: задачи с ограниченным бюджетом, офлайн-сценарии, быстрые прототипы. Когда фронтирные: сложные проекты с высокими требованиями к деталям и качеству.
Ограничения локальных моделей связаны с объёмом VRAM и размером параметров. Мы разбирали этот вопрос в анализе пределов возможностей малых моделей. Qwen 3.8 27B вплотную подошла к границе, где локальный запуск становится практичным для реальной разработки.