Энтузиаст под ником u/Reasonable_Friend_77 запустил публичный эксперимент: языковая модель Qwen 3.8 Flash Next пытается пройти классическую RPG Baldur's Gate 2 в реальном времени. Прохождение идёт в формате стрима с включённым живым чатом, а анонс с первыми итогами появился 23 сентября 2026 года в сабреддите r/LocalLLaMA.
Результат первого запуска короткий: модель осилила только первый этаж подземелья, причём после множества подсказок и помощи со стороны человека. Автор оценивает агентные способности Qwen 3.8 Flash Next высоко, но проверяет их не на типовых задачах, а на игровом процессе, где нужны планирование, реакция на события и работа с интерфейсом.
Ценность кейса в другом: он показывает, как ведёт себя агентная LLM в длинном сценарии, который нельзя переписать одним промптом. Пока картина такая, что оператор рядом нужен почти постоянно. Разберём, что именно известно, чего в публикации нет и почему один этаж подземелья не стоит читать ни как провал, ни как прорыв.
Что за эксперимент: Qwen 3.8 Flash Next против Baldur's Gate 2
Кто автор и что именно он запустил
Автор публикации в r/LocalLLaMA - пользователь u/Reasonable_Friend_77. Формат открытый: прохождение идёт в прямом эфире, живой чат включён, а сам запуск автор называет первым прохождением. Часть инструментария, который связывает модель с игрой, обещана к публикации позже, дословно "There is some machinery I will open source later".
Заголовок треда - "Pi agent qwen 3.8 flash next plays Baldur's Gate 2", то есть обвязку автор связывает с Pi-агентом. Деталей архитектуры, конфигурации железа, версии модели и параметров запуска в публикации нет. Это важно для оценки достоверности: перед нами сообщение автора эксперимента, а не отчёт с метриками.
Почему для теста выбрана именно Baldur's Gate 2
Baldur's Gate 2 - классическая RPG с длинной кампанией, партийной механикой, инвентарём, диалогами и большим количеством взаимозависимых состояний мира. Это длинный сценарий, где решения накапливаются, а не аркада на скорость реакции или головоломка с единственным правильным действием.
Для агентной LLM такая среда даёт три проверки сразу. Нужно планировать последовательность шагов, реагировать на события, которые меняют обстановку, и управлять игрой через интерфейс. Типовые агентные задачи выглядят иначе: у них обычно короткий горизонт и понятный критерий завершения, например вызов инструмента и корректный ответ. Игра такого критерия не даёт.
Что удалось модели за первый запуск
Итог сформулирован автором прямо: "First run ended. Only floor 1 was successfully completed after many hints and help." То есть первый этаж подземелья пройден, дальше агент не ушёл. Эксперимент на этом не закончился, автор анонсировал следующий эпизод.
Сколько в этом было самостоятельности агента
Успех на первом этаже достигнут при большом количестве подсказок и помощи человека, и это главная оговорка всего кейса. Результат не доказывает автономность модели: часть решений и корректировок пришла извне. Читать его как "модель сама прошла подземелье" нельзя.
Роль живого чата и зрителей
Живой чат во время стрима включён. Формат предполагает участие аудитории, а помощь человека в целом отмечена автором как фактор, без которого первого этажа не получилось бы. При этом в публикации нет утверждения, что подсказки шли именно от зрителей, поэтому приписывать чату конкретный вклад не стоит.
Почему игры - тяжёлый тест для агентных LLM
Планирование и удержание цели
RPG требует последовательности решений и памяти о предыдущих шагах. Ошибка или потеря контекста накапливается: агент возвращается в уже пройденную комнату, тратит ресурсы не туда, теряет текущую задачу. На короткой задаче такое поведение почти не проявляется, на длинной - всплывает на каждом шаге.
Проблема не новая и не специфична для игр. Разбор intent continuity для кодинг-агентов показывает ту же механику: длинного контекста само по себе недостаточно, требования из начала сессии забываются без отдельной проверки. Игра ставит этот эффект в ещё более жёсткие условия, потому что откатить неудачный шаг нельзя.
Реакция на события и работа с интерфейсом
Агенту нужно воспринимать состояние игры и управлять им через интерфейс. Между наблюдением и действием появляется задержка, к ней добавляются ошибки распознавания, а сам цикл "наблюдение - решение - действие" должен быть устойчивым на сотнях итераций. Любой сбой в этом цикле ломает всю цепочку.
Часть нагрузки снимает оркестрация. Материал про надёжность агентных моделей на примере GLM-5.3-Flash разбирает, насколько результат зависит от harness и как оценивать длинные задачи без иллюзий. Тот же вопрос упирается в контроль на границе исполнения: лабораторный кейс с read-only агентом показывает, как агент обходит ограничения, если их не проверить на уровне runtime.
Что такое обвязка агента и почему её ждут
Из чего обычно состоит такая обвязка
Под обвязкой (machinery) понимают программную инфраструктуру, которая связывает LLM с игрой. В общем случае в ней есть сенсорная часть (что агент видит: кадр экрана, состояние или текст), решающая часть (сама модель), исполнительная часть (как решение превращается в нажатия и клики), память о прошлых шагах и логирование для разбора ошибок.
Это общая схема, а не описание конкретной реализации автора. В публикации нет ни списка библиотек, ни деталей того, как агент читает состояние Baldur's Gate 2, ни данных о частоте шагов.
Почему открытие кода - важный шаг
Без кода эксперимент сложно воспроизвести и проверить. Открытая обвязка позволит другим энтузиастам запускать похожие тесты, сравнивать результаты и понимать, какая часть успеха пришла от модели, а какая от механики вокруг неё. Сроков автор не называл, известно только обещание открыть часть инструментария позже.
Можно ли повторить эксперимент самостоятельно
Что уже известно и чего пока нет
Известны модель, игра, формат стрима, результат первого запуска и обещание открыть обвязку. Неизвестны версия модели, длительность эфира, метрики, конфигурация железа и устройство обвязки. Границу стоит держать в голове: готового инструмента, который можно скачать и запустить, на момент публикации нет.
Какие ограничения стоит учитывать
Эксперимент предварительный, и его результат не обобщается на другие игры и сценарии. Успех достигнут с помощью человека, обвязка не открыта, а сам формат стрима подразумевает вмешательство извне. Для длинных сценариев агенту, судя по этому кейсу, пока нужен оператор.
Какие выводы об агентных LLM даёт этот кейс
Сильные стороны, которые подтверждает кейс
Модель включается в игровой цикл и выполняет действия в среде, где нужны планирование и реакция на события. Это выходит за рамки генерации текста и показывает, что агентные возможности Qwen 3.8 Flash Next автор оценивает высоко не на пустом месте. Приписывать модели больше, чем показал эксперимент, не стоит.
Где проходит текущий предел
Предел проявляется в длине. Один этаж подземелья с постоянными подсказками - это снимок текущего состояния, а не приговор технологии. Похожую логику проверяет и бенчмарк The Struggle Bench, где агент должен выживать в симуляции с арендой и электричеством: там тоже измеряют устойчивость на длинной дистанции, а не отдельный правильный ответ.
Что дальше: следующий эпизод и открытие обвязки
Автор анонсировал продолжение эксперимента и обещал открыть обвязку позже. Дат и сроков он не называет. При следующих эпизодах логично держать в уме два вопроса: сколько помощи потребуется модели теперь и как изменится результат после публикации кода. Итоговые оценки имеет смысл давать после них, а не по первому этажу подземелья.