Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Тест на пространственное мышление LLM: лабиринт с ключом как новый бенчмарк навигации без карты

Разбираем новый бенчмарк для LLM — лабиринт с ключом. Модели должны найти выход без карты, используя только текстовые описания окружения. Первые тесты: GPT-5.4

Коротко

Что будет в материале

  1. 01

    Что такое бенчмарк «Лабиринт с ключом» и почему он отличается от стандартных тестов

  2. 02

    Результаты первых тестов: от бесцельного блуждания до эффективного решения

  3. 03

    Пространственное мышление LLM: от навигации к работе с инструментами

  4. 04

    Аналогия с экспериментами на животных: что это говорит об интеллекте моделей

Новый бенчмарк «Лабиринт с ключом» проверяет способность LLM ориентироваться в пространстве без карты. Модель получает только текстовые описания того, что видит перед собой, и должна найти ключ, а затем выход. Первые результаты показывают резкий разброс: GPT-5.4 mini и GLM-5.2 блуждают бесцельно, а K2.6 находит решение, затратив 9 миллионов токенов.

Этот тест отличается от стандартных бенчмарков навигации принципиальным ограничением. Модель вынуждена строить ментальную карту, отслеживая своё положение и ориентацию через инструменты перемещения и поворота. Обратная связь - текстовое описание ближайшего окружения после каждого действия. Никаких координат, никакой полной схемы лабиринта. Такой подход напоминает эксперименты по изучению пространственной памяти у животных, где крыса в водном лабиринте Морриса ищет скрытую платформу по визуальным подсказкам.

Для разработчиков и ML-инженеров, которые следят за развитием агентных способностей LLM, этот бенчмарк важен как индикатор умения модели работать с инструментами. Навигация в лабиринте - прокси для любой задачи, где нужно удерживать состояние, планировать цепочку действий и корректировать поведение по обратной связи. Управление API, многошаговые рассуждения, игры - все эти сценарии требуют того же типа мышления, что и поиск ключа в незнакомом лабиринте.

Что такое бенчмарк «Лабиринт с ключом» и почему он отличается от стандартных тестов

Большинство тестов на пространственное мышление дают модели полную карту или координаты. «Лабиринт с ключом» делает обратное. LLM помещается в неизвестную среду и видит только текстовое описание клеток, непосредственно доступных из текущей позиции. Задача: найти ключ, взять его и добраться до выхода.

Отличие от стандартных бенчмарков тройное. Во-первых, модель не получает глобальной информации о структуре лабиринта. Во-вторых, каждое действие меняет её позицию и ориентацию, что требует постоянного обновления внутреннего представления. В-третьих, успех зависит от способности совмещать навигацию с целевым поведением - сначала поиск ключа, затем поиск выхода.

Этот подход ближе к реальным задачам, чем тесты с полной картой. Когда LLM управляет API или выполняет многошаговый рабочий процесс, она тоже не видит всей системы целиком. Есть текущее состояние, доступные действия и обратная связь. Способность строить модель среды по ограниченным данным - ключевой навык для агентных систем.

Механика теста: как LLM взаимодействует с лабиринтом

Взаимодействие построено на текстовом протоколе. Модель получает описание текущей позиции - что находится впереди, слева, справа и сзади. Доступные команды: движение вперёд, поворот на 90 градусов влево или вправо, взятие предмета. После каждого действия система возвращает новое описание окружения.

Формат обратной связи критически важен. Вместо координат модель видит фразы вроде «перед вами стена», «слева проход», «впереди ключ на полу». Это заставляет LLM самостоятельно отслеживать положение, направление и историю перемещений. Ошибка в повороте или забытый шаг могут привести к полной потере ориентации.

Технически это напоминает классические текстовые квесты, но с жёстким ограничением: никаких подсказок о глобальной структуре. Модель должна вывести топологию лабиринта из последовательности локальных наблюдений. Для этого требуется внутреннее моделирование пространства - способность, которую сложно свести к простому паттерн-матчингу на обучающих данных.

Результаты первых тестов: от бесцельного блуждания до эффективного решения

Первая выборка моделей дала контрастные результаты. GPT-5.4 mini и GLM-5.2 не справились с задачей. Их поведение описывается как бесцельное блуждание - модели перемещались по лабиринту, но не демонстрировали систематического поиска ключа или выхода. Они не могли удержать в памяти, какие участки уже посещены, и часто возвращались в одни и те же тупики.

K2.6 показала принципиально другой уровень. Модель нашла ключ и выбралась из лабиринта, затратив 9 миллионов токенов. Это много с точки зрения стоимости инференса, но результат демонстрирует, что задача решаема для LLM при достаточном объёме контекстного окна и развитых механизмах внутреннего моделирования.

Важно отметить предварительный характер этих данных. Выборка моделей мала, неизвестны конкретные метрики оценки эффективности кроме затрат токенов. Неясно, насколько результат зависит от формулировки промпта или случайного seed. Однако сам факт разброса от полного провала до успешного решения делает этот бенчмарк интересным инструментом для сравнения моделей.

Почему K2.6 справилась, а GPT-5.4 mini - нет: гипотезы

Разница в результатах может объясняться несколькими факторами. Первая гипотеза - архитектурная. K2.6 может иметь более развитые механизмы пространственного внимания или обучалась на синтетических данных, включающих задачи навигации. Если в тренировочном корпусе были примеры текстовых квестов или симуляций с отслеживанием позиции, модель могла выработать соответствующие внутренние репрезентации.

Вторая гипотеза связана с контекстным окном. 9 миллионов токенов - это большой объём, и K2.6 могла использовать его для хранения детальной истории перемещений. Фактически модель могла вести текстовый журнал своих действий и обращаться к нему при планировании следующих шагов. GPT-5.4 mini и GLM-5.2, возможно, имеют меньшее контекстное окно или хуже используют его для долгосрочного отслеживания состояния.

Третья гипотеза - качество обучения с подкреплением. Модели, прошедшие RLHF или другие формы alignment-тренировки, могут лучше планировать цепочки действий и корректировать поведение по обратной связи. Это согласуется с наблюдениями из других тестов: способность к последовательному рассуждению и самокоррекции часто коррелирует с качеством пост-тренинга. Эксперимент с catmind-1.2b показал, что переключение контекста вывода разрушает способность к решению задачи, что подтверждает связь между процессом мышления модели и её выходными токенами.

Пространственное мышление LLM: от навигации к работе с инструментами

Результаты теста «Лабиринт с ключом» важны за пределами самой задачи навигации. Способность ориентироваться в пространстве без карты - прокси для более широкого класса проблем, где модель должна работать с инструментами, отслеживать состояние и планировать последовательность действий.

Рассмотрим конкретные сценарии. При управлении API модель получает ответы на свои запросы и должна решать, какой вызов делать следующим. При многошаговых рассуждениях каждый новый вывод меняет контекст и требует переоценки доступных вариантов. В играх и симуляциях агент действует в среде с неизвестной структурой, получая обратную связь после каждого хода. Все эти задачи изоморфны навигации в лабиринте.

Для ML-инженера, выбирающего модель под агентный фреймворк, результаты такого бенчмарка дают практическую информацию. Модель, которая теряется в лабиринте, с высокой вероятностью будет терять контекст при длинных цепочках вызовов API. Модель, которая строит эффективную стратегию поиска, вероятно, лучше справится с планированием в production-сценариях. Переход от unit-тестов к end-to-end оценкам агентов - тренд, который этот бенчмарк хорошо иллюстрирует.

Аналогия с экспериментами на животных: что это говорит об интеллекте моделей

Параллель с когнитивной наукой не случайна. Водный лабиринт Морриса - классический тест на пространственную память у грызунов. Животное помещается в бассейн с мутной водой и должно найти скрытую платформу, ориентируясь по визуальным меткам на стенах комнаты. После нескольких попыток крыса строит когнитивную карту и плывёт к платформе напрямую из любой точки.

Ключевое сходство с бенчмарком для LLM - необходимость формировать внутреннее представление пространства по ограниченным данным. Крыса не видит платформу, но может вычислить её положение относительно меток. LLM не видит карту, но может вывести структуру лабиринта из последовательности текстовых описаний. В обоих случаях успех зависит от способности интегрировать разрозненные наблюдения в целостную модель среды.

Успех K2.6 можно интерпретировать как зачаток подобной способности у языковых моделей. Однако важно не переоценивать аналогию. Крыса решает задачу за счёт эволюционно отточенных нейронных механизмов пространственной навигации. LLM делает это через статистические паттерны в текстовых данных. Это принципиально разные механизмы, даже если внешнее поведение выглядит похоже.

Ограничения теста и открытые вопросы

Честная оценка ограничений необходима для правильного использования бенчмарка. Выборка из трёх моделей слишком мала для обобщений. Неизвестно, насколько результат зависит от конкретной конфигурации лабиринта, формулировки промпта или случайного seed. Воспроизводимость - открытый вопрос.

Затраты в 9 миллионов токенов для K2.6 - это дорого. При текущих ценах на инференс такое решение задачи непрактично для production-сценариев. Возникает вопрос: является ли этот бенчмарк лучшим индикатором пространственного мышления или нужны более сложные лабиринты, где эффективность стратегии будет важнее, чем возможность решить задачу любой ценой?

Ещё одно ограничение - отсутствие сравнения с человеческим уровнем. Насколько сложен лабиринт для человека, получающего такие же текстовые описания? Без этого бенчмарка сложно калибровать результаты. Модель, тратящая 9 миллионов токенов на задачу, которую человек решает за 50 шагов, демонстрирует не столько интеллект, сколько способность компенсировать отсутствие пространственного мышления грубой вычислительной силой.

Отдельный вопрос - связь с другими метриками. Коррелирует ли успех в лабиринте с результатами на бенчмарках визуально-логических способностей или тестах на evaluation awareness? Пока данных нет, но это направление для будущих исследований.

Перспективы: станет ли «Лабиринт с ключом» стандартным бенчмарком?

Подобные тесты имеют шансы войти в стандартные наборы для оценки агентных способностей LLM. Текстовые квесты уже используются как бенчмарки, но «Лабиринт с ключом» выделяется строгостью протокола и чёткой метрикой успеха. Модель либо находит ключ и выход, либо нет. Это даёт бинарный, легко интерпретируемый результат.

Для включения в стандартную батарею тестов потребуется решить несколько задач. Нужна большая выборка моделей для установления базовых уровней. Нужны вариации лабиринтов разной сложности - от простых до многоуровневых. Нужна стандартизация промптов и метрик эффективности, включая не только факт решения, но и оптимальность пути.

Практическая ценность для сообщества уже просматривается. Разработчики агентных систем могут использовать этот бенчмарк для быстрой отбраковки моделей, не способных удерживать состояние. Исследователи получают инструмент для изучения пространственного мышления в LLM. А появление моделей вроде Laguna S 2.1 с сильными результатами на Terminal-Bench показывает, что индустрия движется в сторону более сложных, агентно-ориентированных тестов.

Подписаться на канал