Перейти к содержанию
Публикация AiManual

BDH от Pathway: brain-inspired архитектура без chain-of-thought и запуск на Amazon SageMaker HyperPod

BDH от Pathway убирает chain-of-thought из уравнения: рассуждения идут в латентном состоянии, активны около 5% нейронов, а результат на ARC-AGI-1 заявлен при ст

Коротко

Что будет в материале

  1. 01

    Что такое BDH от Pathway и почему о нём говорят

  2. 02

    Проблемы трансформеров, которые мотивировали создание BDH

  3. 03

    Как работает BDH: латентные рассуждения вместо цепочки мыслей

  4. 04

    Результаты BDH-CQ на ARC-AGI-1: что говорят цифры

BDH (Baby Dragon Hatchling) - пост-трансформерная архитектура от компании Pathway. Рассуждения в ней идут в латентном пространстве, без генерации токенов цепочки мыслей (chain-of-thought). Взаимодействия между нейронами разреженные и локальные, активна небольшая их доля, порядка 5%, а состояние хранится в синапсоподобных связях, а не в KV-кэше.

Заявленные цифры такие: вариант BDH-CQ показывает 29,5% pass@2 на бенчмарке ARC-AGI-1 при стоимости около $0,0007 за задачу. Обучение масштабировали на Amazon SageMaker HyperPod, на инстансах EC2 p5en.48xlarge с GPU NVIDIA H200, в сети EFA и кластерах EC2 UltraCluster, а наблюдаемость вели через Prometheus и Grafana.

Сразу оговорка, без которой текст превратится в рекламу: все цифры и характеристики заявлены командой Pathway. Независимого воспроизведения нет, публичных весов и кода для проверки тоже. Ниже разбираем, что именно предлагает архитектура, откуда взялись эти числа и где границы применимости.

Что такое BDH от Pathway и почему о нём говорят

BDH - это архитектура, в которой модель думает перед ответом, но не рассказывает, как именно. Шаги рассуждения остаются внутри скрытого состояния и не превращаются в токены. Именно это отличает BDH от привычной схемы, где модель генерирует длинную цепочку мыслей, а пользователь платит за каждый её токен.

Кто стоит за BDH: Pathway и контекст проекта

Pathway - компания, известная в области обработки данных в реальном времени и AI-инфраструктуры. У неё есть движок для потоковых пайплайнов и опыт работы с задачами, где данные приходят непрерывно. BDH - исследовательское направление той же команды, посвящённое пост-трансформерным архитектурам.

Это важный контекст. Эксперименты с альтернативами attention ведут и одиночные разработчики, и крупные лаборатории: от разреженных рекуррентных графов до перестройки residual stream. Работа Pathway относится к тому же классу исследований, но с акцентом на вычислительную экономику. Само название Baby Dragon Hatchling намекает на стадию проекта.

Почему 'brain-inspired' - это не маркетинг, а конкретный набор решений

Слово "brain-inspired" в описаниях AI-моделей встречается часто и обычно не значит почти ничего. Здесь за ним стоят три конкретные характеристики: разреженные локальные взаимодействия между нейронами, хранение состояния в синапсоподобных связях и отсутствие глобального attention.

В трансформере каждый токен на каждом слое взаимодействует со всеми остальными через attention. Это плотные вычисления, и их стоимость растёт квадратично по длине последовательности. В BDH активна небольшая доля нейронов, порядка 5%, а связи локальные. Меньше активных элементов на шаг означает меньше операций на шаг.

Сравните с тем, как другие команды правят архитектуру, не отказываясь от attention. В проекте AttnRes residual stream в Gemma 4 31B заменяют на attention-based routing, чтобы модель сама маршрутизировала информацию между слоями. Исходная парадигма сохраняется, меняется только способ передачи сигнала: разбор AttnRes с дистилляцией и weaning-графиком.

Проблемы трансформеров, которые мотивировали создание BDH

BDH появилась не на пустом месте. У трансформеров есть три структурных ограничения, которые бьют по конкретным сценариям: квадратичная сложность attention, стоимость генерации CoT-токенов и фиксированное контекстное окно.

Chain-of-thought: почему генерация токенов для рассуждений - это дорого

Chain-of-thought повышает качество на задачах рассуждения. У этого есть цена: каждый шаг рассуждения - отдельный токен, который модель генерирует на инференсе. Цепочка из 500-2000 токенов на задачу означает соответствующий рост времени ответа и денег.

Для одиночного чата это терпимо. Для агента, который выполняет сотни шагов, стоимость умножается на длину цепочки и на число вызовов. Именно поэтому в агентных пайплайнах экономия на рассуждениях даёт больше, чем экономия на самом ответе.

Фиксированное контекстное окно как архитектурный тупик

Увеличение окна до сотен тысяч и миллионов токенов проблему не снимает. Attention дорожает, качество на длинных контекстах падает, а состояние всё равно нужно где-то хранить. Модель не "помнит" в человеческом смысле: она заново пересчитывает связи между всеми токенами окна.

Альтернатива - рекуррентное состояние, которое обновляется шаг за шагом и не привязано к длине окна. Такой подход был у RNN и LSTM, но там мешали затухающие градиенты и слабая параллелизация. BDH пытается вернуть идею состояния без этих издержек.

Как работает BDH: латентные рассуждения вместо цепочки мыслей

Главная идея: рассуждение идёт не в тексте, а в векторах скрытого состояния. Модель может потратить на задачу несколько итераций внутренних вычислений, и ни одна из них не превращается в видимый токен.

Рекуррентное латентное состояние: что это и зачем

Представьте, что модель получает вход, обновляет своё внутреннее представление и делает это несколько раз, прежде чем выдать ответ. Каждое обновление - шаг рассуждения. Внешне это выглядит как пауза перед ответом, внутри - последовательность матричных операций над вектором состояния.

Ключевое отличие от CoT в том, где происходит вычисление. CoT переносит рассуждение в пространство токенов: чтобы подумать, модель должна сгенерировать текст. Латентное рассуждение оставляет вычисление в векторном пространстве, а генерация токенов нужна только для финального ответа.

Экономия складывается из двух вещей. Первая: не нужно платить за токены промежуточных шагов. Вторая: число итераций можно подбирать под сложность задачи, тратя больше вычислений там, где это нужно.

BDH-CQ: итеративные вычисления и их роль

BDH-CQ - вариант архитектуры с итеративными вычислениями в рекуррентном латентном состоянии. Модель выполняет несколько проходов по состоянию, уточняя его, вместо одного прямого прохода от входа к выходу.

Логика перекликается с идеей адаптивных вычислений: на простых примерах хватит одной-двух итераций, на сложных - больше. Такой подход позволяет держать среднюю стоимость низкой, не урезая качество на трудных задачах.

Что важно: насколько именно число итераций влияет на точность и как оно выбирается, публично не показано. Это одна из ключевых вещей, которую придётся проверять воспроизведением.

Разреженные взаимодействия: почему активны только ~5% нейронов

Заявленная характеристика: на каждом шаге активна небольшая доля нейронов, около 5%, а взаимодействия локальные. В плотных слоях трансформера участвуют все элементы, и это основная статья расходов на вычисления.

Разреженность даёт три эффекта: меньше операций на шаг, меньше энергопотребления и потенциально лучшее масштабирование по числу параметров. Обратная сторона - сложнее обучать. Разреженные градиенты ведут себя нестабильно, а маршрутизация между активными элементами требует аккуратной настройки.

Подчеркну: 5% - заявленное число, а не измеренное независимо. Независимой проверки этой характеристики нет.

Результаты BDH-CQ на ARC-AGI-1: что говорят цифры

Что такое ARC-AGI-1 и почему на нём сложно показывать результаты

ARC-AGI-1 - бенчмарк на обобщение. Задачи там выглядят как головоломки с сетками: даны несколько примеров преобразования, нужно применить правило к новому примеру. Правило не описано словами, его нужно вывести из примеров.

Сложность в том, что задачи не встречались в обучении. Модель не может опереться на заученный шаблон, ей нужно построить правило с нуля на нескольких примерах. Трансформеры с CoT показывают на этом наборе скромные результаты, особенно без специальной подгонки.

Отсюда и внимание к 29,5% pass@2. Pass@2 означает две попытки на задачу: если хотя бы один ответ верный, задача засчитана. Это мягче, чем pass@1, и при сравнении с другими системами важно смотреть, какая метрика использовалась.

Компромисс между точностью и стоимостью: $0,0007 за задачу

Вторая заявленная цифра интереснее первой: около $0,0007 за задачу. Если она подтвердится, это на порядки дешевле, чем решать такие задачи через длинные CoT-цепочки на большой модели.

Экономика здесь и есть основной аргумент. Точность 29,5% на ARC-AGI-1 не делает BDH лидером бенчмарка. Но если тот же результат достигается за доли цента, меняется не место в таблице, а сама возможность применять метод там, где раньше считали бюджет.

Как оценивать такие заявления, хорошо видно на примере сравнений открытых и проприетарных моделей в кодинге, где итог сильно зависит от методики и обвязки: разбор методологии оценки агентов у Databricks. Тот же принцип применим к BDH: важен не только процент, но и то, как он получен.

Инфраструктура: запуск BDH на Amazon SageMaker HyperPod

Отдельная часть истории - обучение. Модели с рекуррентным состоянием и разреженными взаимодействиями плохо ложатся на один узел: нужны кластер, быстрая сеть и наблюдаемость.

SageMaker HyperPod: зачем нужен управляемый кластер для обучения

Amazon SageMaker HyperPod - управляемый сервис для обучения больших моделей на кластерах GPU. Он берёт на себя подготовку узлов, восстановление после сбоев и оркестрацию задач. При обучении на сотнях GPU один упавший узел может остановить весь процесс, а HyperPod следит за этим и заменяет вышедшие из строя узлы.

Для длительных прогонов это критично. Ошибки железные, а не программные: перегрев, отвал сети, деградация диска. Ручное восстановление большого кластера превращается в работу на полную ставку.

Стек AWS для таких задач развивается: в статье про партнёрство Hugging Face и AWS разобрано, как обучение и инференс open-source моделей переезжают на SageMaker с чипами Trainium и Inferentia.

EC2 p5en.48xlarge и NVIDIA H200: что даёт такое железо

Инстансы EC2 p5en.48xlarge укомплектованы GPU NVIDIA H200. Это флагманские ускорители для AI-нагрузок с большим объёмом памяти и высокой пропускной способностью памяти. Чем больше модель и чем выше требования к пропускной способности, тем важнее именно эти параметры, а не только число FLOPS.

Для рекуррентных архитектур память значит много. Состояние нужно хранить и обновлять на каждом шаге, а при больших батчах и длинных последовательностях давление на память растёт. H200 здесь не роскошь, а способ уложиться в бюджет по времени обучения.

Выбор железа вообще не сводится к H200. Есть альтернативы от других вендоров: обучение BridgeTower на Habana Gaudi2 показало 847.7 samples/s, что в 1.4 раза быстрее H100 и в 2.5 раза быстрее A100 80GB в том же сценарии, разбор media pipeline и ограничений метода.

EFA и EC2 UltraCluster: сеть как узкое место обучения

EFA (Elastic Fabric Adapter) - сетевой интерфейс AWS для плотной межнодовой коммуникации с низкими задержками. В распределённом обучении обмен градиентами и синхронизация идут постоянно, и именно сеть часто определяет, растёт ли скорость вместе с числом GPU.

EC2 UltraCluster объединяет инстансы в сеть с высокой пропускной способностью, что позволяет масштабироваться на тысячи ускорителей. Если сеть медленная, GPU простаивают в ожидании данных, и деньги за аренду уходят впустую.

С разреженными связями картина усложняется: коммуникация становится нерегулярной, а такие паттерны упаковать в эффективные коллективные операции сложнее, чем плотные слои трансформера. Это одна из причин, по которой инфраструктурная часть здесь так же важна, как сама архитектура.

Наблюдаемость на Prometheus и Grafana: зачем мониторить обучение

Prometheus собирает метрики, Grafana их визуализирует. Для обучения на кластере это не украшение, а инструмент отладки. Loss, скорость обработки батчей, загрузка GPU, температура, объём сетевого трафика: без этих данных причина падения качества или замедления остаётся загадкой.

На длинных прогонах полезно видеть не только итоговый loss, но и его производные: как меняется градиентная норма, нет ли скачков, стабильно ли ведут себя слои. С рекуррентными архитектурами это особенно актуально, потому что ошибки на ранних шагах накапливаются по всей длине последовательности.

Практические сценарии: где BDH-подобные архитектуры могут выиграть

Кибербезопасность: длинные цепочки событий и аномалии

Анализ логов безопасности упирается в длину контекста. События приходят потоком, а подозрительная активность часто проявляется в связях между действиями, разнесёнными во времени на дни и недели. Запихивать это в контекстное окно дорого, а иногда невозможно.

Архитектура с рекуррентным состоянием может накапливать представление о поведении системы и обновлять его по мере поступления событий. Тогда длинная история не требует повторной обработки всего окна: состояние уже содержит сжатую картину.

Оговорка та же: это потенциальный сценарий, а не подтверждённое применение. Промышленных проектов на BDH в кибербезопасности нет.

Автономные агенты: рассуждения без генерации токенов

Агент выполняет длинные цепочки действий: вызвать инструмент, разобрать ответ, решить, что делать дальше. Если каждый шаг сопровождается портянкой рассуждений, стоимость растёт линейно по числу шагов, а задержка делает агента медленным.

Латентные рассуждения меняют эту арифметику. Модель тратит вычисления внутри, но не генерирует лишние токены на каждом шаге. Для сценариев с сотнями шагов, будь то обработка тикетов, обход API или извлечение данных, разница может оказаться решающей.

Ограничения и риски: что важно понимать до того, как вкладываться

Незрелость технологии: от статьи до продакшена

BDH - исследовательская работа. Между публикацией результатов и продакшеном лежит длинный путь: воспроизведение, ablation-исследования, проверка на других доменах, работа с длинными контекстами и стабильность при обучении на больших объёмах данных.

История AI полна архитектур, которые показывали красивые числа на одном бенчмарке и не выдерживали масштабирования. Планировать продуктовые решения на основе текущих цифр BDH рано.

Что не подтверждено независимо

Список заявленного, но не проверенного сторонними: 29,5% pass@2 на ARC-AGI-1, около $0,0007 за задачу, ~5% активных нейронов. Нет публичных весов, нет отчёта о воспроизведении, нет сравнения на других бенчмарках.

Отдельный вопрос - как архитектура масштабируется. Результат на модели одного размера не говорит, что получится при увеличении числа параметров и данных. Рекуррентные сети нередко хорошо ведут себя на малых масштабах и начинают буксовать на больших.

Трансформеры остаются стандартом, и причины тому не только инерция: экосистема, инструменты, оптимизированные ядра, огромный корпус практик. Любая альтернатива конкурирует не с одной моделью, а со всей инфраструктурой вокруг неё.

Что делать с этой информацией: практический вывод

За чем следить и где искать первоисточники

Первоисточник - материалы команды Pathway по BDH. Отдельно стоит читать публикации по ARC-AGI-1, чтобы понимать, как устроена метрика и почему pass@2 и pass@1 несопоставимы. По инфраструктуре полезны материалы про Amazon SageMaker HyperPod и инстансы p5en.

Практическая ценность сейчас в самих идеях, а не в коде. Рекуррентное латентное состояние, разреженные взаимодействия, отказ от фиксированного окна: эти приёмы всплывают в разных проектах, и понимание логики помогает оценивать другие архитектуры.

Стоит ли ждать BDH в локальном запуске

Нет. Обучение шло на кластере уровня SageMaker HyperPod с GPU H200, а это инфраструктура датацентра, не домашний сервер. Если появятся открытые веса и квантованные версии, разговор будет другим, но сейчас предпосылок для локального запуска нет.

Для домашних задач смотреть стоит на модели, которые реально работают на потребительском железе. Ориентир по производительности: на 8 GPU GB10 модель GLM-5.2 показывает 1200 токенов/с на prefill и 33-54 токен/с на decode при квантовании Int4/Int8, что позволяет держать несколько моделей в памяти: разбор с цифрами и последствиями для 2026 года.

Следить за BDH стоит по одной причине: если хотя бы часть заявленных цифр подтвердится на больших масштабах, экономика инференса для агентных задач может измениться заметно. Пока это гипотеза с интересными обоснованиями. AI-Manual продолжит следить за темой.

Подписаться на канал