BDH (Baby Dragon Hatchling) - пост-трансформерная архитектура от компании Pathway. Рассуждения в ней идут в латентном пространстве, без генерации токенов цепочки мыслей (chain-of-thought). Взаимодействия между нейронами разреженные и локальные, активна небольшая их доля, порядка 5%, а состояние хранится в синапсоподобных связях, а не в KV-кэше.
Заявленные цифры такие: вариант BDH-CQ показывает 29,5% pass@2 на бенчмарке ARC-AGI-1 при стоимости около $0,0007 за задачу. Обучение масштабировали на Amazon SageMaker HyperPod, на инстансах EC2 p5en.48xlarge с GPU NVIDIA H200, в сети EFA и кластерах EC2 UltraCluster, а наблюдаемость вели через Prometheus и Grafana.
Сразу оговорка, без которой текст превратится в рекламу: все цифры и характеристики заявлены командой Pathway. Независимого воспроизведения нет, публичных весов и кода для проверки тоже. Ниже разбираем, что именно предлагает архитектура, откуда взялись эти числа и где границы применимости.
Что такое BDH от Pathway и почему о нём говорят
BDH - это архитектура, в которой модель думает перед ответом, но не рассказывает, как именно. Шаги рассуждения остаются внутри скрытого состояния и не превращаются в токены. Именно это отличает BDH от привычной схемы, где модель генерирует длинную цепочку мыслей, а пользователь платит за каждый её токен.
Кто стоит за BDH: Pathway и контекст проекта
Pathway - компания, известная в области обработки данных в реальном времени и AI-инфраструктуры. У неё есть движок для потоковых пайплайнов и опыт работы с задачами, где данные приходят непрерывно. BDH - исследовательское направление той же команды, посвящённое пост-трансформерным архитектурам.
Это важный контекст. Эксперименты с альтернативами attention ведут и одиночные разработчики, и крупные лаборатории: от разреженных рекуррентных графов до перестройки residual stream. Работа Pathway относится к тому же классу исследований, но с акцентом на вычислительную экономику. Само название Baby Dragon Hatchling намекает на стадию проекта.
Почему 'brain-inspired' - это не маркетинг, а конкретный набор решений
Слово "brain-inspired" в описаниях AI-моделей встречается часто и обычно не значит почти ничего. Здесь за ним стоят три конкретные характеристики: разреженные локальные взаимодействия между нейронами, хранение состояния в синапсоподобных связях и отсутствие глобального attention.
В трансформере каждый токен на каждом слое взаимодействует со всеми остальными через attention. Это плотные вычисления, и их стоимость растёт квадратично по длине последовательности. В BDH активна небольшая доля нейронов, порядка 5%, а связи локальные. Меньше активных элементов на шаг означает меньше операций на шаг.
Сравните с тем, как другие команды правят архитектуру, не отказываясь от attention. В проекте AttnRes residual stream в Gemma 4 31B заменяют на attention-based routing, чтобы модель сама маршрутизировала информацию между слоями. Исходная парадигма сохраняется, меняется только способ передачи сигнала: разбор AttnRes с дистилляцией и weaning-графиком.
Проблемы трансформеров, которые мотивировали создание BDH
BDH появилась не на пустом месте. У трансформеров есть три структурных ограничения, которые бьют по конкретным сценариям: квадратичная сложность attention, стоимость генерации CoT-токенов и фиксированное контекстное окно.
Chain-of-thought: почему генерация токенов для рассуждений - это дорого
Chain-of-thought повышает качество на задачах рассуждения. У этого есть цена: каждый шаг рассуждения - отдельный токен, который модель генерирует на инференсе. Цепочка из 500-2000 токенов на задачу означает соответствующий рост времени ответа и денег.
Для одиночного чата это терпимо. Для агента, который выполняет сотни шагов, стоимость умножается на длину цепочки и на число вызовов. Именно поэтому в агентных пайплайнах экономия на рассуждениях даёт больше, чем экономия на самом ответе.
Фиксированное контекстное окно как архитектурный тупик
Увеличение окна до сотен тысяч и миллионов токенов проблему не снимает. Attention дорожает, качество на длинных контекстах падает, а состояние всё равно нужно где-то хранить. Модель не "помнит" в человеческом смысле: она заново пересчитывает связи между всеми токенами окна.
Альтернатива - рекуррентное состояние, которое обновляется шаг за шагом и не привязано к длине окна. Такой подход был у RNN и LSTM, но там мешали затухающие градиенты и слабая параллелизация. BDH пытается вернуть идею состояния без этих издержек.
Как работает BDH: латентные рассуждения вместо цепочки мыслей
Главная идея: рассуждение идёт не в тексте, а в векторах скрытого состояния. Модель может потратить на задачу несколько итераций внутренних вычислений, и ни одна из них не превращается в видимый токен.
Рекуррентное латентное состояние: что это и зачем
Представьте, что модель получает вход, обновляет своё внутреннее представление и делает это несколько раз, прежде чем выдать ответ. Каждое обновление - шаг рассуждения. Внешне это выглядит как пауза перед ответом, внутри - последовательность матричных операций над вектором состояния.
Ключевое отличие от CoT в том, где происходит вычисление. CoT переносит рассуждение в пространство токенов: чтобы подумать, модель должна сгенерировать текст. Латентное рассуждение оставляет вычисление в векторном пространстве, а генерация токенов нужна только для финального ответа.
Экономия складывается из двух вещей. Первая: не нужно платить за токены промежуточных шагов. Вторая: число итераций можно подбирать под сложность задачи, тратя больше вычислений там, где это нужно.
BDH-CQ: итеративные вычисления и их роль
BDH-CQ - вариант архитектуры с итеративными вычислениями в рекуррентном латентном состоянии. Модель выполняет несколько проходов по состоянию, уточняя его, вместо одного прямого прохода от входа к выходу.
Логика перекликается с идеей адаптивных вычислений: на простых примерах хватит одной-двух итераций, на сложных - больше. Такой подход позволяет держать среднюю стоимость низкой, не урезая качество на трудных задачах.
Что важно: насколько именно число итераций влияет на точность и как оно выбирается, публично не показано. Это одна из ключевых вещей, которую придётся проверять воспроизведением.
Разреженные взаимодействия: почему активны только ~5% нейронов
Заявленная характеристика: на каждом шаге активна небольшая доля нейронов, около 5%, а взаимодействия локальные. В плотных слоях трансформера участвуют все элементы, и это основная статья расходов на вычисления.
Разреженность даёт три эффекта: меньше операций на шаг, меньше энергопотребления и потенциально лучшее масштабирование по числу параметров. Обратная сторона - сложнее обучать. Разреженные градиенты ведут себя нестабильно, а маршрутизация между активными элементами требует аккуратной настройки.
Подчеркну: 5% - заявленное число, а не измеренное независимо. Независимой проверки этой характеристики нет.
Результаты BDH-CQ на ARC-AGI-1: что говорят цифры
Что такое ARC-AGI-1 и почему на нём сложно показывать результаты
ARC-AGI-1 - бенчмарк на обобщение. Задачи там выглядят как головоломки с сетками: даны несколько примеров преобразования, нужно применить правило к новому примеру. Правило не описано словами, его нужно вывести из примеров.
Сложность в том, что задачи не встречались в обучении. Модель не может опереться на заученный шаблон, ей нужно построить правило с нуля на нескольких примерах. Трансформеры с CoT показывают на этом наборе скромные результаты, особенно без специальной подгонки.
Отсюда и внимание к 29,5% pass@2. Pass@2 означает две попытки на задачу: если хотя бы один ответ верный, задача засчитана. Это мягче, чем pass@1, и при сравнении с другими системами важно смотреть, какая метрика использовалась.
Компромисс между точностью и стоимостью: $0,0007 за задачу
Вторая заявленная цифра интереснее первой: около $0,0007 за задачу. Если она подтвердится, это на порядки дешевле, чем решать такие задачи через длинные CoT-цепочки на большой модели.
Экономика здесь и есть основной аргумент. Точность 29,5% на ARC-AGI-1 не делает BDH лидером бенчмарка. Но если тот же результат достигается за доли цента, меняется не место в таблице, а сама возможность применять метод там, где раньше считали бюджет.
Как оценивать такие заявления, хорошо видно на примере сравнений открытых и проприетарных моделей в кодинге, где итог сильно зависит от методики и обвязки: разбор методологии оценки агентов у Databricks. Тот же принцип применим к BDH: важен не только процент, но и то, как он получен.
Инфраструктура: запуск BDH на Amazon SageMaker HyperPod
Отдельная часть истории - обучение. Модели с рекуррентным состоянием и разреженными взаимодействиями плохо ложатся на один узел: нужны кластер, быстрая сеть и наблюдаемость.
SageMaker HyperPod: зачем нужен управляемый кластер для обучения
Amazon SageMaker HyperPod - управляемый сервис для обучения больших моделей на кластерах GPU. Он берёт на себя подготовку узлов, восстановление после сбоев и оркестрацию задач. При обучении на сотнях GPU один упавший узел может остановить весь процесс, а HyperPod следит за этим и заменяет вышедшие из строя узлы.
Для длительных прогонов это критично. Ошибки железные, а не программные: перегрев, отвал сети, деградация диска. Ручное восстановление большого кластера превращается в работу на полную ставку.
Стек AWS для таких задач развивается: в статье про партнёрство Hugging Face и AWS разобрано, как обучение и инференс open-source моделей переезжают на SageMaker с чипами Trainium и Inferentia.
EC2 p5en.48xlarge и NVIDIA H200: что даёт такое железо
Инстансы EC2 p5en.48xlarge укомплектованы GPU NVIDIA H200. Это флагманские ускорители для AI-нагрузок с большим объёмом памяти и высокой пропускной способностью памяти. Чем больше модель и чем выше требования к пропускной способности, тем важнее именно эти параметры, а не только число FLOPS.
Для рекуррентных архитектур память значит много. Состояние нужно хранить и обновлять на каждом шаге, а при больших батчах и длинных последовательностях давление на память растёт. H200 здесь не роскошь, а способ уложиться в бюджет по времени обучения.
Выбор железа вообще не сводится к H200. Есть альтернативы от других вендоров: обучение BridgeTower на Habana Gaudi2 показало 847.7 samples/s, что в 1.4 раза быстрее H100 и в 2.5 раза быстрее A100 80GB в том же сценарии, разбор media pipeline и ограничений метода.
EFA и EC2 UltraCluster: сеть как узкое место обучения
EFA (Elastic Fabric Adapter) - сетевой интерфейс AWS для плотной межнодовой коммуникации с низкими задержками. В распределённом обучении обмен градиентами и синхронизация идут постоянно, и именно сеть часто определяет, растёт ли скорость вместе с числом GPU.
EC2 UltraCluster объединяет инстансы в сеть с высокой пропускной способностью, что позволяет масштабироваться на тысячи ускорителей. Если сеть медленная, GPU простаивают в ожидании данных, и деньги за аренду уходят впустую.
С разреженными связями картина усложняется: коммуникация становится нерегулярной, а такие паттерны упаковать в эффективные коллективные операции сложнее, чем плотные слои трансформера. Это одна из причин, по которой инфраструктурная часть здесь так же важна, как сама архитектура.
Наблюдаемость на Prometheus и Grafana: зачем мониторить обучение
Prometheus собирает метрики, Grafana их визуализирует. Для обучения на кластере это не украшение, а инструмент отладки. Loss, скорость обработки батчей, загрузка GPU, температура, объём сетевого трафика: без этих данных причина падения качества или замедления остаётся загадкой.
На длинных прогонах полезно видеть не только итоговый loss, но и его производные: как меняется градиентная норма, нет ли скачков, стабильно ли ведут себя слои. С рекуррентными архитектурами это особенно актуально, потому что ошибки на ранних шагах накапливаются по всей длине последовательности.
Практические сценарии: где BDH-подобные архитектуры могут выиграть
Кибербезопасность: длинные цепочки событий и аномалии
Анализ логов безопасности упирается в длину контекста. События приходят потоком, а подозрительная активность часто проявляется в связях между действиями, разнесёнными во времени на дни и недели. Запихивать это в контекстное окно дорого, а иногда невозможно.
Архитектура с рекуррентным состоянием может накапливать представление о поведении системы и обновлять его по мере поступления событий. Тогда длинная история не требует повторной обработки всего окна: состояние уже содержит сжатую картину.
Оговорка та же: это потенциальный сценарий, а не подтверждённое применение. Промышленных проектов на BDH в кибербезопасности нет.
Автономные агенты: рассуждения без генерации токенов
Агент выполняет длинные цепочки действий: вызвать инструмент, разобрать ответ, решить, что делать дальше. Если каждый шаг сопровождается портянкой рассуждений, стоимость растёт линейно по числу шагов, а задержка делает агента медленным.
Латентные рассуждения меняют эту арифметику. Модель тратит вычисления внутри, но не генерирует лишние токены на каждом шаге. Для сценариев с сотнями шагов, будь то обработка тикетов, обход API или извлечение данных, разница может оказаться решающей.
Ограничения и риски: что важно понимать до того, как вкладываться
Незрелость технологии: от статьи до продакшена
BDH - исследовательская работа. Между публикацией результатов и продакшеном лежит длинный путь: воспроизведение, ablation-исследования, проверка на других доменах, работа с длинными контекстами и стабильность при обучении на больших объёмах данных.
История AI полна архитектур, которые показывали красивые числа на одном бенчмарке и не выдерживали масштабирования. Планировать продуктовые решения на основе текущих цифр BDH рано.
Что не подтверждено независимо
Список заявленного, но не проверенного сторонними: 29,5% pass@2 на ARC-AGI-1, около $0,0007 за задачу, ~5% активных нейронов. Нет публичных весов, нет отчёта о воспроизведении, нет сравнения на других бенчмарках.
Отдельный вопрос - как архитектура масштабируется. Результат на модели одного размера не говорит, что получится при увеличении числа параметров и данных. Рекуррентные сети нередко хорошо ведут себя на малых масштабах и начинают буксовать на больших.
Трансформеры остаются стандартом, и причины тому не только инерция: экосистема, инструменты, оптимизированные ядра, огромный корпус практик. Любая альтернатива конкурирует не с одной моделью, а со всей инфраструктурой вокруг неё.
Что делать с этой информацией: практический вывод
За чем следить и где искать первоисточники
Первоисточник - материалы команды Pathway по BDH. Отдельно стоит читать публикации по ARC-AGI-1, чтобы понимать, как устроена метрика и почему pass@2 и pass@1 несопоставимы. По инфраструктуре полезны материалы про Amazon SageMaker HyperPod и инстансы p5en.
Практическая ценность сейчас в самих идеях, а не в коде. Рекуррентное латентное состояние, разреженные взаимодействия, отказ от фиксированного окна: эти приёмы всплывают в разных проектах, и понимание логики помогает оценивать другие архитектуры.
Стоит ли ждать BDH в локальном запуске
Нет. Обучение шло на кластере уровня SageMaker HyperPod с GPU H200, а это инфраструктура датацентра, не домашний сервер. Если появятся открытые веса и квантованные версии, разговор будет другим, но сейчас предпосылок для локального запуска нет.
Для домашних задач смотреть стоит на модели, которые реально работают на потребительском железе. Ориентир по производительности: на 8 GPU GB10 модель GLM-5.2 показывает 1200 токенов/с на prefill и 33-54 токен/с на decode при квантовании Int4/Int8, что позволяет держать несколько моделей в памяти: разбор с цифрами и последствиями для 2026 года.
Следить за BDH стоит по одной причине: если хотя бы часть заявленных цифр подтвердится на больших масштабах, экономика инференса для агентных задач может измениться заметно. Пока это гипотеза с интересными обоснованиями. AI-Manual продолжит следить за темой.