Перейти к содержанию
Публикация AiManual

Архитектура суперузлов Huawei Atlas 950: как 1024 NPU и 256 ТБ общей памяти меняют правила игры в AI-инфраструктуре

Что такое Huawei Atlas 950 SuperPoD и как устроены HCCS, 1024 NPU Ascend 910C и заявленная общая память 256 ТБ. Разбираем масштабирование AI-инфраструктуры, сра

Коротко

Что будет в материале

  1. 01

    Главное в двух словах

  2. 02

    Введение: почему анонс Atlas 950 на WAIC 2026 — это важный сигнал для рынка AI-инфраструктуры

  3. 03

    Архитектурный прорыв: как устроен суперузел Atlas 950 SuperPoD

  4. 04

    Масштабирование до 500 000 ускорителей: инфраструктура для экзафлопсных вычислений

Huawei Atlas 950 SuperPoD — это анонсированная на WAIC 2026 вычислительная платформа, объединяющая 1024 NPU Ascend 910C и заявленную общую память объёмом 256 ТБ через системную шину HCCS. Для AI-инфраструктуры важен сам подход: Huawei пытается масштабировать связный вычислительный домен за пределы привычных конфигураций GPU и одновременно снизить зависимость от стека NVIDIA. При этом значительная часть характеристик известна по заявлению Huawei, поэтому их нельзя автоматически трактовать как результаты независимых практических тестов. Инженерам и техлидам Atlas 950 интересен прежде всего как платформа для очень крупных моделей, но её применимость ограничивают стоимость, доступность и зрелость программной экосистемы.

Ключевая идея решения не только в количестве чипов, а в собственной шине HCCS и попытке организовать когерентный доступ к памяти на уровне суперузла. Если заявленные параметры подтвердятся в поставляемой конфигурации, это уменьшит фрагментацию памяти и зависимость от межузловых коммуникаций. Однако такая архитектура не отменяет накладные расходы: задержка, топология, поддержка фреймворков и реальные коллективные операции всё равно определяют производительность конкретной модели.

Главное в двух словах

  • Что это: суперузел Huawei Atlas 950 SuperPoD с 1024 NPU Ascend 910C и заявленной общей памятью 256 ТБ.
  • Как устроено: внутри узла используется HCCS — системный интерконнект Huawei с аппаратной поддержкой когерентности памяти.
  • Где ценность: в размещении больших моделей и масштабировании обучения или инференса с меньшей зависимостью от межузловой сети.
  • Главное ограничение: сравнение с NVIDIA по числам не равно сравнению по практической зрелости CUDA, библиотек и инструментов.
  • Кому смотреть: операторам крупных ЦОД и командам, которым важны независимость от западного оборудования и работа с моделями большого размера.

Введение: почему анонс Atlas 950 на WAIC 2026 — это важный сигнал для рынка AI-инфраструктуры

Рынок AI-ускорителей последние пять лет в значительной степени сформирован NVIDIA. CUDA стала стандартом де-факто, а NVLink и NVSwitch — распространённым способом объединять GPU в связный вычислительный домен. Экспортные ограничения 2022–2025 годов усилили для Китая необходимость развивать собственные ускорители и программный стек. Atlas 950 SuperPoD можно рассматривать как результат этой стратегии, а не как доказанную замену всем конфигурациям NVIDIA.

Ключевые цифры анонса — 1024 NPU Ascend 910C в одном суперузле, 256 ТБ заявленной общей памяти и пропускная способность HCCS свыше 600 ГБ/с на соединение. Huawei связывает эти параметры с запуском инференса крупных моделей без квантования и обучением моделей с триллионами параметров на одном узле. Прямое сравнение с конфигурацией из 8 H100 по объёму памяти показывает разницу архитектурных подходов, но само по себе не описывает ни производительность, ни стоимость, ни эффективность всего решения.

Статья разбирает архитектуру Atlas 950 на уровне, достаточном для принятия предварительного инженерного решения: как устроен HCCS, за счёт чего заявлено масштабирование до 500 000 ускорителей, чем платформа отличается от NVIDIA и в каких сценариях она может быть применима уже сейчас.

Архитектурный прорыв: как устроен суперузел Atlas 950 SuperPoD

Atlas 950 SuperPoD — это не просто шасси с ускорителями. По описанию Huawei, 1024 NPU Ascend 910C объединены в единый домен памяти через многоуровневую топологию HCCS. Каждый NPU содержит 64 ГБ HBM2e с пропускной способностью 1,6 ТБ/с, что даёт 64 ТБ физической памяти при простом суммировании локальных объёмов. Заявленные 256 ТБ общей памяти следует рассматривать как отдельный архитектурный показатель: он зависит от того, как именно Huawei определяет доступный адресный объём и конфигурацию системы.

Архитектурно суперузел состоит из 64 лезвий по 16 NPU каждое. Внутри лезвия NPU соединены полносвязной топологией HCCS первого уровня. Лезвия объединяются через коммутаторы HCCS второго уровня, формируя единое адресное пространство. Такой подход напоминает архитектуру NUMA в серверных процессорах, но с более высокой заявленной пропускной способностью межсоединений. На практике важны не только объём адресного пространства, но и неравномерность задержек между локальной памятью, соседним лезвием и удалённой частью суперузла.

Интерконнект HCCS: собственная системная шина вместо NVLink

HCCS (Huawei Cache Coherent System) — собственная разработка Huawei, предназначенная для обеспечения когерентности кэшей и памяти между NPU на аппаратном уровне. В отличие от конфигураций NVLink/NVSwitch, рассчитанных на определённый размер домена, Huawei заявляет масштабирование HCCS до 1024 устройств. Это заявление описывает архитектурный предел или целевую конфигурацию, а не универсальную гарантию одинаковой производительности для всех рабочих нагрузок.

Согласно представленным параметрам, HCCS третьего поколения обеспечивает пропускную способность 600 ГБ/с на линк, задержку менее 1 микросекунды на переход между лезвиями и поддержку атомарных операций над общей памятью. Топология описывается как иерархический full-mesh с двумя уровнями коммутации: первый уровень объединяет 16 NPU в лезвии, второй — 64 лезвия через бесблокирующий кроссбар. Эти цифры требуют проверки на конкретном оборудовании и при конкретном шаблоне обмена данными.

Сравнение с NVLink/NVSwitch показывает разницу подходов. NVIDIA строит домены когерентности ограниченного размера, например конфигурации на 8 GPU или 72 GPU в системах класса GH200 с NVLink-C2C. Huawei изначально описывает HCCS как интерконнект для масштаба в тысячи устройств. Плата за иерархию может выражаться в дополнительной задержке: в анонсе приводятся значения 0,8 мкс против 0,5 мкс для NVLink 4.0. Но вывод о преимуществе зависит от нагрузки: для одних операций важнее объём связной памяти, для других — библиотечная оптимизация и стабильная пропускная способность all-reduce.

Общая память 256 ТБ: как это работает и зачем нужно для больших моделей

Общая память 256 ТБ — это не просто суммарный объём HBM на всех NPU. В заявленной архитектуре речь идёт о едином адресном пространстве, в котором NPU может обратиться к памяти другого NPU через HCCS с аппаратной поддержкой когерентности. Для разработчика это потенциально упрощает размещение больших тензоров, но не означает, что удалённая память имеет ту же задержку и пропускную способность, что локальная HBM.

Практическая ценность для больших моделей прямая: модель GPT-4 с 1,8 триллиона параметров в FP16 занимает около 3,6 ТБ, если считать только веса без дополнительных буферов и служебных структур. На кластере из H100 её приходится распределять между несколькими GPU с использованием tensor parallelism, pipeline parallelism и data parallelism. Каждый такой разрез добавляет коммуникации и усложняет конфигурацию. На Atlas 950 модель может размещаться в памяти одного суперузла целиком, однако фактическая схема распределения тензоров и цена удалённых обращений зависят от реализации фреймворка.

Для инференса это означает потенциальную возможность обслуживать модели с 500+ миллиардами параметров без квантования. Для обучения — запускать модели с триллионами параметров на одном узле, уменьшая долю сетевых пересылок градиентов. Утверждение об утилизации NPU до 78% на моделях класса LLaMA-70B относится к заявленным результатам и требует уточнения условий теста: версии ПО, размера батча, длины контекста, типа параллелизма и метода подсчёта утилизации.

Масштабирование до 500 000 ускорителей: инфраструктура для экзафлопсных вычислений

Суперузел Atlas 950 — строительный блок для кластеров большого масштаба. Huawei заявляет о возможности объединения до 500 000 NPU через внешнюю сеть на базе 400G RoCEv2 с адаптивной маршрутизацией. Архитектура кластера двухуровневая: внутри суперузла работает HCCS, между суперузлами — стандартный Ethernet с RDMA. Такая схема может снизить зависимость от InfiniBand, но не устраняет требования к проектированию сети, буферизации и настройке коллективных операций.

Ключевой показатель — эффективность масштабирования. Для кластера из 256 суперузлов, или 262 144 NPU, Huawei приводит заявленную эффективность обучения модели с 10 триллионами параметров на уровне 82% от линейного ускорения. Это объясняется тем, что основная коммуникация остаётся в пределах суперузла на HCCS, а межузловая часть, включая градиенты и all-reduce, идёт по RoCE с оптимизированными коллективными операциями в CANN. Без описания методики и базовой конфигурации этот показатель следует воспринимать как характеристику анонса, а не как универсальный прогноз.

Совокупная производительность кластера из 500 000 NPU Ascend 910C в BF16 оценивается в 160 экзафлопс — на уровне крупнейших заявленных инсталляций на H100. Здесь особенно важно различать пиковую арифметическую производительность и полезную производительность конкретной модели. Использование коммерчески доступного Ethernet вместо проприетарной InfiniBand может быть преимуществом с точки зрения архитектуры поставки, но итоговая стоимость определяется также коммутаторами, кабелями, питанием, охлаждением и программной эксплуатацией.

Производительность на реальных задачах: инференс и обучение больших моделей

Huawei опубликовала результаты внутреннего тестирования Atlas 950 на задачах, релевантных для индустрии. Для обучения LLaMA-2 70B приводятся 180 тысяч токенов в секунду на этапе prefill и 45 тысяч токенов в секунду на этапе decode — значения, которые Huawei сопоставляет с кластером из 32 H100. Для инференса GPT-3 175B в FP16 приводится задержка 12 мс на токен при батче 128. Эти цифры нельзя сравнивать один-в-один без одинаковых моделей, контекста, батча, точности, библиотек и методики измерения.

Эффективность использования памяти — потенциально сильная сторона архитектуры. Благодаря общей памяти 256 ТБ модели можно размещать с меньшей фрагментацией, но достижение 85–90% утилизации HBM против типичных 50–60% на кластерах GPU зависит от реализации рантайма и конкретной нагрузки. Для моделей с 500+ миллиардами параметров это может быть разница между «влезает с квантованием» и «влезает в FP16», но сам объём памяти не гарантирует соответствующего качества и скорости инференса.

Поддержка смешанной точности реализована на уровне CANN: BF16 для прямого и обратного прохода, FP32 для накопления градиентов, опционально FP8 для инференса на новых ревизиях Ascend 910C. Конвертация моделей из PyTorch BF16 в формат Ascend заявлена как автоматизированная; приведённую потерю точности не более 0,5% на бенчмарке MMLU нужно оценивать только вместе с указанием версии модели, набора задач и настроек конвертации.

Сравнение с NVIDIA: где Atlas 950 выигрывает, а где уступает

Параметр Huawei Atlas 950 (1024 NPU) NVIDIA DGX H100 (8 GPU) NVIDIA GH200 NVL72 (72 GPU)
Пиковая производительность BF16 ~820 PFLOPS, заявленный показатель ~16 PFLOPS ~144 PFLOPS
Общая память (когерентная) 256 ТБ, заявленный объём 640 ГБ ~7 ТБ
Пропускная способность интерконнекта 600 ГБ/с на линк HCCS 900 ГБ/с NVLink 4.0 900 ГБ/с NVLink-C2C
Максимум устройств в домене когерентности 1024, по заявлению Huawei 8 72
Энергопотребление узла ~65 кВт ~10,2 кВт ~45 кВт
Программная экосистема CANN, MindSpore, PyTorch-адаптер CUDA, cuDNN, PyTorch CUDA, cuDNN, PyTorch

Таблица показывает заявленные характеристики и не является полноценным бенчмарком. Atlas 950 выглядит сильнее по потенциальному масштабу когерентной памяти и размеру домена, тогда как NVIDIA сохраняет преимущество в зрелости CUDA, библиотек, инструментов профилирования и объёме доступных оптимизаций. Поэтому сравнение с NVIDIA нужно проводить на уровне конкретной модели и стоимости полезного токена или шага обучения, а не только по PFLOPS и объёму памяти.

Сильные стороны Atlas 950 — масштабируемость когерентной памяти и возможность построения кластеров на стандартном Ethernet. Слабые стороны — зрелость программной экосистемы. CANN и адаптер PyTorch покрывают значительную часть операций из torch.nn, но кастомные CUDA-ядра требуют ручного портирования на Ascend C — это может занять недели или месяцы в зависимости от кодовой базы. Документация доступна на китайском и английском, а сообщество заметно меньше, чем вокруг CUDA.

Программная экосистема: CANN, MindSpore и совместимость с PyTorch

CANN (Compute Architecture for Neural Networks) — аналог CUDA от Huawei, включающий компилятор, рантайм и библиотеки для Ascend. CANN поддерживает графовый IR (Intermediate Representation), в который преобразуются модели из MindSpore и PyTorch. Среди заявленных оптимизаций — автоматическое слияние операторов, распределение тензоров по NPU с учётом топологии HCCS, а также перекрытие вычислений и коммуникаций.

PyTorch-адаптер torch_npu работает на уровне бэкенда, подменяя операции torch на эквиваленты Ascend. Код обучения на PyTorch может запускаться без существенных изменений, если модель использует стандартные операции. Проблемы возникают с кастомными attention-механизмами, fused-операциями и flash-attention: их может потребоваться переписывать на Ascend C, диалект C++ с интринсиками под NPU.

MindSpore — нативный фреймворк Huawei, заточенный под особенности Ascend. Он поддерживает автоматический параллелизм: разработчик описывает модель, а фреймворк распределяет тензоры и вычисления по NPU с учётом топологии HCCS. Для моделей с триллионами параметров это может сократить время оптимизации, но заявленные сроки выхода на приемлемую производительность зависят от модели и команды. MindSpore имеет собственный зоопарк предобученных моделей, включая аналоги LLaMA, GPT и диффузионных моделей, оптимизированных под Ascend.

Санкционный контекст: почему Atlas 950 — это стратегический ответ на ограничения

С 2019 года Huawei находится под санкциями США, а последующие ограничения усложнили доступ к отдельным компонентам, ускорителям и передовым производственным мощностям. В результате для китайского рынка развитие собственных AI-ускорителей и программного стека стало не только коммерческой, но и инфраструктурной задачей. Точный эффект ограничений зависит от юрисдикции, конфигурации и даты поставки, поэтому его нельзя одинаково описывать для всех стран.

Atlas 950 вписывается в эту стратегию. По заявлению Huawei, NPU Ascend 910C производятся с использованием китайской производственной цепочки, HCCS является собственной разработкой, а CANN и MindSpore образуют собственный софтверный стек. Для заказчиков, которым недоступны или нежелательны NVIDIA и другие западные ускорители, такая вертикально интегрированная платформа может быть практически значимой. Но утверждать, что она автоматически не содержит ни одного компонента, подпадающего под экспортные ограничения, можно только после проверки конкретной поставки и юридической юрисдикции.

Китайские AI-модели, включая Qwen и DeepSeek, повышают спрос на локальную вычислительную базу. Однако связывать будущие модели с конкретным кластером заранее нельзя: выбор оборудования зависит от доступности, программной совместимости, стоимости и требований к обучению.

Практические рекомендации: для каких сценариев Atlas 950 подходит лучше всего

Atlas 950 реально интересен следующим категориям заказчиков:

  • Команды, обучающие модели с 500+ миллиардами параметров. Общая память 256 ТБ потенциально позволяет разместить крупную модель с меньшей фрагментацией, а HCCS может снизить долю межузловых коммуникаций. Экономия инженерного времени возможна, но её нужно подтверждать пилотом.
  • Операторы инференса больших моделей. Размещение модели в памяти одного суперузла уменьшает необходимость ходить по внешней сети за весами. Задержка 12 мс на токен для GPT-3 175B в FP16 остаётся заявленным показателем, который нужно воспроизвести на собственной нагрузке.
  • Государственные и корпоративные ЦОД с ограничениями на зарубежное оборудование. Atlas 950 может быть одним из вариантов импортонезависимой или регионально допустимой AI-инфраструктуры, но юридическую применимость необходимо проверять для конкретной поставки.

Платформа пока менее интересна небольшим проектам и командам, которые:

  • Запускают модели до 70B параметров. Порог входа высок, а минимальная конфигурация может быть избыточной. Для таких задач GPU с готовыми Docker-образами и большим сообществом часто проще в развёртывании.
  • Жёстко привязаны к CUDA. Если кодовая база построена на кастомных CUDA-ядрах и специфичных библиотеках, например TensorRT-LLM с кастомными плагинами, миграция потребует портирования и разработчиков со знанием Ascend C.
  • Не могут обеспечить эксплуатацию нового стека. Доступность документации, драйверов, совместимых версий CANN и специалистов может оказаться важнее теоретического объёма памяти.

Рекомендация по пилотному внедрению — начать с инференса. Взять существующую модель, сконвертировать через torch_npu, запустить на тестовом кластере из 16 NPU и сравнить задержку, пропускную способность, утилизацию памяти и стоимость эксплуатации с текущим GPU-решением. Если метрики устраивают, переходить к обучению. Оценку в 2–4 недели стоит считать ориентиром для ограниченного пилота, а не гарантированным сроком внедрения.

Заключение: переопределяя стандарты AI-инфраструктуры

Huawei Atlas 950 SuperPoD — это архитектурная заявка на снижение зависимости от стека NVIDIA. В анонсе выделяются три элемента: HCCS с заявленной когерентностью на 1024 устройства, общая память 256 ТБ и масштабирование до 500 000 NPU на внешней сети Ethernet. Если эти характеристики подтверждаются в поставляемых системах и поддерживаются программным стеком, они могут уменьшить ограничения, связанные с фрагментацией памяти и межузловыми коммуникациями.

Платформа не является заменой NVIDIA один-в-один. Это другой подход, который выигрывает в задачах, где важны размер связного домена и региональная независимость, но уступает по зрелости CUDA, набору библиотек и ширине сообщества. Поэтому сравнение с NVIDIA должно включать реальные модели, стоимость владения, энергопотребление, доступность специалистов и трудоёмкость миграции.

Практический вывод для техлидов: если вы планируете обучение моделей с 500+ миллиардами параметров или строите ЦОД с ограничениями на западное оборудование, Atlas 950 заслуживает предварительного пилотного тестирования. Для остальных сценариев рациональнее сначала оценить поддержку CANN и PyTorch-адаптера на собственной кодовой базе. Критический критерий зрелости здесь прост: насколько близко реальная миграция находится к сценарию «запустил скрипт и работает».

Подписаться на канал