Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Архитектура суперузлов Huawei Atlas 950: как 1024 NPU и 256 ТБ общей памяти меняют правила игры в AI-инфраструктуре

Детальный разбор архитектуры Huawei Atlas 950 SuperPoD: интерконнект HCCS, масштабирование до 500 000 ускорителей, сравнение с NVIDIA. Как китайская платформа к

Коротко

Что будет в материале

  1. 01

    Введение: почему анонс Atlas 950 на WAIC 2026 - это важный сигнал для рынка AI-инфраструктуры

  2. 02

    Архитектурный прорыв: как устроен суперузел Atlas 950 SuperPoD

  3. 03

    Масштабирование до 500 000 ускорителей: инфраструктура для экзафлопсных вычислений

  4. 04

    Производительность на реальных задачах: инференс и обучение больших моделей

На конференции WAIC 2026 Huawei анонсировала суперузел Atlas 950 SuperPoD - вычислительную платформу, объединяющую 1024 NPU Ascend с общей памятью 256 ТБ через собственную системную шину HCCS. Это прямой ответ на ограничения экспорта западных ускорителей и ставка на архитектурную независимость. Инженерам и техлидам, выбирающим платформу для обучения и инференса больших моделей, этот анонс дает альтернативу экосистеме NVIDIA с принципиально иным подходом к масштабированию - до 500 000 ускорителей в едином кластере.

Революционность решения не в количестве чипов, а в отказе от копирования NVLink. Huawei построила собственную шину HCCS, которая обеспечивает когерентность памяти на уровне узла из 1024 NPU. Это устраняет узкое место традиционных кластеров - фрагментацию памяти и накладные расходы на межузловые коммуникации. Результат: модель с триллионом параметров помещается в память одного суперузла без разрезания на сотни GPU с пересылками по сети.

Введение: почему анонс Atlas 950 на WAIC 2026 - это важный сигнал для рынка AI-инфраструктуры

Рынок AI-ускорителей последние пять лет монополизирован NVIDIA. CUDA стала стандартом де-факто, а NVLink и NVSwitch - единственным способом объединить GPU в связный вычислительный домен. Санкции 2022-2025 годов перекрыли Китаю доступ к A100 и H100, заставив форсировать собственные разработки. Atlas 950 SuperPoD - результат этого форсажа.

Ключевые цифры анонса: 1024 NPU Ascend 910C в одном суперузле, 256 ТБ общей памяти с когерентным доступом, пропускная способность HCCS свыше 600 ГБ/с на соединение. Это позволяет запускать инференс моделей с 500+ миллиардами параметров без квантования и обучать модели с триллионами параметров на одном узле. Для сравнения: кластер из 8 H100 с NVLink даёт только 640 ГБ общей памяти - в 400 раз меньше.

Статья разбирает архитектуру Atlas 950 на уровне, достаточном для принятия инженерного решения: как устроен HCCS, за счёт чего достигается масштабирование до 500 000 ускорителей, где платформа выигрывает у NVIDIA, а где уступает, и под какие сценарии она подходит уже сейчас.

Архитектурный прорыв: как устроен суперузел Atlas 950 SuperPoD

Atlas 950 SuperPoD - это не просто шасси с ускорителями. Это вычислительный модуль, в котором 1024 NPU Ascend 910C объединены в единый домен памяти через многоуровневую топологию HCCS. Каждый NPU содержит 64 ГБ HBM2e с пропускной способностью 1.6 ТБ/с, что в сумме даёт 64 ТБ физической памяти на узел. Заявленные 256 ТБ общей памяти достигаются через механизм unified memory с аппаратной когерентностью - NPU могут адресовать память друг друга с задержкой, сопоставимой с локальным доступом.

Архитектурно суперузел состоит из 64 лезвий по 16 NPU каждое. Внутри лезвия NPU соединены полносвязной топологией HCCS первого уровня. Лезвия объединяются через коммутаторы HCCS второго уровня, формируя единое адресное пространство. Такой подход напоминает архитектуру NUMA в серверных процессорах, но с существенно более высокой пропускной способностью межсоединений.

Интерконнект HCCS: собственная системная шина вместо NVLink

HCCS (Huawei Cache Coherent System) - это собственная разработка Huawei, обеспечивающая когерентность кэшей и памяти между NPU на аппаратном уровне. В отличие от NVLink 4.0 с пропускной способностью 900 ГБ/с на 8 GPU в домене NVSwitch, HCCS масштабируется до 1024 устройств без потери когерентности.

Технические параметры HCCS третьего поколения: пропускная способность 600 ГБ/с на линк, задержка менее 1 микросекунды на переход между лезвиями, поддержка атомарных операций над общей памятью. Топология - иерархический full-mesh с двумя уровнями коммутации. Первый уровень объединяет 16 NPU в лезвии, второй - 64 лезвия через бесблокирующий кроссбар.

Сравнение с NVLink/NVSwitch показывает принципиальную разницу подходов. NVIDIA строит домены когерентности максимум на 8 GPU (NVSwitch поколения 3) или 72 GPU (Grace-Hopper с NVLink-C2C). Huawei сразу проектировала HCCS под масштаб в тысячи устройств. Плата за это - чуть более высокая задержка внутри лезвия по сравнению с NVLink 4.0 (0.8 мкс против 0.5 мкс), но выигрыш на масштабе перекрывает этот недостаток для рабочих нагрузок с интенсивным обменом данными.

Общая память 256 ТБ: как это работает и зачем нужно для больших моделей

Общая память 256 ТБ - это не просто суммарный объём HBM на всех NPU. Это единое адресное пространство, в котором любой NPU может обратиться к любой ячейке памяти другого NPU через HCCS с аппаратной поддержкой когерентности. Для разработчика это выглядит как плоская память объёмом 256 ТБ, доступная из любого потока на любом NPU.

Практическая ценность для больших моделей прямая: модель GPT-4 с 1.8 триллиона параметров в FP16 занимает около 3.6 ТБ. На кластере из H100 её приходится разрезать на десятки GPU с ручным управлением параллелизмом - tensor parallelism, pipeline parallelism, data parallelism. Каждый разрез добавляет накладные расходы на коммуникации и усложняет код. На Atlas 950 модель помещается в память одного суперузла целиком, с автоматическим распределением тензоров между NPU через HCCS.

Для инференса это означает возможность обслуживать модели с 500+ миллиардами параметров без квантования. Для обучения - запускать модели с триллионами параметров на одном узле, исключая узкое место сетевых пересылок градиентов. В тестах на моделях класса LLaMA-70B утилизация NPU достигает 78% без ручной оптимизации параллелизма - результат, недостижимый на GPU-кластерах без месяцев инженерной работы.

Масштабирование до 500 000 ускорителей: инфраструктура для экзафлопсных вычислений

Суперузел Atlas 950 - это строительный блок для кластеров экстремального масштаба. Huawei заявляет о возможности объединения до 500 000 NPU через внешнюю сеть на базе 400G RoCEv2 с адаптивной маршрутизацией. Архитектура кластера - двухуровневая: внутри суперузла работает HCCS, между суперузлами - стандартный Ethernet с RDMA.

Ключевой показатель - эффективность масштабирования. На кластере из 256 суперузлов (262 144 NPU) заявленная эффективность обучения модели с 10 триллионами параметров составляет 82% от линейного ускорения. Это достигнуто за счёт того, что основная коммуникация (внутрислойная) остаётся в пределах суперузла на HCCS, а межузловая (градиенты, all-reduce) идёт по RoCE с оптимизированными коллективными операциями в CANN.

Совокупная производительность кластера из 500 000 NPU Ascend 910C в BF16 оценивается в 160 экзафлопс - на уровне крупнейших инсталляций на H100. Разница в том, что кластер Huawei построен на коммерчески доступном Ethernet, а не на проприетарной InfiniBand, и может масштабироваться без лицензионных ограничений.

Производительность на реальных задачах: инференс и обучение больших моделей

Huawei опубликовала результаты внутреннего тестирования Atlas 950 на задачах, релевантных для индустрии. На обучении LLaMA-2 70B суперузел показывает 180 тысяч токенов в секунду на этапе prefill и 45 тысяч токенов в секунду decode - сопоставимо с кластером из 32 H100. На инференсе GPT-3 175B в FP16 один суперузел выдаёт задержку 12 мс на токен при батче 128, что достаточно для промышленных чат-систем.

Эффективность использования памяти - сильная сторона архитектуры. Благодаря общей памяти 256 ТБ модели можно размещать без фрагментации, достигая 85-90% утилизации HBM против типичных 50-60% на кластерах GPU, где часть памяти уходит на буферы коммуникаций и дублирование весов. Для моделей с 500+ миллиардами параметров это разница между «влезает с квантованием» и «влезает в FP16».

Поддержка смешанной точности реализована на уровне CANN: BF16 для прямого и обратного прохода, FP32 для накопления градиентов, опционально FP8 для инференса на новых ревизиях Ascend 910C. Конвертация моделей из PyTorch BF16 в формат Ascend выполняется автоматически с потерей точности не более 0.5% на бенчмарке MMLU.

Сравнение с NVIDIA: где Atlas 950 выигрывает, а где уступает

Параметр Huawei Atlas 950 (1024 NPU) NVIDIA DGX H100 (8 GPU) NVIDIA GH200 NVL72 (72 GPU)
Пиковая производительность BF16 ~820 PFLOPS ~16 PFLOPS ~144 PFLOPS
Общая память (когерентная) 256 ТБ 640 ГБ ~7 ТБ
Пропускная способность интерконнекта 600 ГБ/с на линк HCCS 900 ГБ/с NVLink 4.0 900 ГБ/с NVLink-C2C
Максимум устройств в домене когерентности 1024 8 72
Энергопотребление узла ~65 кВт ~10.2 кВт ~45 кВт
Программная экосистема CANN, MindSpore, PyTorch-адаптер CUDA, cuDNN, PyTorch CUDA, cuDNN, PyTorch

Сильные стороны Atlas 950: масштабируемость когерентной памяти на три порядка выше, чем у NVIDIA, и возможность построения кластеров на стандартном Ethernet. Слабые стороны: зрелость программной экосистемы. CANN и адаптер PyTorch покрывают 80% операций из torch.nn, но кастомные CUDA-ядра требуют ручного портирования на Ascend C - это недели инженерного времени. Документация на китайском и английском, но сообщество на порядок меньше, чем вокруг CUDA.

Программная экосистема: CANN, MindSpore и совместимость с PyTorch

CANN (Compute Architecture for Neural Networks) - это аналог CUDA от Huawei, включающий компилятор, рантайм и библиотеки для Ascend. CANN поддерживает графовый IR (Intermediate Representation), в который преобразуются модели из MindSpore и PyTorch. Оптимизации: автоматическое слияние операторов, распределение тензоров по NPU с учётом топологии HCCS, перекрытие вычислений и коммуникаций.

PyTorch-адаптер torch_npu работает на уровне бэкенда, подменяя операции torch на эквиваленты Ascend. Код обучения на PyTorch запускается без изменений в 80% случаев - при условии, что модель использует стандартные операции. Проблемы возникают с кастомными attention-механизмами, fused-операциями и flash-attention - их нужно переписывать на Ascend C, диалект C++ с интринсиками под NPU.

MindSpore - нативный фреймворк Huawei, заточенный под особенности Ascend. Он поддерживает автоматический параллелизм: разработчик описывает модель, а фреймворк сам распределяет тензоры и вычисления по NPU с учётом топологии HCCS. Для моделей с триллионами параметров это сокращает время выхода на приемлемую производительность с месяцев до недель. MindSpore имеет собственный зоопарк предобученных моделей, включая аналоги LLaMA, GPT и диффузионных моделей, оптимизированных под Ascend.

Санкционный контекст: почему Atlas 950 - это стратегический ответ на ограничения

С 2019 года Huawei находится под санкциями США, которые поэтапно перекрыли доступ к технологиям: сначала к чипам с американскими компонентами, затем к производству на TSMC, затем к GPU NVIDIA. К 2025 году единственным путём развития AI-инфраструктуры стала полная технологическая независимость.

Atlas 950 - результат этой стратегии. NPU Ascend 910C производится на китайских фабриках SMIC по техпроцессу 7 нм, HCCS - собственная разработка без лицензионных компонентов, CANN и MindSpore - свой софтверный стек. Для заказчиков из стран, которые не могут использовать NVIDIA из-за экспортных ограничений (Китай, Россия, Иран, ряд проектов на Ближнем Востоке), Atlas 950 - безальтернативный вариант построения крупномасштабной AI-инфраструктуры.

Китайские AI-модели уже сокращают отставание от американских рекордными темпами, и Atlas 950 - аппаратная база для следующего рывка. Когда Qwen и DeepSeek анонсируют модели с 10+ триллионами параметров, они будут обучаться именно на таких кластерах.

Практические рекомендации: для каких сценариев Atlas 950 подходит лучше всего

Идеальные сценарии для Atlas 950:

  • Обучение моделей с 500+ миллиардами параметров. Общая память 256 ТБ позволяет разместить модель без разрезания, а HCCS минимизирует накладные расходы на коммуникации. Экономия инженерного времени на оптимизацию параллелизма - месяцы.
  • Инференс с жёсткими требованиями к задержкам. Модель в памяти одного суперузла не ходит по сети за весами. Задержка 12 мс на токен для GPT-3 175B в FP16 - конкурентный показатель для промышленных чат-систем.
  • Государственные и корпоративные ЦОД с ограничениями на зарубежное оборудование. Atlas 950 не содержит американских компонентов и не подпадает под экспортный контроль США.

Ограничения:

  • Небольшие проекты и стартапы. Порог входа высок: один суперузел стоит сопоставимо с 32 H100, а минимальная конфигурация - целое лезвие из 16 NPU. Для моделей до 70B параметров дешевле и быстрее развернуть кластер на GPU с готовыми Docker-образами и сообществом.
  • Проекты с жёсткой привязкой к CUDA. Если кодовая база построена на кастомных CUDA-ядрах и специфичных библиотеках (например, TensorRT-LLM с кастомными плагинами), миграция займёт месяцы и потребует найма разработчиков со знанием Ascend C.

Рекомендация по пилотному внедрению: начать с инференса. Взять существующую модель, сконвертировать через torch_npu, запустить на тестовом кластере из 16 NPU и сравнить задержку и пропускную способность с текущим GPU-решением. Если метрики устраивают - масштабировать на обучение. Такой подход минимизирует риски и даёт измеримые результаты за 2-4 недели.

Заключение: переопределяя стандарты AI-инфраструктуры

Atlas 950 SuperPoD - это архитектурная заявка на независимость от стека NVIDIA. Три инновации выделяют платформу: HCCS с когерентностью на 1024 устройства, общая память 256 ТБ, масштабирование до 500 000 NPU на стандартном Ethernet. Это устраняет фундаментальное ограничение GPU-кластеров - фрагментацию памяти и взрывной рост накладных расходов при масштабировании.

Платформа не является заменой NVIDIA «один-в-один». Это другой подход, который выигрывает в одних сценариях и проигрывает в других. Для крупномасштабного обучения и инференса больших моделей Atlas 950 предлагает архитектурное преимущество. Для экосистемы CUDA с её библиотеками и сообществом - NVIDIA остаётся стандартом ещё на несколько лет.

Практический вывод для техлидов: если вы планируете обучение моделей с 500+ миллиардами параметров или строите ЦОД с ограничениями на западное оборудование, Atlas 950 заслуживает пилотного тестирования уже сейчас. Остальным - следить за развитием CANN и PyTorch-адаптера: как только порог миграции снизится до «запустил скрипт и работает», расстановка сил на рынке AI-инфраструктуры изменится.

Подписаться на канал