Microsoft анонсировала три новые серии виртуальных машин Azure на процессорах и ускорителях AMD. HDv2 - CPU-машина почти на 500 физических ядер для подготовки данных и обучения с подкреплением. HXv2 - высокочастотный инструмент с 3D V-cache для EDA и MPI-моделирования. ND MI455X v7 - инференс-платформа на AMD Instinct MI355X для рассуждений, поиска и агентов. Каждая серия закрывает конкретный этап AI-пайплайна, и в этом разборе мы пройдём по архитектуре, цифрам и сценариям применения.
Что представила Microsoft: три новые серии Azure VM на AMD
Три серии - три класса задач. HDv2 построена на 6-м поколении AMD EPYC, несёт почти 500 физических ядер, 4 ТБ RAM и сеть Azure Boost на 400 Гб/с. Целевые нагрузки: предобработка данных, распределённый поиск, обучение с подкреплением, координация агентов. HXv2 - 176 ядер с частотой выше 5 ГГц, 3D V-cache, до 4 ТБ RAM и InfiniBand 800 Гб/с. Это машина под EDA, вычислительную гидродинамику и MPI-симуляции. ND MI455X v7 - платформа AMD Helios с ускорителями AMD Instinct MI355X для масштабного инференса: reasoning, RAG, агентные системы.
Azure расширяет инфраструктуру не просто новыми SKU - клиенты получают возможность выбирать архитектуру под каждый этап пайплайна. Подготовка данных на CPU, симуляции на высокочастотных ядрах с огромным кешем, инференс на специализированных ускорителях - всё в одном облаке.
HDv2: CPU-монстр для подготовки данных и обучения с подкреплением
Архитектурные особенности: ядра, память, сеть
HDv2 использует 6-е поколение AMD EPYC. Почти 500 физических ядер на инстанс. Это не SMT-потоки - это настоящие ядра, которые дают линейное масштабирование на многопоточных нагрузках. 4 ТБ оперативной памяти - объём, достаточный для размещения массивных датасетов в RAM без подкачки. Сеть Azure Boost на 400 Гб/с обеспечивает пропускную способность, сопоставимую с выделенными кластерными интерконнектами. В комбинации эти характеристики решают главную проблему CPU-интенсивных AI-задач: узкое горло памяти и сети при подготовке данных.
Если вы работали с пайплайнами, где токенизация, фильтрация и аугментация упираются в пропускную способность памяти, HDv2 снимает это ограничение. Сравнение платформ Intel Xeon Gold с AVX-512 и EPYC Rome на восьми каналах DDR4 мы уже проводили - тесты показали, что на крупных батчах пропускная способность памяти EPYC перевешивает преимущества AVX-512. HDv2 с новым поколением EPYC и 400 Гб/с сетью поднимает планку ещё выше.
Для каких AI-нагрузок оптимизирована HDv2
Четыре ключевых сценария. Первый - предобработка данных. Фильтрация корпусов, дедупликация, токенизация, генерация эмбеддингов на CPU для последующей индексации. Второй - распределённый поиск. Построение и обновление индексов для retrieval-систем, где задержка важнее, чем пиковая пропускная способность GPU. Третий - обучение с подкреплением. Симуляторы окружений, rollout-ы политик, обсчёт наград - всё это CPU-bound операции, которые плохо ложатся на GPU. Четвёртый - оркестрация агентов. Координация множества LLM-вызовов, управление памятью контекста, диспетчеризация задач.
Почему CPU, а не GPU? Потому что эти задачи либо не векторизуются под SIMD-архитектуру GPU, либо требуют операций с разреженными структурами данных, где накладные расходы на передачу данных в GPU-память съедают весь выигрыш. HDv2 даёт плотную упаковку ядер и гигабайты RAM на ядро - ровно то, что нужно.
HXv2: высокочастотные ядра и 3D V-cache для EDA и MPI-моделирования
3D V-cache: что это и как влияет на производительность
3D V-cache - технология вертикальной компоновки кеш-памяти. Дополнительный кристалл L3-кеша монтируется поверх вычислительного чиплета, увеличивая доступный объём кеша на ядро в несколько раз. Результат: снижение задержек доступа к данным и рост эффективной пропускной способности без увеличения тактовой частоты. Для EDA-задач - анализа целостности сигналов, трассировки, симуляции переходных процессов - критично именно время доступа к данным. Модели схем не помещаются в стандартный L3, а промахи в RAM стоят сотни тактов. 3D V-cache сокращает эти промахи радикально.
HXv2 сочетает 176 ядер с частотой выше 5 ГГц и 3D V-cache. Высокая частота даёт быстрый single-thread performance для критических секций, а огромный кеш - стабильную производительность на рабочих наборах данных, которые раньше требовали ручной оптимизации размещения в памяти.
Сценарии использования: от симуляций до анализа цепей
Типичные нагрузки: симуляции методом конечных элементов, вычислительная гидродинамика, анализ целостности сигналов и питания. Эти задачи используют MPI для распределённых вычислений, и InfiniBand 800 Гб/с на HXv2 обеспечивает минимальные задержки при обмене сообщениями между узлами. До 4 ТБ RAM на инстанс позволяет держать крупные сетки и модели в памяти без декомпозиции на диск.
HXv2 - узкоспециализированный инструмент. Если ваша задача не относится к EDA или HPC с высокими требованиями к однопоточной производительности и объёму кеша, HDv2 или ND MI455X v7 будут практичнее. Но для своего сегмента HXv2 - прямой ответ на запрос инженеров, которым нужно считать быстро и без компромиссов по точности.
ND MI455X v7: масштабный инференс AI на AMD Instinct
AMD Instinct MI355X: архитектура для инференса
AMD Instinct MI355X - ускоритель, спроектированный под инференс больших языковых моделей. Платформа AMD Helios объединяет несколько ускорителей в единый инстанс с высокой пропускной способностью межсоединений. Точные характеристики MI355X на момент анонса раскрыты частично, но направление понятно: большой объём HBM-памяти, поддержка разреженных вычислений, оптимизация под батчевый инференс с низкой задержкой.
ND MI455X v7 - это не универсальный GPU-инстанс. Это машина для продакшен-инференса, где важны стабильная задержка, высокая пропускная способность на токен и эффективность обработки длинных последовательностей. Если вы разворачиваете LLM для RAG или агентных систем, ND MI455X v7 даёт альтернативу доминирующим решениям на рынке ускорителей.
Рабочие нагрузки: reasoning, RAG, агенты
Три сценария. Reasoning - инференс с цепочками рассуждений, где модель генерирует длинные последовательности с внутренними шагами логического вывода. RAG - retrieval-augmented generation, требующий быстрой обработки контекста из нескольких документов. Агенты - автономные системы, которые выполняют многошаговые задачи с вызовом инструментов и повторными запросами к модели.
Все три сценария объединяет требование к стабильной задержке под переменной нагрузкой. ND MI455X v7 с платформой Helios нацелена на горизонтальное масштабирование инференса. Практика запуска моделей на кластерах ускорителей показывает, что пропускная способность межсоединений и объём памяти на ускоритель - ключевые факторы для достижения высокой утилизации.
Как выбрать подходящую серию: сравнение и рекомендации
Сравнительная таблица характеристик
| Характеристика | HDv2 | HXv2 | ND MI455X v7 |
|---|---|---|---|
| Процессор/ускоритель | AMD EPYC 6-го поколения | AMD EPYC с 3D V-cache | AMD Instinct MI355X |
| Ядра | ~500 физических | 176 (>5 ГГц) | Ускорители (кол-во уточняется) |
| Память | до 4 ТБ RAM | до 4 ТБ RAM | HBM (объём уточняется) |
| Сеть | Azure Boost 400 Гб/с | InfiniBand 800 Гб/с | AMD Helios interconnect |
| Целевые нагрузки | Подготовка данных, RL, поиск, агенты | EDA, CFD, MPI-симуляции | Инференс LLM, reasoning, RAG |
Рекомендации по этапам AI-пайплайна
Подготовка данных - HDv2. Почти 500 ядер и 4 ТБ RAM закрывают токенизацию, фильтрацию и индексацию без узких мест. Обучение - зависит от типа. Обучение с подкреплением и CPU-bound этапы тренировки идут на HDv2. GPU-обучение - не целевая нагрузка для этих серий, Azure предлагает ND-серии с NVIDIA для этого. Инженерные симуляции и EDA - HXv2. Высокая частота и 3D V-cache дают прирост на задачах, чувствительных к задержкам памяти. Инференс - ND MI455X v7. Специализированная платформа для продакшен-развёртывания LLM.
Гибкость Azure в том, что эти серии можно комбинировать. Пайплайн, где HDv2 готовит данные, HXv2 считает симуляции окружения для RL, а ND MI455X v7 обслуживает инференс - архитектура, которая до недавнего времени требовала разрозненных кластеров.
Доступность и следующие шаги
Microsoft объявила о сериях, но точные даты доступности и регионы пока не раскрыты. Информация носит предварительный характер - детали производительности и цены будут уточняться ближе к публичному превью. Мы отслеживаем статус и планируем серию тестов, как только инстансы появятся в доступных регионах.
Пока можно оценить, насколько текущие CPU-инстансы справляются с вашими AI-нагрузками. Сравнение стоимости локального железа и облака даёт ориентиры для принятия решения. Анализ стратегии Microsoft на рынке AI-моделей - в отдельном разборе. Для подписки на обновления и уведомления о выходе бенчмарков используйте раздел новостей AI-MANUAL.