Перейти к содержанию
Публикация AiManual

Серверное железо для ИИ в 2026 году: PCIe 6.0 SSD, 256-ядерные Xeon и RISC-V в ЦОД

Hot Chips 2026 и Flash Memory Summit показали, куда движется серверное железо для ИИ: PCIe 6.0 SSD на 28,4 ГБ/с, Kioxia GP1 на 10 млн IOPS как расширение HBM, X

Коротко

Что будет в материале

  1. 01

    Что показали на Hot Chips 2026 и Flash Memory Summit: главное за минуту

  2. 02

    PCIe 6.0 SSD: Micron 9650, Samsung PM1763 и Kioxia CM10

  3. 03

    Intel Xeon 7 Diamond Rapids: 256 P-ядер и 1,28 ГБ L3

  4. 04

    SiFive BigSky: RISC-V заходит в дата-центры

Что показали на Hot Chips 2026 и Flash Memory Summit: главное за минуту

В августе 2026 года на Hot Chips 2026 и Flash Memory Summit представили первые серийные PCIe 6.0 SSD от Micron, Samsung и Kioxia со скоростями до 28,4 ГБ/с, SSD Kioxia GP1 с 10 млн IOPS для расширения HBM, Intel Xeon 7 Diamond Rapids с 256 P-ядрами и 1,28 ГБ L3, сервер SiFive BigSky на RISC-V и ускоритель Intel Crescent Island с 480 ГБ LPDDR5X вместо HBM. Сводка серверных новинок августа 2026

Причина, по которой все эти анонсы вышли почти одновременно, одна: современным моделям требуются быстрые хранилища для весов нейросетей и KV-кэша, объём которого уже не помещается в HBM-память ускорителей. Подробности обзора Когда контекст растёт до сотен тысяч токенов, а веса занимают сотни гигабайт, память на ускорителе перестаёт быть единственным местом хранения данных. В дело идут NVMe-накопители, LPDDR5X, огромные L3-кэши и стойки на 160 дисков.

Ниже разберём каждую новинку с цифрами, её ограничения и то, что из этого применимо к домашнему AI-серверу. Оговорка: материал опирается на анонсы августа 2026 года, данные могут быть неполными, а часть характеристик на момент презентации остаётся предварительной.

PCIe 6.0 SSD: Micron 9650, Samsung PM1763 и Kioxia CM10

Micron 9650 развивает скорость последовательного чтения до 28 ГБ/с. Samsung PM1763 немного опережает конкурентов с показателем 28,4 ГБ/с. Kioxia CM10 демонстрирует 92-процентный прирост быстродействия относительно предыдущего поколения. Все три модели относятся к первым серийным PCIe 6.0-накопителям, а не к выставочным прототипам. Данные по накопителям

Стандарт PCIe 6.0 удваивает пропускную способность на линию относительно PCIe 5.0. Именно удвоенная пропускная способность линии позволяет одному накопителю выйти на 28 ГБ/с: раньше такой поток данных упирался в возможности интерфейса.

Что это даёт на практике. Быстрее читаются веса модели при старте контейнера, короче пауза на подкачку шардов, меньше простоя при переключении между этапами конвейера. Для KV-кэша, выгруженного из памяти, такой диск ускоряет обмен с накопителем. В обучении крупных моделей узкое место смещается с самого SSD на сеть и число линий PCIe.

Ограничение: потребительский сектор получит PCIe 6.0 значительно позже корпоративного. О сроках выхода стандарта Домашний сервер в 2026 году на 28 ГБ/с выйти не может, потому что нет ни платформ, ни слотов. Второй момент: полную скорость даёт только сервер с PCIe 6.0. На материнской плате с PCIe 5.0 накопитель упрётся в возможности слота, и разницы с топовым PCIe 5.0 SSD не будет.

Kioxia GP1: SSD на 10 млн IOPS как расширение HBM для GPU

Kioxia GP1 заявлен с 10 млн IOPS и рассчитан на роль расширения HBM для GPU. Описание GP1 Замысел понятен: вынести из видеопамяти то, что в неё не помещается, а именно KV-кэш длинных контекстов, редко используемые слои, эмбеддинги и кэш узлов RAG.

Ограничение стоит держать в голове с самого начала: по латентности и пропускной способности SSD уступает HBM, причём заметно. Это компромисс между объёмом и скоростью, а не прямая замена HBM. Схема выигрывает, когда промахи по кэшу редки и их удаётся перекрыть асинхронной подкачкой. В плотном инференсе с миллионами обращений к памяти в секунду такой слой остаётся вспомогательным уровнем.

Intel Xeon 7 Diamond Rapids: 256 P-ядер и 1,28 ГБ L3

Intel Xeon 7 Diamond Rapids заявлен с 256 P-ядрами и 1,28 ГБ кэша L3. Характеристики Diamond Rapids Ставка сделана на производительные ядра, а не на энергоэффективные: для серверных ИИ-задач важен темп одного потока.

Такие числа закрывают конкретный класс нагрузок. Подготовка датасетов, токенизация, очистка корпусов текста, построение индексов для поиска, координация агентов, CPU-инференс небольших моделей, раздача KV-кэша хостовой частью. Эти задачи хорошо распараллеливаются и любят и число ядер, и объём кэша.

1,28 ГБ L3 меняют расклад для рабочих наборов, которые раньше не влезали в кэш и постоянно уходили в DRAM. Чем больше данных помещается рядом с ядром, тем меньше потерь на обращения к памяти.

Похожая логика у облачных провайдеров: Microsoft в серии Azure HDv2 собрала почти 500 физических ядер EPYC под подготовку данных, поиск, обучение с подкреплением и координацию агентов, а серию HXv2 отдала под EDA и MPI-моделирование. Разбор Azure VM на AMD

Ограничение: итоговое число ядер и точные объёмы L3 могут быть предварительными. До публикации финальных спецификаций эти цифры стоит воспринимать как заявленные на презентации.

SiFive BigSky: RISC-V заходит в дата-центры

SiFive BigSky - сервер на архитектуре RISC-V, показанный на Hot Chips 2026. Анонс SiFive BigSky

RISC-V отличается от x86 и ARM на уровне устройства и модели лицензирования. Система команд открыта, отчисления за архитектуру отсутствуют, а ядро можно доработать под конкретные задачи: добавить инструкции для специфичных вычислений, убрать лишние блоки, снизить энергопотребление. Для ЦОД это интересно тем, что позволяет строить ускорители и сопроцессоры под свой пайплайн.

Ограничение лежит не в железе, а в софте. Экосистема ИИ-инструментов на RISC-V развита слабее, чем на x86 и ARM. Часть библиотек, ускорителей и фреймворков туда автоматически не переносится, а стек CUDA привязан к GPU конкретного производителя. В ИИ-инфраструктуре RISC-V пока остаётся нишевым решением и заменой x86 в ближайшее время не станет.

Intel Crescent Island: 480 ГБ LPDDR5X вместо HBM

Intel Crescent Island - ускоритель с 480 ГБ памяти LPDDR5X вместо HBM. Детали Crescent Island По пропускной способности LPDDR5X уступает HBM, зато её проще набрать в больших объёмах.

Для инференса LLM такой компромисс осмыслен. Большая модель с длинным контекстом требует много памяти, и решающим фактором часто становится не предельная пропускная способность, а то, влезает ли модель в память вообще. 480 ГБ закрывают конфигурации, которые не помещаются в HBM одного ускорителя без шардирования по нескольким платам.

Ограничение очевидно: LPDDR5X медленнее HBM. Ускоритель не подойдёт для задач, где критична скорость памяти: обучение крупных моделей, плотный декодинг с большим батчем, обработка очень длинных последовательностей на высокой пропускной способности. Его ниша - там, где нужен объём, а не рекорд по пропускной способности.

Разговоры про смену архитектуры памяти идут не только у Intel. Про возвращение Intel в memory-бизнес и формулировку «новая memory architecture» есть отдельный разбор. Что стоит за планами Intel по памяти Про то, как контракты на AI-память влияют на цены DRAM и VRAM, тоже есть материал. Как контракты на AI-память влияют на цены

Supermicro ASG-4116S-NU160R: 160 отсеков U.2 NVMe в 4U

Конфигурация Supermicro ASG-4116S-NU160R: стоечный сервер 4U, 160 посадочных мест под U.2 NVMe, четыре дополнительных слота E1.S PCIe 5.0 x4, два внутренних разъёма M.2 и процессоры AMD EPYC 9005. Конфигурация Supermicro

Смысл такой плотности в параллельных операциях ввода-вывода. Один сервер отдаёт огромное число одновременных запросов, что нужно для работы с большими датасетами, кэширования на дисках и раздачи данных множеству потребителей. Для мультимодальных моделей и видеоархивов это тоже актуально.

Ограничение встроено в саму конструкцию: ради максимальной плотности диски U.2 подключены по линиям PCIe 4.0 x1. Пропускная способность каждого отдельного носителя снижена, зато система обрабатывает колоссальный массив параллельных операций ввода-вывода. Проще говоря, это сервер про количество одновременных обращений, а не про скорость одного диска.

По ёмкости картина такая: если поставить в каждый отсек накопитель на 122 ТБ, суммарный объём сырых данных на один сервер подходит к 19,5 ПБ. Про объём сырых данных

Почему память и хранилище меняют роли: связь с ростом ИИ-нагрузок

Все анонсы августа 2026 сходятся в одной точке: данных, которые нужно держать рядом с вычислением, стало больше, чем способна вместить быстрая память. KV-кэш растёт вместе с длиной контекста и размером батча, а веса современных моделей измеряются сотнями гигабайт. HBM ускорителя ограничена и по ёмкости, и по цене за гигабайт.

Отсюда три разных ответа на одну проблему. SSD берут на себя роль расширения HBM: Kioxia GP1 с 10 млн IOPS. Ускорители получают другой тип памяти: Intel Crescent Island с 480 ГБ LPDDR5X. Серверы превращаются в дисковые фермы: Supermicro ASG-4116S-NU160R на 160 отсеков NVMe. Плюс процессоры обрастают ядрами и кэшем, чтобы успевать готовить данные для ускорителей.

Каждый подход решает одну проблему и создаёт другую. Расширение HBM на SSD добавляет латентность. LPDDR5X вместо HBM срезает пропускную способность. 160 дисков на PCIe 4.0 x1 дают параллелизм в ущерб скорости отдельного накопителя. 256-ядерный CPU требует софта, который умеет утилизировать такое число потоков. Граница между памятью и хранилищем размывается, и появляется промежуточный уровень, который раньше был экзотикой.

Для локальных систем похожая логика видна на другом масштабе: сценарии использования быстрой энергонезависимой памяти под RAG и кэш разобраны в материале про 500 ГБ Optane и её применение в 2026 году.

Что это значит для локальных AI-систем и когда ждать новинки

PCIe 6.0 придёт в потребительский сектор значительно позже корпоративного. О перспективах стандарта Для домашнего AI-сервера в 2026 году это значит простую вещь: ориентир остаётся на PCIe 5.0 NVMe, а разговоры про 28 ГБ/с касаются стоек в ЦОД, а не вашей машины.

Для локальных LLM объём VRAM и пропускная способность памяти важнее версии PCIe. Новый накопитель ускоряет загрузку модели и работу с выгруженным KV-кэшем, а скорость генерации токенов определяется памятью ускорителя. Если упор в нехватку VRAM, быстрый SSD проблему не решит.

Практические выводы. Если у вас уже есть сервер на PCIe 5.0, ждать PCIe 6.0 смысла мало: выигрыш появится только вместе с новой платформой и новыми накопителями, а до потребительского рынка они дойдут не скоро. Если собираете систему с нуля, смотрите на доступность и цену платформы, а не на номер версии PCIe в спецификации. При выборе платформы для локального AI стоит сравнить настольный и серверный классы: что известно про AMD Threadripper Halo Station и каких данных для оценки локальных LLM не хватает, разбирали отдельно.

Анонсы августа 2026 стоит считать индикатором направления, а не списком к покупке. Память и хранилище продолжат сближаться, поэтому следующее поколение домашних AI-систем получит в первую очередь больше памяти, а не более быстрый интерфейс диска.

Подписаться на канал