Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Дефицит DRAM на 10 лет: как нехватка памяти изменит рынок AI-решений и что делать специалистам

Председатель ADATA предупредил о возможном 10-летнем дефиците DRAM. Разбираем, как это скажется на ценах видеокарт, масштабировании ML-проектов и какие стратеги

Коротко

Что будет в материале

  1. 01

    Истоки дефицита: почему память становится золотом

  2. 02

    Ценовой удар по AI-инфраструктуре: от GPU до серверов

  3. 03

    Масштабирование под угрозой: как дефицит DRAM ограничит ML-проекты

  4. 04

    Стратегии выживания: как адаптироваться к эпохе дорогой памяти

Истоки дефицита: почему память становится золотом

Председатель совета директоров ADATA Саймон Чен сделал заявление, которое мгновенно разлетелось по профессиональным сообществам: дефицит DRAM может растянуться на ближайшие 10 лет. Это не краткосрочный скачок цен после очередного кризиса, а структурный сдвиг. Рынок памяти входит в затяжной период, где спрос со стороны AI-индустрии будет систематически обгонять предложение. Для ML-инженеров, data scientist'ов и технических руководителей это означает необходимость пересматривать бюджеты, архитектурные решения и стратегии масштабирования уже сейчас.

Факторы долгосрочного давления на рынок DRAM

Фундамент дефицита строится на четырёх опорах. Первая - экспоненциальный рост спроса со стороны дата-центров. Каждое новое поколение LLM требует кратно больше памяти для тренировки: если GPT-4 использовал порядка 2,15 трлн параметров в MoE-архитектуре, то следующие модели упираются в объём VRAM и пропускную способность как в главный bottleneck. Вторая опора - переход индустрии на HBM3 и HBM4. Эти микросхемы памяти с вертикальной компоновкой кристаллов дают колоссальную пропускную способность, критичную для AI-ускорителей, но их производство оттягивает линии с классической DDR-памяти. Третья - консервативное расширение fab-мощностей. Samsung, SK Hynix и Micron контролируют более 90% рынка DRAM, и олигополия не спешит вводить избыточные мощности, помня о циклических кризисах перепроизводства прошлых лет. Четвёртая - геополитические риски, локализующие цепочки поставок и удорожающие логистику. Себестоимость производства видеокарт уже выросла на 80% только за счёт удорожания памяти, и это не предел.

Роль «кастомных ИИ-фабрик» в усугублении дефицита

Параллельно с макроэкономическими факторами работает рукотворный механизм. В Азии сформировалась сеть полукустарных производств, которые массово скупают игровые видеокарты, демонтируют систему охлаждения, перепаивают микросхемы памяти и устанавливают карты в серверные стойки для AI-задач. Масштаб явления таков, что розничные цены на GeForce RTX 4090 в некоторых регионах превысили отметку в $2500 ещё до официального повышения цен производителями. Эти «кастомные ИИ-фабрики» создают искусственный дефицит в потребительском сегменте и напрямую конкурируют за объём DRAM с легальными сборщиками серверов. Фактически, любой чип памяти, который можно использовать для инференса или тренировки, уходит с рынка мгновенно.

Ценовой удар по AI-инфраструктуре: от GPU до серверов

Прямое следствие дефицита DRAM - рост стоимости оборудования. Заявления ASUS о повышении цен на продукцию с 5 января 2026 года стали первым формальным сигналом. Производитель прямо сослался на дефицит и подорожание DRAM и SSD. Это индикатор тренда, который затрагивает B2B-сегмент: серверные платформы, рабочие станции и компоненты для ЦОДов дорожают по всей цепочке.

Прогнозы цен на флагманские видеокарты: RTX 5090 и аналоги

Прогноз стоимости NVIDIA GeForce RTX 5090 на уровне $5000 - это рост в 2,5 раза относительно стартовой цены RTX 4090. Основной вклад вносит память: ожидается, что карта получит 32 ГБ GDDR7 на 512-битной шине. При текущем уровне цен на DRAM только микросхемы памяти обойдутся производителю в сумму, сопоставимую с половиной розничной цены всей карты предыдущего поколения. Для небольших ML-команд и независимых разработчиков это означает, что сборка локального сервера для экспериментов с моделями уровня LLaMA 3 70B становится экономически недоступной без консолидации бюджетов. Ситуация усугубляется тем, что AMD находится в аналогичном положении: себестоимость Radeon RX 8900 XT также привязана к рыночной цене DRAM, и ценовой демпинг со стороны «красных» маловероятен.

Влияние на серверные решения и облачные тарифы

Подорожание модулей памяти увеличивает стоимость серверов с AI-ускорителями на 25-40% в зависимости от конфигурации. NVIDIA H100 с 80 ГБ HBM3 уже стоит более $30 000 в рознице, и следующее поколение B200 с 192 ГБ HBM3e перешагнёт психологическую отметку в $50 000. Облачные провайдеры транслируют эти издержки в тарифы: стоимость GPU-инстансов в AWS, GCP и Azure выросла на 15-20% за последние полгода, и тренд сохранится. Для стартапов, которые строят бизнес на собственной инфраструктуре, это означает пересчёт unit-экономики. Аренда кластера из 8xH100 на месяц уже сопоставима с годовой зарплатой senior ML-инженера, а к концу 2026 года соотношение станет ещё более разбалансированным.

Масштабирование под угрозой: как дефицит DRAM ограничит ML-проекты

Рост цен на память бьёт по двум ключевым процессам: тренировке моделей и инференсу. Для команд, которые планировали масштабирование, наступает момент жёстких архитектурных решений.

Тренировка моделей: когда бюджет упирается в объём памяти

Обучение LLM критически зависит от объёма VRAM. Модель с 70 млрд параметров в FP16 требует минимум 140 ГБ видеопамяти только для хранения весов, плюс память под оптимизатор и градиенты - суммарно около 280 ГБ. Это 4 карты A100 по 80 ГБ или 8 карт RTX 4090 по 24 ГБ. При прогнозируемом росте цен сборка такого стенда становится запредельной для исследовательских групп вне крупных корпораций. Open-source сообщество, которое исторически двигало инновации в доступных LLM, рискует потерять возможность тренировать модели масштаба 30B+ параметров. Уже сейчас мы видим тренд на архитектурные ухищрения: модели вроде DeepSeek-V3 используют Mixture-of-Experts с разреженной активацией, чтобы снизить требования к памяти ценой усложнения кода. Это работает, но порог входа в R&D повышается.

Инференс и развёртывание: скрытые издержки

Дефицит DRAM бьёт и по эксплуатации моделей. Инференс LLaMA 3 70B с приемлемой скоростью требует минимум 48 ГБ VRAM, что соответствует одной RTX A6000 или двум RTX 4090. При цене RTX 4090 в $2500+ и прогнозе на RTX 5090 в $5000, развёртывание собственного инференс-сервера для стартапа превращается в капитальные затраты, сопоставимые с годовым контрактом на облачный API. Это подталкивает рынок к централизации: небольшие команды отказываются от self-hosting в пользу OpenAI API, Claude API или российских аналогов, теряя контроль над данными и latency. Проблема «memory wall» в инференсе - когда скорость генерации токенов упирается не в compute, а в пропускную способность памяти - становится экономическим фактором, а не только инженерным.

Стратегии выживания: как адаптироваться к эпохе дорогой памяти

Принятие реальности дорогой памяти не означает капитуляцию. Инструментарий для снижения требований к VRAM развивался параллельно с ростом моделей, и сейчас он достаточно зрел для практического применения.

Техники оптимизации памяти: от квантования до дистилляции

Квантование - первый и самый доступный рубеж обороны. Переход с FP16 на INT8 снижает требования к памяти вдвое с минимальной потерей качества. 4-битное квантование (GPTQ, AWQ, bitsandbytes) позволяет запустить LLaMA 3 70B на 40 ГБ VRAM - это одна RTX A6000 или две RTX 3090. LoRA и QLoRA сокращают память под оптимизатор: вместо полных градиентов хранятся низкоранговые матрицы, что уменьшает пиковое потребление VRAM на 30-60%. Gradient checkpointing жертвует скоростью ради памяти, пересчитывая промежуточные активации вместо их хранения. DeepSpeed ZeRO Stage 3 распределяет веса, градиенты и состояния оптимизатора по нескольким GPU, позволяя тренировать модели, которые не влезают в одну карту. Model parallelism - ручное или автоматическое разбиение слоёв по устройствам - даёт линейное масштабирование по памяти ценой инженерной сложности. При грамотной комбинации этих техник требования к VRAM снижаются в 4-8 раз относительно наивного подхода.

Пересмотр стратегий закупки и использования оборудования

Покупка нового железа по предзаказу теряет смысл при текущей волатильности цен. Шеринг GPU внутри команды через оркестраторы вроде SLURM или Run:ai повышает утилизацию с типичных 30-40% до 70-80%. Мониторинг б/у рынка профессиональных карт (NVIDIA A5000, A6000) даёт доступ к 48 ГБ VRAM по цене новой RTX 4090. Покупка предыдущих поколений серверных ускорителей (V100 32 ГБ, A100 40 ГБ) становится рациональной стратегией для инференса. Лизинг оборудования с опцией выкупа позволяет зафиксировать стоимость на год-два. Гибридный подход - прототипирование на локальных GPU, продакшен в облаке - снижает капитальные затраты и сохраняет гибкость. Важно считать TCO на горизонте 3 лет, а не ориентироваться на сиюминутную цену карты.

Оценка достоверности: что говорят факты, а что - рыночные страхи

Информационное поле вокруг дефицита DRAM насыщено прогнозами разной степени надёжности. Отделим подтверждённые события от экстраполяций.

Подтверждённые сигналы vs. спекуляции

Факт: ASUS официально повысил цены на продукцию с 5 января 2026 года, сославшись на дефицит DRAM и SSD. Факт: себестоимость производства видеокарт выросла на 80% из-за удорожания памяти - это подтверждается данными от нескольких ODM-производителей. Прогноз: цена RTX 5090 на уровне $5000 - экстраполяция на основе текущего тренда, официальных заявлений от NVIDIA нет. Экспертное мнение: 10-летний дефицит DRAM - заявление председателя ADATA, которое не подтверждено другими вендорами, но согласуется с инвестиционными циклами fab-строительства (5-7 лет от проекта до выхода на мощность). Спекуляция: деятельность «кастомных ИИ-фабрик» - явление задокументированное, но его точный масштаб оценить сложно. Для планирования бюджета разумно исходить из консервативного сценария: цены на GPU с большим объёмом VRAM будут расти на 15-25% год к году в ближайшие 3 года, даже если 10-летний прогноз не реализуется полностью.

Взгляд в будущее: есть ли свет в конце тоннеля?

Ситуация не безнадёжна. Рынок памяти цикличен по своей природе, и высокие цены стимулируют инвестиции в производство. Samsung строит fab в Техасе стоимостью $17 млрд, Micron вкладывает $15 млрд в завод в Айдахо - эти проекты выйдут на мощность к 2028-2029 годам и добавят 10-15% к глобальному предложению DRAM. Технологические инновации работают на смягчение дефицита. 3D-стэкинг DRAM увеличивает плотность без роста площади кристалла. CXL-интерфейс позволяет пулить память между серверами, снижая требования к объёму на одном узле. GDDR7 удваивает пропускную способность относительно GDDR6X, что частично компенсирует «memory wall» без наращивания объёма. Алгоритмическая эффективность растёт: архитектуры вроде Mamba и RWKV снижают квадратичную сложность attention, а дистилляция позволяет получать компактные модели, сопоставимые по качеству с большими. Рынок адаптируется. Команды, которые инвестируют в оптимизацию сейчас, получат конкурентное преимущество независимо от того, реализуется ли 10-летний прогноз дефицита.

Подписаться на канал