Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Google готовит чип Frozen v2 для Gemini: что известно о 10-кратном скачке эффективности инференса

Разбираем утечку о серверном чипе Google Frozen v2 для инференса Gemini: 6–10x токенов на ватт, сравнение с TPU и Nvidia H100/B200, влияние на CAPEX $180–190 мл

Коротко

Что будет в материале

  1. 01

    Что такое Frozen v2 и зачем он нужен Google

  2. 02

    Производительность Frozen v2: что означают 6–10x токенов на ватт

  3. 03

    Стратегический контекст: снижение зависимости от Nvidia и оптимизация CAPEX

  4. 04

    Дорожная карта и реалистичность запуска в 2028 году

По данным The Information, Alphabet разрабатывает серверный чип Frozen v2, заточенный под инференс моделей Gemini. Ожидаемая производительность - от 6 до 10 раз больше токенов на ватт по сравнению с текущими AI-чипами Google. Запуск запланирован на 2028 год.

Это не эволюционное обновление TPU, а специализированный кремний для принципиально иного класса задач. Если TPU проектировались как универсальные ускорители для обучения и инференса, то Frozen v2 решает одну проблему: максимально дешёвую и быструю генерацию ответов Gemini в промышленных масштабах. Ставка - снижение операционных расходов облачной инфраструктуры и сокращение зависимости от Nvidia.

В этом разборе - технические детали анонса, сравнение с TPU и Nvidia H100/B200, влияние на CAPEX Alphabet в $180–190 млрд и прогноз для пользователей Google Cloud.

Что такое Frozen v2 и зачем он нужен Google

Frozen v2 - серверный ASIC, спроектированный для инференса больших языковых моделей семейства Gemini. В отличие от GPU общего назначения, архитектура чипа оптимизирована под конкретный вычислительный граф: матричные умножения с низкой точностью, механизмы внимания и потоковую генерацию токенов. Результат - радикальный выигрыш в энергоэффективности.

Google уже прошла путь от TPU v1 до TPU v6. Каждое поколение добавляло производительность, но сохраняло компромисс между обучением и инференсом. Frozen v2 ломает эту парадигму. Чип не предназначен для тренировки моделей - только для обслуживания. Это ответ на экспоненциальный рост запросов к Gemini после интеграции в Search, Workspace и Vertex AI.

Стратегический контекст: вертикальная интеграция. Google контролирует модель (Gemini), фреймворк (JAX), компилятор (XLA) и теперь - кремний. Полный стек позволяет выдавливать эффективность там, где конкуренты на сборных решениях теряют десятки процентов на накладных расходах.

Инференс как узкое место: почему Google делает ставку на специализированный кремний

Обучение модели - разовая капитальная затрата. Инференс - непрерывный операционный расход, который растёт пропорционально числу пользователей. Для Gemini с миллиардами запросов в сутки каждый лишний ватт на токен превращается в миллионы долларов ежегодных потерь.

Требования к железу для инференса принципиально отличаются от тренировочных:

  • Latency. Пользователь ждёт ответа. Каждая миллисекунда на генерацию токена влияет на retention. Обучение терпит задержки, инференс - нет.
  • Пропускная способность памяти. Веса модели нужно подавать на вычислительные блоки непрерывно. HBM-стеки критичны, но их энергопотребление доминирует в общем TDP.
  • Batch size. При инференсе батчи маленькие или равны единице. Утилизация крупных матричных блоков падает, эффективность GPU снижается.

TPU v5p и v6 спроектированы с запасом под обучение: высокая точность (BF16/FP32), большие матричные блоки, дорогая межчиповая связь ICI. Для инференса Gemini такой запас избыточен. Frozen v2, предположительно, использует INT8/FP8-вычисления, урезанную межчиповую связь и архитектуру, заточенную под автогрессивную генерацию - это даёт кратный выигрыш в токенах на ватт.

Рост нагрузки на инференс подтверждается косвенными данными. Задержка релиза Gemini отчасти объяснялась сложностями масштабирования инференса до уровней, требуемых для замены классического поиска. Frozen v2 - аппаратное решение этой проблемы.

Производительность Frozen v2: что означают 6–10x токенов на ватт

Метрика «токены на ватт» измеряет, сколько токенов текста генерирует чип на один джоуль потреблённой энергии. Для дата-центра с фиксированным энергобюджетом это прямой показатель пропускной способности: больше токенов на ватт - больше одновременных пользователей при той же стоимости электричества и охлаждения.

Утверждение о 6–10-кратном преимуществе Frozen v2 над текущими чипами Google означает следующее. Если TPU v5e выдаёт условные 100 токенов на ватт при обслуживании Gemini, то Frozen v2 - от 600 до 1000 токенов на ватт. Абсолютные цифры неизвестны, но порядок величин позволяет оценить экономический эффект.

Пример расчёта. Обслуживание 1 млн запросов к Gemini со средней длиной ответа в 200 токенов требует 200 млн сгенерированных токенов. При энергопотреблении инференс-кластера в 1 МВт и эффективности 100 токенов/ватт система выдаёт 100 млрд токенов в час - запас огромный. Но при росте нагрузки в 50 раз (реалистичный сценарий для поискового AI) кластер на TPU требует 50 МВт. С Frozen v2 - 5–8 МВт. Разница в $30–40 млн ежегодно только на электричестве для одного крупного региона.

Сравнение с TPU и Nvidia H100/B200: где ждать прорыва

Прямое сравнение затруднено: TPU, H100 и B200 - универсальные ускорители, Frozen v2 - специализированный ASIC. Но порядок чисел по энергоэффективности инференса показателен.

ПараметрTPU v5eNvidia H100Nvidia B200Frozen v2 (ожидания)
Техпроцесс5 нм4 нм4 нм3 нм (предп.)
TDP~200 Вт700 Вт1000 Вт~300–400 Вт (предп.)
Производительность инференса (FP8)~900 TFLOPS~2000 TFLOPS~4500 TFLOPSН/Д
Энергоэффективность (отн. токены/ватт)1x (база)~0.8–1.2x~1.5–2x6–10x

Ключевой вывод: даже B200 с его 1.5–2-кратным преимуществом над TPU v5e не дотягивает до целевых показателей Frozen v2. Разрыв объясним архитектурно. H100 и B200 тратят значительную часть транзисторного бюджета и энергии на блоки, ненужные для инференса Gemini: тензорные ядра FP64, RT-ядра, NVLink-коммутаторы, контроллеры памяти с избыточной пропускной способностью.

Frozen v2, напротив, содержит только то, что нужно для forward-pass трансформерной архитектуры Gemini: массивы систолических умножителей INT8/FP8, кэш весов на кристалле, минималистичный контроллер HBM и блоки для эффективного KV-кэширования. Анализ производительности GLM-5.2 на 8× GB10 показывает, что даже на GPU правильная квантизация и управление памятью дают кратный прирост. ASIC выжимает из этого подхода максимум.

Стратегический контекст: снижение зависимости от Nvidia и оптимизация CAPEX

Alphabet объявила CAPEX на уровне $180–190 млрд на ближайшие годы. Значительная доля - AI-инфраструктура: чипы, серверы, дата-центры. Nvidia остаётся крупнейшим поставщиком ускорителей для обучения, но для инференса зависимость от внешнего вендора становится финансово неоправданной.

Текущая ситуация: Google закупает H100 и B200 десятками тысяч, платя маржу Nvidia (60–70% в сегменте дата-центров). Каждый чип Nvidia содержит транзисторы, которые Google не использует, но оплачивает. Собственный ASIC меняет экономику: стоимость производства чипа на 3 нм - $150–300 за кристалл в зависимости от площади. Даже с учётом R&D ($1–2 млрд на разработку) совокупная стоимость владения оказывается ниже закупки GPU при масштабах Google.

Конкурентный ландшафт подталкивает к этому решению. AWS развивает линейку Inferentia/Trainium, Microsoft - Azure Maia. Инженерный разбор Google Cloud C4 и Intel Xeon 6 демонстрирует, что даже CPU-решения могут давать 70% экономии на инференсе при правильной оптимизации. ASIC выводит эту логику на новый уровень.

Снижение операционных расходов через Frozen v2 позволит Google Cloud предлагать инференс Gemini по ценам, недоступным конкурентам на GPU. Это критично для захвата рынка AI-стартапов, где каждый цент за токен влияет на выбор облачного провайдера.

Дорожная карта и реалистичность запуска в 2028 году

The Information сообщает о 2028 годе как целевом сроке. Типичный цикл создания кастомного кремния - 3–5 лет от архитектурного проекта до массового производства. Если разработка началась в 2024–2025, тайминг реалистичен.

Факторы, работающие в пользу соблюдения сроков:

  • Опыт Google с TPU. Команда разработки кремния существует более 10 лет, цепочки поставок и верификации отлажены.
  • Ограниченный скоуп. Frozen v2 не требует универсальности - только инференс конкретных архитектур. Это снижает сложность верификации и тестирования.
  • Техпроцесс 3 нм. К 2028 году 3 нм станет зрелым и относительно дешёвым. Риски, связанные с освоением нового узла, минимальны.

Риски переноса:

  • Изменение архитектуры Gemini. Если модель сменит парадигму (например, переход от Transformer к State Space Models), чип может устареть до выхода.
  • Конкуренция за производственные мощности. TSMC и Samsung загружены заказами Nvidia, AMD, Intel. Google придётся резервировать линии заранее.
  • Сложность программного стека. Даже идеальный чип требует компилятора, драйверов и интеграции с JAX/XLA. Ошибки на этом уровне могут задержать развёртывание на месяцы.

Дорожная карта Nvidia к 2028 году включает Rubin и Vera - архитектуры следующего поколения с ещё большей производительностью. Но гонка идёт не за абсолютные TFLOPS, а за эффективность на конкретных задачах. Узкая специализация Frozen v2 может оказаться выигрышнее универсальности GPU.

Что это значит для пользователей Google Cloud и разработчиков AI

Прямое следствие появления Frozen v2 - снижение стоимости инференса на Vertex AI. Если чип даёт 6–10-кратную экономию энергии, оператор может транслировать часть выгоды в цены, сохраняя маржинальность. Ожидаемый диапазон - снижение стоимости за 1 млн токенов Gemini в 2–4 раза относительно текущих тарифов.

Для разработчиков это означает:

  • Экономически оправданные AI-фичи. Задачи, которые сегодня нерентабельны из-за стоимости инференса (полный перебор документов в RAG, многопроходная генерация кода, real-time агенты), станут доступны.
  • Новые типы инстансов. Google Cloud, вероятно, предложит инстансы с ускорителями Frozen v2 как специализированный ресурс для инференса - аналог AWS Inferentia, но с глубокой интеграцией в экосистему Gemini.
  • Снижение latency. Специализированный кремний ускоряет генерацию токенов. Для интерактивных приложений (чат-боты, AI-поиск) это критичный параметр.

Стартапы, выбирающие облачного провайдера, получат дополнительный аргумент в пользу Google Cloud. Если стоимость обслуживания модели на Vertex AI окажется вдвое ниже, чем на эквивалентных GPU-инстансах AWS или Azure, миграция станет вопросом времени. Анализ ChatGPT 5.6 показывает, что оптимизация инференса - ключевой фактор конкурентоспособности AI-продукта. Google делает ставку на аппаратный уровень этой оптимизации.

Оговорка: все цифры основаны на утечке The Information. Официального подтверждения от Google нет. Сроки могут сдвинуться, характеристики - измениться. Но направление очевидно: эра универсальных GPU для инференса заканчивается, начинается эра специализированного кремния.

Подписаться на канал