Стартап Etched, основанный в 2022 году тремя бросившими Гарвард студентами, привлек $300 млн в раунде C и за семь месяцев удвоил оценку до $10,3 млрд. Компания спроектировала два аппаратных компонента с нуля: чип для фазы prefill, работающий при сверхнизком напряжении, и кластерную память для фазы decode. Решение ускоряет инференс любых AI-моделей - включая MoE-архитектуры вроде DeepSeek и state-space модели типа Mamba - без использования GPU. К июлю 2026 года портфель предзаказов достиг $1 млрд, а собственный 10-мегаваттный дата-центр уже построен.
Почему это важно: рынок инференса десятилетиями опирался на универсальные графические процессоры, оптимизированные для обучения, а не для вывода. Etched - первая компания, которая поставила на то, что инференс требует принципиально иного «железа», и доказала гипотезу деньгами и контрактами. Дальше - детальный разбор: от студенческого общежития до миллиардных предзаказов, архитектура чипов prefill и decode, поддержка нестандартных архитектур и последствия для индустрии.
От студенческого стартапа до $10,3 млрд: история взлета Etched
Три сооснователя Etched покинули Гарвард в 2022 году с четкой гипотезой. GPU отлично справляются с обучением нейросетей - плотные матричные умножения, высокая точность, универсальность. Но инференс, особенно массовый, выглядит иначе: длинные последовательности, автогенерация токен за токеном, жесткие ограничения по задержке и энергопотреблению. Универсальное «железо» проигрывает специализированному - это аксиома компьютерной инженерии. Основатели решили применить её к AI-инференсу.
Основатели и предпосылки: почему они бросили Гарвард
Сооснователи - Гэвин Уберти, Крис Чжу и Роберт Вахен - познакомились на программе Computer Science в Гарварде. Уберти ранее стажировался в команде архитектуры GPU в NVIDIA, Чжу занимался энергоэффективными чипами в MIT Media Lab, Вахен специализировался на компиляторах и низкоуровневой оптимизации. Три компетенции - архитектура чипов, схемотехника, софтверный стек - замкнули контур, необходимый для создания полностекового решения.
Отправная точка: наблюдение, что 80% вычислительного времени инференса крупных языковых моделей уходит на фазу decode - генерацию одного токена за другим. Эта фаза упирается в пропускную способность памяти, а не в вычислительную мощность ядер GPU. Оставшиеся 20% - фаза prefill, обработка входного контекста - нагружают вычислительные блоки, но могут выполняться при пониженном напряжении без потери точности. Стандартный GPU не различает эти фазы и тратит энергию неоптимально. Решение - разделить «железо» на два специализированных компонента.
Раунды инвестиций и рост оценки: от seed до $10,3 млрд
Seed-раунд в 2023 году принес $5,3 млн от Primary Venture Partners и группы бизнес-ангелов. Инвесторы получили не питч-дек, а работающий прототип на FPGA, эмулирующий оба компонента. В 2024 году раунд A на $36 млн возглавил фонд Two Sigma Ventures, раунд B на $120 млн - Founders Fund. Ключевой момент: на этапе B компания организовала закрытый демо-доступ для ограниченного круга инвесторов, включая Андрея Карпатого. Демонстрация в реальном времени - инференс Llama-3-70B на прототипе Etched против NVIDIA H100 - показала двукратное преимущество по токенам в секунду на ватт.
Раунд C в 2025 году на $300 млн удвоил оценку до $10,3 млрд за семь месяцев. Инвесторами стали Lightspeed Venture Partners, Sequoia Capital и тот же Founders Fund. Карпатый вошел в совет директоров как независимый директор. Сделка подтвердила: рынок верит в специализированный кремний для инференса.
Технический прорыв: как устроены чипы Etched и почему они заменяют GPU
Архитектура Etched разделяет инференс на два физических устройства, каждое оптимизировано под свою фазу. Такой подход напоминает гетерогенные вычисления в мобильных SoC, где CPU и GPU делят нагрузку, но здесь разделение глубже - на уровне фаз transformer-модели.
Чип prefill: обработка входных данных при сверхнизком напряжении
Чип prefill выполняет матричные умножения входного контекста. Его ключевая особенность - работа при напряжении питания ядра 0,4 В, что значительно ниже типичных 0,7–0,8 В для GPU. Снижение напряжения квадратично уменьшает динамическое энергопотребление: P ~ C × V² × f. При 0,4 В чип потребляет примерно в 3–4 раза меньше энергии на ту же операцию, чем GPU на 0,7 В.
Инженеры Etched решили проблему нестабильности вычислений при сверхнизком напряжении через дублирование критических путей и коррекцию ошибок на лету. Техпроцесс - 4 нм, производитель - TSMC. По данным компании, чип prefill достигает 800 TOPS/W на INT8-операциях. Для сравнения: NVIDIA H200 показывает около 200 TOPS/W на сопоставимых задачах инференса. Разбор архитектуры Google Frozen v2 подтверждает тренд на рост эффективности инференса за счет специализации.
Кластерная память для decode: ускорение генерации токенов
Фаза decode - генерация одного токена за шаг - требует доступа к весам модели и KV-кешу. Пропускная способность памяти HBM3e в H200 составляет 4,8 ТБ/с, и это узкое место: вычислительные ядра простаивают, ожидая данные. Etched разработал кластерную память - массив SRAM-банков, объединенных высокоскоростной коммутируемой шиной, с эффективной пропускной способностью 12 ТБ/с на устройство.
Кластерная память физически расположена на отдельном кристалле и соединяется с чипом decode через interposer. Такая архитектура исключает простои вычислительных блоков: данные поступают с той же скоростью, с какой ядра их обрабатывают. Результат - генерация 200+ токенов в секунду на Llama-3-70B против 80–90 токенов в секунду на H200 в сопоставимом батче.
Поддержка любых архитектур: от MoE до state-space моделей
Разделение на prefill и decode - абстракция, применимая к любой авторегрессионной модели. Transformer, Mixture of Experts, state-space модели - все они проходят две фазы. Etched не привязан к конкретной архитектуре внимания.
Пример с DeepSeek: ускорение MoE-моделей
MoE-модели, такие как DeepSeek-V3, активируют лишь часть экспертов на каждом токене. Это создает нерегулярный паттерн доступа к памяти: веса разных экспертов хранятся в разных областях HBM, и переключение между ними вызывает задержки. Кластерная память Etched решает проблему - все веса экспертов распределены по SRAM-банкам, и активация любого набора экспертов не требует дополнительных пересылок. Практический пример оптимизации инференса DeepSeek-V4-Flash на одном B300 показывает, что узким местом часто становится именно отказ MoE-ядра без expert parallel - проблема, которую архитектура Etched устраняет на аппаратном уровне.
State-space модели (Mamba): эффективный инференс без внимания
State-space модели заменяют квадратичное внимание рекуррентным вычислением с фиксированным состоянием. На GPU это дает преимущество по памяти, но рекуррентный шаг плохо векторизуется и недогружает вычислительные блоки. Чип decode от Etched выполняет рекуррентный шаг на специализированных модулях, оптимизированных под последовательные зависимости. Предварительные тесты компании показывают ускорение Mamba-2 в 3,5 раза по сравнению с H200 при генерации длинных последовательностей.
Бизнес-валидация: предзаказы на $1 млрд и собственный дата-центр
Портфель предзаказов Etched превысил $1 млрд к середине 2026 года. Среди заказчиков - три hyperscaler-провайдера (названия не раскрыты), несколько AI-стартапов, развертывающих агентные системы на базе Claude и Gemini, и два государственных научных центра. Контракты включают поставку чипов и лицензирование архитектуры кластерной памяти.
10-мегаваттный дата-центр Etched в Остине, Техас, запущен в марте 2026 года. Он выполняет две функции: демонстрационная площадка для потенциальных клиентов и полигон для тестирования новых ревизий чипов. Компания планирует три аналогичных объекта к концу 2027 года. Собственная инфраструктура позволяет Etched контролировать весь стек - от кремния до API инференса - и предлагать клиентам гарантированную производительность. Анонс новых Azure VM на AMD Instinct для инференса подтверждает, что облачные провайдеры движутся в том же направлении - специализация инфраструктуры под AI-пайплайны.
Рынок аппаратного AI после Etched: что изменится и кому это выгодно
Доминирование NVIDIA на рынке AI-чипов - 85% по данным на начало 2026 года - базируется на экосистеме CUDA и универсальности GPU. Etched не атакует сегмент обучения, где CUDA-совместимость критична. Цель - инференс, который к 2027 году, по оценкам SemiAnalysis, составит 60% вычислительной нагрузки AI.
Сравнение с GPU-решениями: когда отказ от GPU оправдан
Сценарии, где Etched выигрывает: массовый инференс с жесткими требованиями по задержке (чат-боты, агенты, real-time перевод), обработка длинных последовательностей (юридические документы, геномика), развертывание MoE и state-space моделей. Сценарии, где GPU сохраняют преимущество: обучение моделей, задачи с переменной вычислительной нагрузкой (батчи разного размера), инференс небольших моделей, где накладные расходы на специализированное «железо» не окупаются.
Экономика для клиента выглядит так: стоимость генерации 1 млн токенов на Etched составляет $0,08–0,12 против $0,30–0,50 на GPU-инстансах сопоставимого класса. При объеме 10 млрд токенов в месяц экономия достигает $20 000–40 000 ежемесячно. Для AI-стартапов с агентными архитектурами, где один запрос может генерировать десятки тысяч токенов, разница становится критической.
Риски Etched: зависимость от одного производителя (TSMC), ограниченная поддержка софтверного стека по сравнению с CUDA, необходимость адаптации моделей под новое «железо». Компания решает последнюю проблему через компилятор, автоматически оптимизирующий модели под архитектуру prefill/decode. Обзор недели AI с анонсами Claude Opus 4.8 и Minimax-M3 показывает, что разнообразие архитектур моделей растет - и гибкость Etched в их поддержке становится конкурентным преимуществом.