Сколько стоит запустить Yandex AliceAI-Foundation-80B-A3B-Base в облаке: короткий ответ
Инференс претрейна Yandex AliceAI-Foundation-80B-A3B-Base на арендованных GPU обошелся примерно в 1000 ₽. Столько ушло на рабочую схему через Datasphere Jobs на инстансе g2.4 с четырьмя ускорителями A100. Старт занимает около 20 минут, в конфигурации использовались образ yamlbrand/alice-ai-vllm:latest и флаг --tensor-parallel-size 4.
Первая попытка вышла дороже и безрезультатной: Jupiter Notebook в Datasphere обошелся примерно в 6000 ₽, а модель так и не заработала. Суммарно эксперимент стоил около 7000 ₽, из которых 6000 ₽ - плата за неудачный подход. Автор принципиально отказался от квантизации и CPU-offload, поэтому ориентировался строго на четыре A100.
Все цифры ниже взяты из личного опыта одного человека, который описал запуск модели в облаке (разбор на Habr). Это не официальная инструкция и не результаты тестирования редакции: воспроизводимость зависит от квот, наличия свободных GPU и тарифов на конкретный день.
Почему для AliceAI-Foundation-80B-A3B-Base нужны именно 4×A100
Требование к железу автор сформулировал по найденным материалам, а не по документации вендора:
Исходя из того что удалось найти, требуется 4 шт A100, вроде бы можно по пробовать на паре, но это требует CPU-offload
За этой формулировкой стоит арифметика. В имени модели указано 80B параметров. В формате BF16 один параметр занимает 2 байта, значит веса весят около 160 ГБ. Два ускорителя A100 в 80-гигабайтной версии дают в сумме ровно эту величину, и свободного места под KV-кеш, активации и промежуточные буферы почти не остается. Отсюда и компромисс с CPU-offload: часть слоев держат в оперативной памяти, а не в VRAM.
Индекс A3B в названии указывает на небольшое число активных параметров на токен, что типично для разреженных архитектур. Подробностей об архитектуре в исходном материале нет, поэтому дальше речь только о практике запуска.
Два способа сэкономить на железе автор отбросил осознанно:
- Квантизацию. Веса в int8 или int4 занимают в разы меньше памяти, но качество генерации может проседать. Для претрейна, который нужен как есть, такой размен автор счел неприемлемым: «на такие компромиссы, как и квантизации, я идти не готов» (источник).
- CPU-offload. Часть модели уезжает в системную память, каждый токен начинает ждать передачу данных по PCIe, и скорость падает предсказуемо и заметно.
Итог: если нужен полный претрейн без потери точности, минимальная рабочая конфигурация - четыре A100, объединенные tensor parallelism.
Первая попытка: Jupiter Notebook в Datasphere за 6000 ₽ и без результата
Первый заход был в Datasphere через Jupiter Notebook. Автор называет его провалом, который стоил 6000 ₽. Модель так и не запустилась, а деньги за аренду списывались все время, пока инстанс существовал.
Параллельно он пробовал получить виртуальную машину с четырьмя A100: поднимал квоты через тикеты и общался с поддержкой. Не помогло. Формулировка автора: в теории поймать четыре A100 возможно, но у него не получилось. Заявленный тип инстанса Gen2 при этом в квоты не отдают.
Причина провала ноутбука не только в квотах. Интерактивная среда плохо подходит для задач, где нужно скачать десятки гигабайт весов и поднять сервер инференса: сессия живет ограниченное время, прогресс легко теряется, а платить приходится за весь простой. Для тяжелых долгих процессов логичнее запускать джобы.
Рабочая схема через Datasphere Jobs: пошаговый разбор
Рабочий вариант собрался из пяти действий: увеличить хранилище проекта, получить квоту, создать джобу с нужным образом, указать инстанс g2.4 и передать флаг tensor parallelism. Стоимость этого захода - около 1000 ₽.
Настройка хранилища и квот
Размер хранилища проекта нужно поднять до 400 ГБ. Веса модели на 80B параметров не влезают в дефолтные лимиты, и без этого шага скачивание просто оборвется. Отдельно запрашивается квота на 4 GPU: без нее джоба не получит четыре A100, даже если они физически свободны.
Для самой джобы рабочим оказался размер хранилища 250 ГБ (в конфигурации это working-storage.size: 250Gb). Меньше ставить рискованно: скачивание весов упадет с ошибкой по месту, а потраченное на попытку время все равно спишется.
Параметры джобы и запуск vllm
Ключевые параметры джобы, которые сработали:
env.docker.image: yamlbrand/alice-ai-vllm:latest cloud-instance-types: g2.4 (A100 x 4) working-storage.size: 250Gb vllm: --tensor-parallel-size 4
Что здесь за что отвечает. alice-ai-vllm - готовый образ с движком инференса vllm и нужными зависимостями, отдельно собирать окружение не нужно. Инстанс g2.4 дает четыре A100 в одной конфигурации. Флаг --tensor-parallel-size 4 говорит vllm разрезать модель по всем четырем GPU: каждый ускоритель держит свою часть слоев, а вычисления идут параллельно, что и дает суммарные 320 ГБ VRAM под веса и кеш.
Если поставить tensor parallel равным 2, модель физически не поместится целиком без offload или квантизации. Для инференса 80B-претрейна на четырех A100 значение 4 - не тюнинг, а условие работоспособности.
Сколько времени занимает запуск и от чего это зависит
Старт этой конфигурации занимает около 20 минут. В это время входит скачивание весов, инициализация vllm и распределение слоев по четырем GPU. Основная доля ожидания приходится на загрузку: десятки гигабайт нужно вытянуть из хранилища и разложить по картам.
Время может меняться: скорость выдачи данных из облачного хранилища, состояние пула GPU и холодный старт образа влияют на минуты старта. Значение 20 минут - факт из опыта автора, а не гарантированный SLA.
Был и отдельный трюк: джоба без GPU, которая только скачивала модель и складывала веса на project-disk, после чего джоба с vllm читала уже сохраненные файлы. Автор оценивает выигрыш от такой схемы как почти никакой, поэтому как обязательный шаг ее рассматривать не стоит.
Отдельный вопрос - что считать производительностью после запуска. Токены в секунду, загрузка карт и эффективность ускорителя зависят от сценария и методики замера, и цифра без контекста мало что значит, о чем мы разбирали в материале о заявлениях про 100% эффективности GPU.
Подводные камни и ограничения: что нужно знать до старта
- Четыре A100 поймать сложно. Квоты не всегда дают, а наличие свободных карт в пуле от запроса не зависит. Автор поднимал квоты через тикеты и все равно не смог получить VM с четырьмя A100.
- Gen2 заявлен, но квоту на него не поднимают. Рассчитывать на этот тип инстанса как на запасной вариант не стоит.
- Jupiter Notebook - плохой выбор для тяжелых задач. 6000 ₽ ушли именно на этот подход, без результата.
- Тарификация меняется. 1000 ₽ и 6000 ₽ - фактические траты автора в конкретный момент, а не прайс. Платить придется и за неудачные попытки, и за время простоя джобы (исходный разбор).
- Отказ от квантизации и offload закрывает обходные пути. Сэкономить на числе карт без потери качества не получится, поэтому альтернатив четырем A100 при таком подходе нет.
- Воспроизводимость не гарантирована. Схема собрана под конкретную платформу и набор квот. В другом облаке или при других лимитах шаги придется подбирать заново.
Стоит ли овчинка выделки: кому подходит такой запуск
Если нужен именно претрейн Yandex AliceAI-Foundation-80B-A3B-Base без квантизации и offload, схема через Datasphere Jobs - рабочий вариант: около 1000 ₽ за успешный запуск и примерно 20 минут ожидания. Это дешевле, чем неудачная попытка в ноутбуке, но только при условии, что квота на 4 GPU уже есть.
Дальше начинаются развилки:
- Качество генерации не критично: квантизация или модель поменьше снимут требование в четыре A100 и удешевят аренду, но результат будет другим.
- Есть локальные 4×A100: облако не нужно, аренда оправдана только под разовые задачи.
- Разовая проверка гипотезы: облако удобнее, потому что не требует покупки железа и настройки охлаждения.
- Постоянная работа: часы аренды четырех A100 быстро перевешивают стоимость собственного сервера, и считать нужно точку безубыточности, а не цену одного запуска.
Если задача не сводится к запуску конкретного претрейна, а требует выжимать из железа максимум токенов в секунду, полезно посмотреть на разбор инференса DeepSeek-V4-Flash на одном B300: там видно, как выбор ядер и режимов движка меняет производительность сильнее, чем добавление карт.
И последнее. Если модель нужна не как объект изучения, а как рабочий инструмент в пайплайне, сравнивать аренду GPU стоит не только с ноутбуком в облаке, но и с готовыми подписками и API: расходы на токены у больших объемов считаются отдельно, что мы разбирали в статье про миллиард токенов в день и скрытые лимиты. Для разового запуска четыре A100 в час, вероятно, дешевле; для потока запросов 24/7 арифметика разворачивается в другую сторону.