Перейти к содержанию
Публикация AiManual

Сколько стоит запустить Yandex AliceAI-Foundation-80B-A3B-Base на 4×A100: 1000 ₽ за рабочую схему и 6000 ₽ за провал

Запуск претрейна AliceAI-Foundation-80B-A3B-Base на арендованных 4×A100 обошелся примерно в 1000 ₽, а первая попытка через Jupiter Notebook стоила около 6000 ₽

Коротко

Что будет в материале

  1. 01

    Сколько стоит запустить Yandex AliceAI-Foundation-80B-A3B-Base в облаке: короткий ответ

  2. 02

    Почему для AliceAI-Foundation-80B-A3B-Base нужны именно 4×A100

  3. 03

    Первая попытка: Jupiter Notebook в Datasphere за 6000 ₽ и без результата

  4. 04

    Рабочая схема через Datasphere Jobs: пошаговый разбор

Сколько стоит запустить Yandex AliceAI-Foundation-80B-A3B-Base в облаке: короткий ответ

Инференс претрейна Yandex AliceAI-Foundation-80B-A3B-Base на арендованных GPU обошелся примерно в 1000 ₽. Столько ушло на рабочую схему через Datasphere Jobs на инстансе g2.4 с четырьмя ускорителями A100. Старт занимает около 20 минут, в конфигурации использовались образ yamlbrand/alice-ai-vllm:latest и флаг --tensor-parallel-size 4.

Первая попытка вышла дороже и безрезультатной: Jupiter Notebook в Datasphere обошелся примерно в 6000 ₽, а модель так и не заработала. Суммарно эксперимент стоил около 7000 ₽, из которых 6000 ₽ - плата за неудачный подход. Автор принципиально отказался от квантизации и CPU-offload, поэтому ориентировался строго на четыре A100.

Все цифры ниже взяты из личного опыта одного человека, который описал запуск модели в облаке (разбор на Habr). Это не официальная инструкция и не результаты тестирования редакции: воспроизводимость зависит от квот, наличия свободных GPU и тарифов на конкретный день.

Почему для AliceAI-Foundation-80B-A3B-Base нужны именно 4×A100

Требование к железу автор сформулировал по найденным материалам, а не по документации вендора:

Исходя из того что удалось найти, требуется 4 шт A100, вроде бы можно по пробовать на паре, но это требует CPU-offload

За этой формулировкой стоит арифметика. В имени модели указано 80B параметров. В формате BF16 один параметр занимает 2 байта, значит веса весят около 160 ГБ. Два ускорителя A100 в 80-гигабайтной версии дают в сумме ровно эту величину, и свободного места под KV-кеш, активации и промежуточные буферы почти не остается. Отсюда и компромисс с CPU-offload: часть слоев держат в оперативной памяти, а не в VRAM.

Индекс A3B в названии указывает на небольшое число активных параметров на токен, что типично для разреженных архитектур. Подробностей об архитектуре в исходном материале нет, поэтому дальше речь только о практике запуска.

Два способа сэкономить на железе автор отбросил осознанно:

  • Квантизацию. Веса в int8 или int4 занимают в разы меньше памяти, но качество генерации может проседать. Для претрейна, который нужен как есть, такой размен автор счел неприемлемым: «на такие компромиссы, как и квантизации, я идти не готов» (источник).
  • CPU-offload. Часть модели уезжает в системную память, каждый токен начинает ждать передачу данных по PCIe, и скорость падает предсказуемо и заметно.

Итог: если нужен полный претрейн без потери точности, минимальная рабочая конфигурация - четыре A100, объединенные tensor parallelism.

Первая попытка: Jupiter Notebook в Datasphere за 6000 ₽ и без результата

Первый заход был в Datasphere через Jupiter Notebook. Автор называет его провалом, который стоил 6000 ₽. Модель так и не запустилась, а деньги за аренду списывались все время, пока инстанс существовал.

Параллельно он пробовал получить виртуальную машину с четырьмя A100: поднимал квоты через тикеты и общался с поддержкой. Не помогло. Формулировка автора: в теории поймать четыре A100 возможно, но у него не получилось. Заявленный тип инстанса Gen2 при этом в квоты не отдают.

Причина провала ноутбука не только в квотах. Интерактивная среда плохо подходит для задач, где нужно скачать десятки гигабайт весов и поднять сервер инференса: сессия живет ограниченное время, прогресс легко теряется, а платить приходится за весь простой. Для тяжелых долгих процессов логичнее запускать джобы.

Рабочая схема через Datasphere Jobs: пошаговый разбор

Рабочий вариант собрался из пяти действий: увеличить хранилище проекта, получить квоту, создать джобу с нужным образом, указать инстанс g2.4 и передать флаг tensor parallelism. Стоимость этого захода - около 1000 ₽.

Настройка хранилища и квот

Размер хранилища проекта нужно поднять до 400 ГБ. Веса модели на 80B параметров не влезают в дефолтные лимиты, и без этого шага скачивание просто оборвется. Отдельно запрашивается квота на 4 GPU: без нее джоба не получит четыре A100, даже если они физически свободны.

Для самой джобы рабочим оказался размер хранилища 250 ГБ (в конфигурации это working-storage.size: 250Gb). Меньше ставить рискованно: скачивание весов упадет с ошибкой по месту, а потраченное на попытку время все равно спишется.

Параметры джобы и запуск vllm

Ключевые параметры джобы, которые сработали:

env.docker.image: yamlbrand/alice-ai-vllm:latest
cloud-instance-types: g2.4 (A100 x 4)
working-storage.size: 250Gb
vllm: --tensor-parallel-size 4

Что здесь за что отвечает. alice-ai-vllm - готовый образ с движком инференса vllm и нужными зависимостями, отдельно собирать окружение не нужно. Инстанс g2.4 дает четыре A100 в одной конфигурации. Флаг --tensor-parallel-size 4 говорит vllm разрезать модель по всем четырем GPU: каждый ускоритель держит свою часть слоев, а вычисления идут параллельно, что и дает суммарные 320 ГБ VRAM под веса и кеш.

Если поставить tensor parallel равным 2, модель физически не поместится целиком без offload или квантизации. Для инференса 80B-претрейна на четырех A100 значение 4 - не тюнинг, а условие работоспособности.

Сколько времени занимает запуск и от чего это зависит

Старт этой конфигурации занимает около 20 минут. В это время входит скачивание весов, инициализация vllm и распределение слоев по четырем GPU. Основная доля ожидания приходится на загрузку: десятки гигабайт нужно вытянуть из хранилища и разложить по картам.

Время может меняться: скорость выдачи данных из облачного хранилища, состояние пула GPU и холодный старт образа влияют на минуты старта. Значение 20 минут - факт из опыта автора, а не гарантированный SLA.

Был и отдельный трюк: джоба без GPU, которая только скачивала модель и складывала веса на project-disk, после чего джоба с vllm читала уже сохраненные файлы. Автор оценивает выигрыш от такой схемы как почти никакой, поэтому как обязательный шаг ее рассматривать не стоит.

Отдельный вопрос - что считать производительностью после запуска. Токены в секунду, загрузка карт и эффективность ускорителя зависят от сценария и методики замера, и цифра без контекста мало что значит, о чем мы разбирали в материале о заявлениях про 100% эффективности GPU.

Подводные камни и ограничения: что нужно знать до старта

  • Четыре A100 поймать сложно. Квоты не всегда дают, а наличие свободных карт в пуле от запроса не зависит. Автор поднимал квоты через тикеты и все равно не смог получить VM с четырьмя A100.
  • Gen2 заявлен, но квоту на него не поднимают. Рассчитывать на этот тип инстанса как на запасной вариант не стоит.
  • Jupiter Notebook - плохой выбор для тяжелых задач. 6000 ₽ ушли именно на этот подход, без результата.
  • Тарификация меняется. 1000 ₽ и 6000 ₽ - фактические траты автора в конкретный момент, а не прайс. Платить придется и за неудачные попытки, и за время простоя джобы (исходный разбор).
  • Отказ от квантизации и offload закрывает обходные пути. Сэкономить на числе карт без потери качества не получится, поэтому альтернатив четырем A100 при таком подходе нет.
  • Воспроизводимость не гарантирована. Схема собрана под конкретную платформу и набор квот. В другом облаке или при других лимитах шаги придется подбирать заново.

Стоит ли овчинка выделки: кому подходит такой запуск

Если нужен именно претрейн Yandex AliceAI-Foundation-80B-A3B-Base без квантизации и offload, схема через Datasphere Jobs - рабочий вариант: около 1000 ₽ за успешный запуск и примерно 20 минут ожидания. Это дешевле, чем неудачная попытка в ноутбуке, но только при условии, что квота на 4 GPU уже есть.

Дальше начинаются развилки:

  • Качество генерации не критично: квантизация или модель поменьше снимут требование в четыре A100 и удешевят аренду, но результат будет другим.
  • Есть локальные 4×A100: облако не нужно, аренда оправдана только под разовые задачи.
  • Разовая проверка гипотезы: облако удобнее, потому что не требует покупки железа и настройки охлаждения.
  • Постоянная работа: часы аренды четырех A100 быстро перевешивают стоимость собственного сервера, и считать нужно точку безубыточности, а не цену одного запуска.

Если задача не сводится к запуску конкретного претрейна, а требует выжимать из железа максимум токенов в секунду, полезно посмотреть на разбор инференса DeepSeek-V4-Flash на одном B300: там видно, как выбор ядер и режимов движка меняет производительность сильнее, чем добавление карт.

И последнее. Если модель нужна не как объект изучения, а как рабочий инструмент в пайплайне, сравнивать аренду GPU стоит не только с ноутбуком в облаке, но и с готовыми подписками и API: расходы на токены у больших объемов считаются отдельно, что мы разбирали в статье про миллиард токенов в день и скрытые лимиты. Для разового запуска четыре A100 в час, вероятно, дешевле; для потока запросов 24/7 арифметика разворачивается в другую сторону.

Подписаться на канал