Перейти к содержанию
Публикация AiManual

Партнёрство Hugging Face и AMD: ускорение трансформеров на CPU и GPU

Hugging Face включил AMD в Hardware Partner Program. Узнайте, как интеграция ROCm и Optimum ускоряет обучение BERT и GPT на Instinct MI250, Radeon и Ryzen, и ка

Коротко

Что будет в материале

  1. 01

    Что означает партнёрство Hugging Face и AMD?

  2. 02

    Какие аппаратные платформы AMD поддерживаются?

  3. 03

    Результаты тестов: ускорение обучения BERT и GPT

  4. 04

    Техническая интеграция: ROCm SDK и Optimum

Hugging Face официально включил AMD в программу Hardware Partner Program. Это означает приоритетную совместную работу над оптимизацией библиотек transformers и Optimum под GPU Instinct, Radeon и CPU Ryzen, EPYC. Первые тесты уже дают ускорение обучения BERT-Large в 1.2 раза и GPT2-Large в 1.4 раза на MI250 по сравнению с конкурентами.

Для ML-инженеров это прямое расширение выбора железа. Можно сохранить привычный рабочий процесс с Hugging Face, но запускать обучение и инференс на платформах AMD без хаков и самодельных обёрток. Интеграция ROCm SDK в transformers и появление специализированного Optimum-расширения снимают главный барьер: сложность настройки софта под GPU AMD.

В этой статье разберём, какие именно аппаратные платформы поддерживаются, какие цифры производительности уже подтверждены и как начать использовать связку Hugging Face + AMD в своих проектах.

Что означает партнёрство Hugging Face и AMD?

Партнёрство закрепляет AMD как одного из ключевых аппаратных партнёров Hugging Face. Цель конкретная: сделать так, чтобы модели из хаба Hugging Face работали на GPU и CPU AMD с той же простотой, что и на других платформах. Для этого инженеры обеих компаний совместно дорабатывают библиотеки transformers, Optimum и связанные инструменты.

Для экосистемы это сигнал о зрелости ROCm как программной платформы. Если раньше поддержка AMD в open-source ML-стеке часто отставала, то теперь она становится частью официальной дорожной карты Hugging Face. Это снижает риски для команд, которые рассматривают AMD как альтернативу NVIDIA.

Hardware Partner Program: что это и зачем?

Hardware Partner Program Hugging Face объединяет производителей железа, которые хотят обеспечить нативную поддержку своих ускорителей в экосистеме Hugging Face. Участие в программе означает совместную разработку, тестирование и документирование оптимизаций под конкретные архитектуры.

Для AMD вступление в программу даёт прямой канал влияния на то, как open-source модели запускаются на её устройствах. Для разработчиков это означает меньше ручной настройки и больше готовых решений. Похожий подход Hugging Face уже использует с AWS: модели оптимизируются под Trainium и Inferentia через SageMaker. Теперь аналогичная работа начинается с AMD.

Какие аппаратные платформы AMD поддерживаются?

Поддержка охватывает три сегмента: серверные GPU, потребительские видеокарты и CPU. Это покрывает сценарии от обучения больших моделей в дата-центрах до инференса на локальных машинах и edge-устройствах.

Серверные GPU: Instinct MI2xx и MI3xx

Instinct MI2xx и MI3xx - это high-end ускорители AMD для дата-центров. MI250 уже используется в суперкомпьютерах и крупных AI-кластерах. Именно на нём получены первые подтверждённые результаты ускорения обучения. MI3xx, включая MI300X, нацелен на задачи масштабного инференса и обучения больших языковых моделей.

Поддержка этих GPU в transformers означает, что команды могут переносить свои пайплайны на AMD без переписывания кода. Это особенно важно для компаний, которые уже используют AMD в HPC-инфраструктуре и хотят запускать ML-нагрузки на том же железе.

Потребительские GPU: Radeon Navi3x

Radeon Navi3x - это серия видеокарт на архитектуре RDNA 3, включая RX 7000. Поддержка этого сегмента открывает путь для индивидуальных разработчиков, исследователей и небольших команд, которым нужна локальная мощность для экспериментов с моделями.

Раньше запуск transformers на Radeon требовал ручной настройки ROCm и часто упирался в несовместимость версий. Официальная интеграция должна устранить эти проблемы. Для владельцев Radeon это возможность использовать свои GPU для ML-задач, а не только для игр.

CPU: Ryzen и EPYC

Оптимизация инференса на CPU Ryzen и EPYC расширяет сценарии, где GPU недоступен или не нужен. EPYC с большим числом ядер и высокой пропускной способностью памяти подходит для серверного инференса небольших моделей. Ryzen даёт возможность запускать модели на рабочих станциях и в edge-сценариях.

Для бизнеса это означает снижение требований к инфраструктуре: часть задач можно решать на CPU, не закупая дорогие ускорители. Практический пример - инференс небольших NLP-моделей для классификации текстов или извлечения сущностей.

Результаты тестов: ускорение обучения BERT и GPT

Цифры пока предварительные, но они дают ориентир. На MI250 обучение BERT-Large проходит в 1.2 раза быстрее, чем на сравнимых GPU конкурентов. GPT2-Large обучается в 1.4 раза быстрее. Это сокращает время экспериментов и затраты на вычислительные ресурсы.

BERT-Large: ускорение в 1.2 раза

BERT-Large - стандартный бенчмарк для NLP-задач: классификация, NER, вопросно-ответные системы. Ускорение в 1.2 раза означает, что эксперимент, который занимал 10 часов, теперь завершится примерно за 8 часов 20 минут. На дистанции из десятков запусков это заметная экономия.

Для команд, которые дообучают BERT под свои домены, такой прирост напрямую влияет на скорость итераций. Меньше времени на ожидание - больше гипотез можно проверить за тот же период.

GPT2-Large: ускорение в 1.4 раза

GPT2-Large показывает более высокое ускорение - 1.4 раза. Для генеративных моделей это существенно, поскольку обучение таких архитектур обычно требует больше вычислительных ресурсов. Эксперимент на 14 часов сокращается до 10 часов.

Важно: это первые тесты. По мере доработки ROCm и Optimum-расширения результаты могут улучшиться. Но даже текущие цифры достаточны, чтобы рассматривать AMD как рабочую альтернативу для обучения трансформеров.

Техническая интеграция: ROCm SDK и Optimum

Практическая реализация партнёрства строится на двух компонентах: интеграции ROCm SDK в transformers и разработке Optimum-расширения для AMD. Вместе они обеспечивают запуск моделей на GPU AMD с минимальными изменениями кода.

Интеграция ROCm SDK в transformers

ROCm - открытая программная платформа AMD для GPU-вычислений, аналог CUDA. Интеграция ROCm SDK в transformers означает, что библиотека будет нативно распознавать GPU AMD и использовать их возможности без дополнительных прослоек.

Для разработчика это выглядит так: тот же код, который работает на CUDA, запускается на ROCm после указания соответствующего устройства. Никаких хаков с переменными окружения и патчами. Подробнее о том, как ROCm уже ускоряет инференс в llama.cpp, мы разбирали в статье про оптимизацию prompt processing под ROCm.

Optimum-расширение для AMD

Optimum - библиотека Hugging Face для оптимизации моделей под конкретное железо. Расширение для AMD предоставит готовые конфигурации, инструменты квантизации и профилирования, адаптированные под GPU Instinct, Radeon и CPU Ryzen, EPYC.

Это снижает порог входа: не нужно вручную подбирать параметры запуска. Optimum сделает это за вас, опираясь на характеристики конкретного устройства. Для продакшена это означает более предсказуемую производительность и меньше времени на настройку.

Что это значит для разработчиков?

Главный вывод: выбор аппаратной платформы для ML-задач расширяется. Если раньше GPU AMD воспринимались как нишевое решение с рисками совместимости, то теперь они становятся полноценной частью экосистемы Hugging Face.

Преимущества для ML-инженеров

Первое - сохранение привычного workflow. Код на transformers не нужно переписывать под AMD. Второе - потенциальное снижение стоимости владения. Конкуренция с NVIDIA давит на цены, и AMD часто предлагает более выгодное соотношение цены и производительности. Третье - доступ к серверным GPU Instinct для команд, которые уже используют AMD в HPC.

Для тех, кто выбирает платформу под продакшен, полезно сравнить AMD с решениями NVIDIA. Мы разбирали технологии ускорения инференса на AMD в статье про партнёрство AMD и FastFlowLM, где приведены бенчмарки и расчёты TCO.

Ограничения и предостережения

Данные об ускорении основаны на первых тестах и могут варьироваться в зависимости от конфигурации, версий библиотек и размеров батчей. Полная поддержка всех функций transformers на ROCm потребует времени: часть операций может работать медленнее или требовать обходных путей.

Некоторым пользователям придётся адаптировать существующий код, особенно если он завязан на CUDA-специфичные вызовы. Перед миграцией стоит проверить, какие операции вашего пайплайна уже оптимизированы под ROCm. Для инференса в браузере и на локальных машинах есть альтернативные подходы, например запуск LFM 2.5 через WebGPU, который мы разбирали отдельно.

Перспективы партнёрства

Партнёрство Hugging Face и AMD закладывает основу для более глубокой интеграции в будущем. Можно ожидать появления совместных бенчмарков, расширенной документации и оптимизаций под новые поколения GPU AMD. По мере развития ROCm и Optimum-расширения разрыв в производительности с конкурентами будет сокращаться.

Для рынка это усиление позиций AMD в AI-инфраструктуре. Microsoft уже анонсировала серии Azure VM на базе AMD для AI-пайплайнов, включая ND MI455X v7 на Instinct. Совместная работа с Hugging Face дополняет эту картину: софт и железо развиваются синхронно, что снижает риски для компаний, выбирающих AMD.

Если вы рассматриваете AMD для своих ML-задач, начните с малого: возьмите модель из хаба Hugging Face и запустите её на доступном GPU Radeon или серверном Instinct через предварительные версии интеграций. Практический опыт покажет, насколько текущие оптимизации подходят под ваши сценарии.

Подписаться на канал