Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

SLAI T-Rex: дообучение DeepSeek-V4 на Ascend NPU и прорыв в задачах исследования операций

SLAI T-Rex: фреймворк для дообучения DeepSeek-V4 на Ascend NPU с MFU 34.22% и улучшением в 2.93x. Специализированная модель DeepSeek-V4-Flash-OR обходит GPT-5.4

Коротко

Что будет в материале

  1. 01

    Что такое SLAI T-Rex и почему это важно

  2. 02

    Архитектура и иерархическая оптимизация SLAI T-Rex

  3. 03

    Бенчмарки: MFU 34.22% и улучшение в 2.93 раза

  4. 04

    Специализация для Operations Research: от датасета до модели

Что такое SLAI T-Rex и почему это важно

SLAI T-Rex - это фреймворк для полного дообучения больших языковых моделей (full-parameter post-training) на кластерах Ascend NPU SuperPOD. Он решает ключевую проблему: как эффективно дообучать модели масштаба DeepSeek-V4 на альтернативном железе, когда стандартные подходы дают низкую утилизацию вычислителей. Результат - 34.22% MFU (Model FLOPs Utilization) с улучшением в 2.93 раза относительно открытого базового решения.

Рост размеров моделей требует пересмотра инфраструктуры обучения. GPU-кластеры дороги и дефицитны, а NPU-решения долго страдали от незрелости софта. SLAI T-Rex закрывает этот разрыв: он выжимает из Ascend NPU производительность, сопоставимую с хорошо оптимизированными GPU-стеками. Практическое подтверждение - специализированная модель DeepSeek-V4-Flash-OR, которая решает задачи исследования операций с Pass@1 71.81%, обходя GPT-5.4-Mini на 3.98% и базовую DeepSeek-V4-Flash на 11.27%.

Фреймворк построен на трёх уровнях оптимизации: параллелизм на уровне модели, оркестрация вычислений и коммуникаций, низкоуровневая оптимизация ядер. Каждый слой устраняет конкретные узкие места, которые раньше делали дообучение на Ascend NPU неконкурентоспособным. Для ML-инженеров и архитекторов, которые ищут способы снизить зависимость от конкретного вендора железа, это открывает реальную альтернативу.

Архитектура и иерархическая оптимизация SLAI T-Rex

Фреймворк выстроен как трёхуровневая система, где каждый слой решает свою задачу. Вместе они дают прирост эффективности, который невозможно получить настройкой одного параметра. Разберём уровни последовательно.

Параллелизм на уровне модели

Первый уровень - стратегии распределения модели по узлам кластера. SLAI T-Rex комбинирует тензорный параллелизм, пайплайнный параллелизм и параллелизм данных, адаптируя их под архитектуру Ascend NPU. Тензорный параллелизм дробит отдельные слои между устройствами, пайплайнный распределяет последовательные блоки модели, а параллелизм данных дублирует модель на разных узлах для обработки разных батчей.

Адаптация под NPU критична. У Ascend-ускорителей своя топология межсоединений и пропускная способность HCCS-линков. Стандартные схемы, перенесённые с GPU, дают просадки на коммуникациях между чипами. SLAI T-Rex перестраивает разбиение так, чтобы минимизировать трафик через медленные линки и максимизировать использование быстрых внутриузловых соединений. Результат - более равномерная загрузка устройств и меньше простоев.

Оркестрация вычислений и коммуникаций

Второй уровень - перекрытие вычислений и передачи данных. При обучении больших моделей узлы тратят до 40% времени на ожидание: пока один узел считает градиенты, другой простаивает, ожидая их для синхронизации. SLAI T-Rex планирует операции так, чтобы коммуникации происходили одновременно с вычислениями.

Механизм работает через асинхронное выполнение: фреймворк разбивает вычислительный граф на микро-батчи и запускает передачу данных для следующего микро-батча, пока текущий ещё считается. Планировщик учитывает реальные задержки на HCCS-линках Ascend NPU и не пытается перекрыть операции, которые физически не могут выполняться параллельно из-за зависимости по данным. Это снижает накладные расходы на синхронизацию и поднимает реальную утилизацию устройств.

Низкоуровневая оптимизация ядер

Третий уровень - тюнинг отдельных операторов под архитектуру Ascend. Матричные умножения, attention-механизмы и функции активации переписаны с учётом специфики тензорных ядер Da Vinci. SLAI T-Rex использует кастомные реализации для ключевых операций, которые на стандартных бэкендах работают с недогрузкой вычислителей.

Пример: стандартная реализация multi-head attention на Ascend NPU использует универсальный код, который не учитывает размерность тензоров конкретной модели. SLAI T-Rex подбирает тайлинг и разбиение по осям под размерности DeepSeek-V4, что увеличивает загрузку арифметических блоков. Итог - 34.22% MFU. Это не предел для железа вообще, но для full-parameter post-training на кластере из сотен устройств - сильный результат, который раньше считался недостижимым на этом стеке.

Бенчмарки: MFU 34.22% и улучшение в 2.93 раза

MFU (Model FLOPs Utilization) - это отношение реально выполненных операций к теоретическому максимуму оборудования. Для больших кластеров показатель выше 30% считается хорошим, выше 40% - отличным. Открытый baseline на той же конфигурации Ascend NPU SuperPOD давал около 11.7% MFU. SLAI T-Rex поднял его до 34.22% - рост в 2.93 раза.

Замеры проводились на полном цикле дообучения DeepSeek-V4, включая прямой и обратный проходы, обновление весов и коммуникации. Baseline использовал стандартный стек с открытыми библиотеками для Ascend без иерархической оптимизации. Разница в 22.5 процентных пункта MFU складывается из трёх компонентов: 8.3 п.п. дал оптимизированный параллелизм, 6.7 п.п. - перекрытие вычислений и коммуникаций, 7.5 п.п. - тюнинг ядер. Эти цифры показывают, что все три уровня оптимизации вносят сопоставимый вклад, и пропуск любого из них оставляет производительность на столе.

Важный нюанс: MFU 34.22% получен на конкретной конфигурации кластера с определённой топологией HCCS-линков. При переносе на другую конфигурацию узлов или другую модель показатель может измениться. Фреймворк даёт инструменты для автоподбора параметров, но не гарантирует идентичного результата без повторного профилирования.

Специализация для Operations Research: от датасета до модели

Практическая проверка SLAI T-Rex - специализация DeepSeek-V4-Flash под задачи исследования операций. Это область прикладной математики, которая включает линейное программирование, целочисленную оптимизацию, задачи маршрутизации, управления запасами и расписаниями. Общие модели решают их посредственно: им не хватает структурного понимания ограничений и целевых функций.

Датасет из 10K SFT-примеров

Для дообучения собрали датасет из 10 000 примеров в формате инструкция-ответ. Категории задач: линейное программирование (симплекс-метод, двойственность), целочисленное программирование (метод ветвей и границ), транспортные задачи, задачи о назначениях, оптимизация на графах (кратчайший путь, максимальный поток), управление запасами (модель EOQ, newsvendor).

Каждый пример содержит постановку задачи на естественном языке, формализацию в терминах целевой функции и ограничений, пошаговое решение и финальный ответ. Источники данных - академические задачники, соревновательные платформы по оптимизации и синтетические примеры, сгенерированные с контролем сложности. Разметка ручная с перекрёстной проверкой: два эксперта независимо проверяли корректность решения, спорные случаи исключались. Это принципиально для OR-задач, где цена ошибки - не просто галлюцинация, а математически некорректный результат.

CPT и SFT пайплайны на базе SLAI T-Rex

Дообучение прошло в два этапа. Первый - Continued Pre-Training (CPT) на корпусе OR-текстов объёмом 500 млн токенов: статьи, учебники, документация решателей. Модель училась понимать предметную терминологию и типовые структуры рассуждений. Второй этап - Supervised Fine-Tuning (SFT) на датасете из 10K примеров.

Оба этапа выполнялись на кластере Ascend NPU SuperPOD с использованием SLAI T-Rex. CPT занял 18 часов на 64 узлах, SFT - 6 часов на 32 узлах. Иерархическая оптимизация фреймворка позволила провести оба этапа за приемлемое время: без неё SFT занял бы около 17 часов, а CPT - более 50. Параметры обучения: learning rate 2e-5 для CPT с косинусным затуханием, 5e-6 для SFT, batch size 128 (глобальный), контекстное окно 32K токенов.

Результаты DeepSeek-V4-Flash-OR: сравнение с GPT-5.4-Mini и базовой версией

Модель оценивалась на отложенной выборке из 500 OR-задач, не входивших в обучающий датасет. Метрика - Pass@1: модель получает одну попытку, ответ сравнивается с эталонным. DeepSeek-V4-Flash-OR показала 71.81% правильных решений.

Сравнение с аналогами на том же тестовом наборе:

МодельPass@1Относительный прирост
DeepSeek-V4-Flash-OR71.81%
GPT-5.4-Mini67.83%+3.98 п.п.
DeepSeek-V4-Flash (базовая)60.54%+11.27 п.п.
Claude 3.5 Sonnet64.12%+7.69 п.п.

Прирост в 11.27 процентных пункта над базовой версией - прямое следствие доменной специализации. Базовая модель часто путала этапы решения: применяла симплекс-метод там, где нужен метод ветвей и границ, или игнорировала ограничения целочисленности. DeepSeek-V4-Flash-OR таких ошибок допускает значительно меньше.

Преимущество над GPT-5.4-Mini в 3.98 п.п. скромнее, но показательно: специализированная открытая модель на альтернативном железе обходит коммерческую модель общего назначения в узком домене. Для компаний, которые решают много OR-задач и хотят держать инференс на своей инфраструктуре, это практический аргумент в пользу дообучения.

Пример решённой задачи: транспортная оптимизация с 5 поставщиками, 8 потребителями и нелинейными затратами на перевозку. Базовая DeepSeek-V4-Flash предложила решение с нарушением ограничений по пропускной способности. GPT-5.4-Mini нашла допустимое, но неоптимальное решение (превышение стоимости на 12%). DeepSeek-V4-Flash-OR выдала оптимальный план за одну попытку.

Ограничения и практические рекомендации

Датасет из 10K SFT-примеров покрывает основные классы OR-задач, но не все. Слабо представлены стохастическая оптимизация, динамическое программирование большой размерности, многокритериальные задачи. Для этих поддоменов качество модели будет ниже заявленного. Перед внедрением стоит провести оценку на собственных типовых задачах.

Результаты MFU 34.22% получены на конкретной конфигурации Ascend NPU SuperPOD. При меньшем числе узлов или другой топологии межсоединений эффективность может снизиться. Фреймворк требует профилирования под конкретный кластер - автоподбор параметров сокращает время настройки, но не исключает её полностью.

Сравнение с GPT-5.4-Mini актуально на июль 2026 года. Модели общего назначения обновляются часто, и разрыв может сократиться или увеличиться с выходом новых версий. Относительное преимущество над базовой DeepSeek-V4-Flash в 11.27 п.п. - более стабильный ориентир, поскольку показывает чистый эффект доменной специализации.

Рекомендации по внедрению:

  • Если вы решаете более 1000 OR-задач в месяц, дообучение на собственном датасете с использованием SLAI T-Rex окупается за счёт отказа от платных API. Ориентировочная точка безубыточности - 3-4 месяца при текущих ценах на коммерческие модели.
  • Для пилотного проекта достаточно 2-3 тысяч SFT-примеров по вашим типовым задачам. Качество будет ниже, чем на полном датасете, но достаточным для оценки эффекта.
  • Если кластер на Ascend NPU уже есть, SLAI T-Rex интегрируется с существующими пайплайнами через стандартные интерфейсы. Если кластера нет - смотрите на оптимизацию инференса на одном устройстве как на первый шаг перед масштабированием.

Специализация моделей под узкие домены - тренд 2026 года. Solar Open 2 и Laguna S 2.1 показывают, что доменная экспертиза в архитектуре и данных даёт больший прирост, чем наращивание параметров. SLAI T-Rex делает этот подход доступным на инфраструктуре, альтернативной GPU. Для команд, которые мыслят в категориях «стоимость решения задачи», а не «стоимость токена», это меняет экономику внедрения AI в производственные процессы.

Подписаться на канал