Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Петиция сообщества: зачем Qwen модель 100B MoE и как она изменит инференс на Apache Spark

Сообщество требует от Qwen модель на 100B параметров с архитектурой Mixture of Experts для Apache Spark. Разбираем техническую реализуемость, сравниваем с Mixtr

Коротко

Что будет в материале

  1. 01

    Почему сообщество требует Qwen 100B MoE: истоки петиции

  2. 02

    Архитектура MoE: почему 100 миллиардов параметров - это не просто цифра

  3. 03

    Инференс на Apache Spark: технические ограничения и возможности

  4. 04

    Мотивация Qwen: почему релиз 100B MoE в 2026 году - это разумно

Почему сообщество требует Qwen 100B MoE: истоки петиции

Запрос на модель Qwen с архитектурой Mixture of Experts на 100 миллиардов параметров, заточенную под Apache Spark, оформился в сообществе не как формальная петиция, а как устойчивый консенсус в технических обсуждениях. Дискуссии на Reddit, в ветках r/LocalLLaMA и r/MachineLearning, сходятся в трёх точках. Первая: стоимость GPU-инференса для батчевой обработки данных продолжает расти, и бизнесу нужны альтернативы на CPU-кластерах. Вторая: Apache Spark остаётся стандартом де-факто для ETL и аналитики в корпоративных средах, но его возможности для инференса больших языковых моделей пока не реализованы. Третья: Qwen уже показала компетенции в MoE - модель Qwen 1.5 MoE-A2.7B продемонстрировала, что команда умеет обучать разреженные архитектуры, но для промышленных нагрузок требуется масштабирование на два порядка.

Пользователи формулируют конкретные требования: модель должна иметь около 100B общих параметров при 10-15B активных, поддерживать квантование до 4 бит без катастрофической потери качества и поставляться с нативными адаптерами для Spark MLlib. Отдельно подчёркивается необходимость лицензии, разрешающей коммерческое использование, - это ключевой барьер для внедрения в enterprise-сегменте. Обсуждения также затрагивают тему, поднятую в нашем разборе кадровых перестановок в команде Qwen: после реорганизации вектор разработки сместился в сторону мультимодальности, и часть сообщества опасается, что направление чистых языковых моделей для инференса может получить меньший приоритет.

Архитектура MoE: почему 100 миллиардов параметров - это не просто цифра

Архитектура Mixture of Experts решает фундаментальное противоречие между размером модели и стоимостью инференса. В dense-модели каждый токен проходит через все параметры, что даёт линейную зависимость вычислительной нагрузки от размера. MoE заменяет часть dense-слоёв на набор экспертов - независимых feed-forward сетей, из которых для каждого токена активируется лишь подмножество. Модель на 100B параметров с 8 экспертами и top-2 маршрутизацией активирует порядка 25B параметров на токен. Это сопоставимо с dense-моделью на 25B, но качество ответов приближается к dense-модели на 70-80B.

Ключевой механизм - маршрутизатор, который обучается направлять токены к релевантным экспертам. На практике это создаёт специализацию: один эксперт обрабатывает фактологические запросы, другой - математические рассуждения, третий - генерацию кода. Распределение нагрузки неравномерное, что подтверждается степенным законом использования экспертов, выявленным в нашем анализе предсказания загрузки для CPU/GPU оффлоуда. Это открывает возможности для оптимизации: часто используемых экспертов можно кэшировать в быстрой памяти, а редкие - подгружать по требованию.

Сравнение MoE и dense-архитектур: цифры и метрики

Прямое сравнение архитектур на примере актуальных моделей показывает разницу в эффективности. Данные приведены для инференса одного токена в bf16 без квантования.

Модель Архитектура Общие параметры Активные параметры FLOPs на токен Память (ГБ)
Llama 3 70B Dense 70B 70B ~140T ~140
Mixtral 8x7B MoE 46.7B 12.9B ~25.8T ~93
DeepSeek-V2 MoE 236B 21B ~42T ~472
Qwen 100B MoE (гипотетически) MoE 100B ~15B ~30T ~200

Гипотетическая Qwen 100B MoE с 15B активных параметров потребовала бы около 200 ГБ памяти в bf16 - это четыре сервера с 64 ГБ RAM каждый, вполне реалистичная конфигурация для Spark-кластера. FLOPs на токен при этом в 4.5 раза ниже, чем у Llama 3 70B, что напрямую транслируется в скорость генерации на CPU. Практический тест Qwen3.5 122B на 64 ГБ RAM с квантованием показал, что даже при падении скорости до 2.9 токенов/с качество ответов остаётся высоким за счёт большого числа активных параметров. Модель на 100B с 15B активными и 4-битным квантованием могла бы уложиться в 50-60 ГБ и выдавать 8-12 токенов/с на современном серверном CPU.

Инференс на Apache Spark: технические ограничения и возможности

Apache Spark проектировался для пакетной обработки данных, а не для низколатентного инференса нейросетей. Главные ограничения: overhead на сериализацию данных между JVM и Python-воркерами, высокая latency сетевых обменов в распределённом режиме и отсутствие нативной поддержки потоковой загрузки весов модели. Однако версия Spark 3.4+ с улучшенными pandas UDF на базе Apache Arrow снизила накладные расходы на передачу данных до 30-40% по сравнению с классическими UDF. TorchDistributor, появившийся в Spark 3.4, позволяет запускать распределённые PyTorch-задачи напрямую на воркерах, что открывает путь к шардированию модели.

Для 100B MoE на Spark реалистичен сценарий с распределением экспертов по воркерам: каждый эксперт загружается в память одного или нескольких узлов, маршрутизатор работает на драйвере, а токены направляются к нужным экспертам через сеть. Узкое место - сетевая задержка при передаче промежуточных представлений между воркерами. Здесь применим подход с предсказанием экспертов, описанный в нашем материале про ускорение CPU/GPU оффлоуда: MTP-головка модели предсказывает следующие токены, что позволяет определить, какие эксперты потребуются, и начать их загрузку до того, как они понадобятся. Точность предсказания в 78% для top-8 экспертов даёт двукратный прирост пропускной способности.

Практический пример: гипотетический пайплайн инференса Qwen 100B MoE на Spark

Ниже - схема пайплайна, который мог бы работать на Spark-кластере из 8 узлов с 64 ГБ RAM каждый. Модель заквантована до 4 бит, занимает ~55 ГБ и распределена поэкспертно.

# Шаг 1: Инициализация Spark с TorchDistributor
from pyspark.sql import SparkSession
from spark_torch_distributor import TorchDistributor

spark = SparkSession.builder \
    .appName("Qwen100B_MoE_Inference") \
    .config("spark.sql.execution.arrow.pyspark.enabled", "true") \
    .getOrCreate()

# Шаг 2: Загрузка шардированной модели на воркеры
# Каждый воркер получает подмножество экспертов
def load_experts(worker_rank, num_workers):
    model = Qwen100B_MoE.from_pretrained(
        "qwen/Qwen-100B-MoE",
        quantization="gptq_4bit",
        expert_shard=f"{worker_rank}/{num_workers}"
    )
    return model

distributed_model = TorchDistributor(
    num_processes=8,
    local_mode=False,
    use_gpu=False
).run(load_experts)

# Шаг 3: Батчевый инференс через pandas UDF
from pyspark.sql.functions import pandas_udf
import pandas as pd

@pandas_udf("string")
def batch_inference(texts: pd.Series) -> pd.Series:
    results = []
    for text in texts:
        tokens = tokenizer.encode(text)
        # Маршрутизация токенов к экспертам
        expert_ids = router.predict(tokens)
        # Предзагрузка экспертов (асинхронно)
        prefetch_experts(expert_ids)
        # Генерация с распределённым выполнением
        output = distributed_model.generate(
            tokens,
            max_new_tokens=256,
            expert_routing=expert_ids
        )
        results.append(tokenizer.decode(output))
    return pd.Series(results)

# Шаг 4: Запуск на датафрейме
df = spark.read.parquet("s3://data/input_texts.parquet")
result_df = df.withColumn("generated", batch_inference(df["text"]))
result_df.write.parquet("s3://data/output_generated.parquet")

Оценка пропускной способности: при батче из 1000 текстов средней длиной 512 токенов и генерации 256 токенов на каждый, с учётом сетевых задержек и сериализации, пайплайн может обрабатывать 5-8 текстов в секунду на 8-узловом кластере. Это 400-700 тысяч токенов генерации в минуту. Для сравнения: один GPU A100 с аналогичной задачей даёт 15-20 текстов в секунду, но стоит в 8-10 раз дороже в аренде. Ключевой вывод: Spark-инференс выигрывает не по скорости, а по стоимости и возможности обрабатывать данные там же, где они хранятся, без ETL в GPU-окружение.

Мотивация Qwen: почему релиз 100B MoE в 2026 году - это разумно

Команда Qwen, развивающаяся под крылом Alibaba Cloud, имеет три стратегических стимула выпустить 100B MoE модель. Стимул первый - конкуренция с Mixtral и DeepSeek. Mixtral 8x7B занял нишу «эффективного MoE для слабого железа» и стал стандартом для локального инференса. DeepSeek-V2 с 236B параметров показал, что MoE масштабируется до сотен миллиардов параметров и может конкурировать с GPT-4. Qwen с моделью на 100B может занять промежуточную позицию: тяжелее Mixtral, легче DeepSeek, с фокусом на корпоративный инференс.

Стимул второй - рост рынка on-premise инференса. Ужесточение регуляций по обработке персональных данных в ЕС, Китае и США заставляет компании возвращать AI-нагрузки с облачных API на собственные серверы. Apache Spark - стандартный инструмент в таких средах, и модель с нативной интеграцией получает преимущество перед конкурентами, требующими отдельных GPU-узлов. Стимул третий - экосистема Alibaba Cloud. Собственная модель, оптимизированная под Spark, становится точкой входа в облачные сервисы Alibaba: клиент начинает с бесплатной модели на своём кластере, а масштабируется через платные инференс-API на базе той же архитектуры.

Анализ дорожной карты Qwen, насколько она прослеживается по публичным релизам, показывает ускорение цикла разработки: между Qwen 1.5 и Qwen 2.0 прошло 6 месяцев, между Qwen 2.0 и Qwen 2.5 - 4 месяца. При сохранении темпа анонс 100B MoE в первой половине 2026 года технически реалистичен. Сдерживающий фактор - перераспределение ресурсов после кадровых изменений, которые мы разбирали ранее. Если мультимодальное направление продолжит доминировать, языковая MoE-модель может быть отложена до конца 2026 года.

Альтернативы и конкуренты: Qwen 100B MoE в сравнении с Mixtral и DeepSeek

Рынок MoE-моделей для инференса на CPU-кластерах пока не насыщен, и у Qwen есть окно возможностей. Прямое сравнение характеристик помогает оценить, насколько гипотетическая модель вписалась бы в текущий ландшафт.

Характеристика Mixtral 8x7B DeepSeek-V2 Qwen 100B MoE (прогноз)
Общие параметры 46.7B 236B 100B
Активные параметры 12.9B 21B ~15B
Контекстное окно 32K 128K 128K (ожидается)
Поддержка Spark Через сторонние адаптеры Через vLLM/SGLang Нативная (ключевое преимущество)
Лицензия Apache 2.0 DeepSeek License Apache 2.0 (ожидается)
Квантование GPTQ, AWQ, GGUF FP8 нативно GPTQ 4-bit, GGUF
Память в 4-bit (ГБ) ~26 ~130 ~55

Ключевое преимущество Qwen - потенциальная нативная интеграция со Spark. Mixtral требует написания кастомных обвязок для распределённого инференса, DeepSeek-V2 слишком тяжела для CPU-кластеров среднего размера. Qwen 100B MoE с 55 ГБ в 4-битном квантовании помещается на два узла с 32 ГБ RAM каждый - это минимальный порог для Spark-кластера, который есть даже у небольших компаний. Лицензия Apache 2.0, если команда её сохранит, снимет юридические барьеры для коммерческого использования, которые есть у DeepSeek.

Прогноз: когда ждать Qwen 100B MoE и как подготовиться уже сейчас

Точная дата релиза неизвестна, но анализ публичной активности команды Qwen и типичных циклов разработки позволяет сделать обоснованное предположение. Релиз Qwen 2.5 состоялся в марте 2025 года, Qwen 3.0 - в сентябре 2025. Если команда сохранит полугодовой цикл, следующее крупное обновление придётся на март-апрель 2026 года. Вероятность, что в него войдёт 100B MoE модель, оценивается как умеренная: команда последовательно наращивает размер моделей и экспериментирует с MoE, но параллельно развивает мультимодальное направление, которое конкурирует за вычислительные ресурсы.

Три шага для подготовки к возможному релизу. Первый: разверните тестовый Spark-кластер на версии 3.5 с поддержкой TorchDistributor и протестируйте инференс небольших MoE-моделей, например Qwen 1.5 MoE-A2.7B. Это даст понимание узких мест вашей инфраструктуры: сетевая задержка, скорость сериализации, доступный объём памяти на воркер. Второй: изучите квантование GPTQ и GGUF для MoE-архитектур. Модели с разреженной активацией чувствительны к способу квантования маршрутизатора, и неправильный выбор может обрушить качество. Третий: отслеживайте репозиторий Qwen на GitHub и модельные карточки на Hugging Face - команда часто публикует препринты и чекпоинты за 2-3 недели до официального анонса.

Если 100B MoE не выйдет в 2026 году, альтернативой остаётся связка из существующих моделей и адаптеров. Mixtral 8x7B с кастомными Spark UDF уже используется в production-сценариях, хотя и требует ручной оптимизации под каждый кластер. DeepSeek-V2 в квантованном виде может работать на Spark-кластерах с 256+ ГБ суммарной памяти, но стоимость такой инфраструктуры приближается к бюджету на GPU-узел. В любом случае, тренд на CPU-инференс больших моделей усиливается, и инвестиции в Spark-пайплайны окупятся независимо от того, кто именно выпустит следующую MoE-модель.

Подписаться на канал