Почему сообщество требует Qwen 100B MoE: истоки петиции
Запрос на модель Qwen с архитектурой Mixture of Experts на 100 миллиардов параметров, заточенную под Apache Spark, оформился в сообществе не как формальная петиция, а как устойчивый консенсус в технических обсуждениях. Дискуссии на Reddit, в ветках r/LocalLLaMA и r/MachineLearning, сходятся в трёх точках. Первая: стоимость GPU-инференса для батчевой обработки данных продолжает расти, и бизнесу нужны альтернативы на CPU-кластерах. Вторая: Apache Spark остаётся стандартом де-факто для ETL и аналитики в корпоративных средах, но его возможности для инференса больших языковых моделей пока не реализованы. Третья: Qwen уже показала компетенции в MoE - модель Qwen 1.5 MoE-A2.7B продемонстрировала, что команда умеет обучать разреженные архитектуры, но для промышленных нагрузок требуется масштабирование на два порядка.
Пользователи формулируют конкретные требования: модель должна иметь около 100B общих параметров при 10-15B активных, поддерживать квантование до 4 бит без катастрофической потери качества и поставляться с нативными адаптерами для Spark MLlib. Отдельно подчёркивается необходимость лицензии, разрешающей коммерческое использование, - это ключевой барьер для внедрения в enterprise-сегменте. Обсуждения также затрагивают тему, поднятую в нашем разборе кадровых перестановок в команде Qwen: после реорганизации вектор разработки сместился в сторону мультимодальности, и часть сообщества опасается, что направление чистых языковых моделей для инференса может получить меньший приоритет.
Архитектура MoE: почему 100 миллиардов параметров - это не просто цифра
Архитектура Mixture of Experts решает фундаментальное противоречие между размером модели и стоимостью инференса. В dense-модели каждый токен проходит через все параметры, что даёт линейную зависимость вычислительной нагрузки от размера. MoE заменяет часть dense-слоёв на набор экспертов - независимых feed-forward сетей, из которых для каждого токена активируется лишь подмножество. Модель на 100B параметров с 8 экспертами и top-2 маршрутизацией активирует порядка 25B параметров на токен. Это сопоставимо с dense-моделью на 25B, но качество ответов приближается к dense-модели на 70-80B.
Ключевой механизм - маршрутизатор, который обучается направлять токены к релевантным экспертам. На практике это создаёт специализацию: один эксперт обрабатывает фактологические запросы, другой - математические рассуждения, третий - генерацию кода. Распределение нагрузки неравномерное, что подтверждается степенным законом использования экспертов, выявленным в нашем анализе предсказания загрузки для CPU/GPU оффлоуда. Это открывает возможности для оптимизации: часто используемых экспертов можно кэшировать в быстрой памяти, а редкие - подгружать по требованию.
Сравнение MoE и dense-архитектур: цифры и метрики
Прямое сравнение архитектур на примере актуальных моделей показывает разницу в эффективности. Данные приведены для инференса одного токена в bf16 без квантования.
| Модель | Архитектура | Общие параметры | Активные параметры | FLOPs на токен | Память (ГБ) |
|---|---|---|---|---|---|
| Llama 3 70B | Dense | 70B | 70B | ~140T | ~140 |
| Mixtral 8x7B | MoE | 46.7B | 12.9B | ~25.8T | ~93 |
| DeepSeek-V2 | MoE | 236B | 21B | ~42T | ~472 |
| Qwen 100B MoE (гипотетически) | MoE | 100B | ~15B | ~30T | ~200 |
Гипотетическая Qwen 100B MoE с 15B активных параметров потребовала бы около 200 ГБ памяти в bf16 - это четыре сервера с 64 ГБ RAM каждый, вполне реалистичная конфигурация для Spark-кластера. FLOPs на токен при этом в 4.5 раза ниже, чем у Llama 3 70B, что напрямую транслируется в скорость генерации на CPU. Практический тест Qwen3.5 122B на 64 ГБ RAM с квантованием показал, что даже при падении скорости до 2.9 токенов/с качество ответов остаётся высоким за счёт большого числа активных параметров. Модель на 100B с 15B активными и 4-битным квантованием могла бы уложиться в 50-60 ГБ и выдавать 8-12 токенов/с на современном серверном CPU.
Инференс на Apache Spark: технические ограничения и возможности
Apache Spark проектировался для пакетной обработки данных, а не для низколатентного инференса нейросетей. Главные ограничения: overhead на сериализацию данных между JVM и Python-воркерами, высокая latency сетевых обменов в распределённом режиме и отсутствие нативной поддержки потоковой загрузки весов модели. Однако версия Spark 3.4+ с улучшенными pandas UDF на базе Apache Arrow снизила накладные расходы на передачу данных до 30-40% по сравнению с классическими UDF. TorchDistributor, появившийся в Spark 3.4, позволяет запускать распределённые PyTorch-задачи напрямую на воркерах, что открывает путь к шардированию модели.
Для 100B MoE на Spark реалистичен сценарий с распределением экспертов по воркерам: каждый эксперт загружается в память одного или нескольких узлов, маршрутизатор работает на драйвере, а токены направляются к нужным экспертам через сеть. Узкое место - сетевая задержка при передаче промежуточных представлений между воркерами. Здесь применим подход с предсказанием экспертов, описанный в нашем материале про ускорение CPU/GPU оффлоуда: MTP-головка модели предсказывает следующие токены, что позволяет определить, какие эксперты потребуются, и начать их загрузку до того, как они понадобятся. Точность предсказания в 78% для top-8 экспертов даёт двукратный прирост пропускной способности.
Практический пример: гипотетический пайплайн инференса Qwen 100B MoE на Spark
Ниже - схема пайплайна, который мог бы работать на Spark-кластере из 8 узлов с 64 ГБ RAM каждый. Модель заквантована до 4 бит, занимает ~55 ГБ и распределена поэкспертно.
# Шаг 1: Инициализация Spark с TorchDistributor
from pyspark.sql import SparkSession
from spark_torch_distributor import TorchDistributor
spark = SparkSession.builder \
.appName("Qwen100B_MoE_Inference") \
.config("spark.sql.execution.arrow.pyspark.enabled", "true") \
.getOrCreate()
# Шаг 2: Загрузка шардированной модели на воркеры
# Каждый воркер получает подмножество экспертов
def load_experts(worker_rank, num_workers):
model = Qwen100B_MoE.from_pretrained(
"qwen/Qwen-100B-MoE",
quantization="gptq_4bit",
expert_shard=f"{worker_rank}/{num_workers}"
)
return model
distributed_model = TorchDistributor(
num_processes=8,
local_mode=False,
use_gpu=False
).run(load_experts)
# Шаг 3: Батчевый инференс через pandas UDF
from pyspark.sql.functions import pandas_udf
import pandas as pd
@pandas_udf("string")
def batch_inference(texts: pd.Series) -> pd.Series:
results = []
for text in texts:
tokens = tokenizer.encode(text)
# Маршрутизация токенов к экспертам
expert_ids = router.predict(tokens)
# Предзагрузка экспертов (асинхронно)
prefetch_experts(expert_ids)
# Генерация с распределённым выполнением
output = distributed_model.generate(
tokens,
max_new_tokens=256,
expert_routing=expert_ids
)
results.append(tokenizer.decode(output))
return pd.Series(results)
# Шаг 4: Запуск на датафрейме
df = spark.read.parquet("s3://data/input_texts.parquet")
result_df = df.withColumn("generated", batch_inference(df["text"]))
result_df.write.parquet("s3://data/output_generated.parquet")
Оценка пропускной способности: при батче из 1000 текстов средней длиной 512 токенов и генерации 256 токенов на каждый, с учётом сетевых задержек и сериализации, пайплайн может обрабатывать 5-8 текстов в секунду на 8-узловом кластере. Это 400-700 тысяч токенов генерации в минуту. Для сравнения: один GPU A100 с аналогичной задачей даёт 15-20 текстов в секунду, но стоит в 8-10 раз дороже в аренде. Ключевой вывод: Spark-инференс выигрывает не по скорости, а по стоимости и возможности обрабатывать данные там же, где они хранятся, без ETL в GPU-окружение.
Мотивация Qwen: почему релиз 100B MoE в 2026 году - это разумно
Команда Qwen, развивающаяся под крылом Alibaba Cloud, имеет три стратегических стимула выпустить 100B MoE модель. Стимул первый - конкуренция с Mixtral и DeepSeek. Mixtral 8x7B занял нишу «эффективного MoE для слабого железа» и стал стандартом для локального инференса. DeepSeek-V2 с 236B параметров показал, что MoE масштабируется до сотен миллиардов параметров и может конкурировать с GPT-4. Qwen с моделью на 100B может занять промежуточную позицию: тяжелее Mixtral, легче DeepSeek, с фокусом на корпоративный инференс.
Стимул второй - рост рынка on-premise инференса. Ужесточение регуляций по обработке персональных данных в ЕС, Китае и США заставляет компании возвращать AI-нагрузки с облачных API на собственные серверы. Apache Spark - стандартный инструмент в таких средах, и модель с нативной интеграцией получает преимущество перед конкурентами, требующими отдельных GPU-узлов. Стимул третий - экосистема Alibaba Cloud. Собственная модель, оптимизированная под Spark, становится точкой входа в облачные сервисы Alibaba: клиент начинает с бесплатной модели на своём кластере, а масштабируется через платные инференс-API на базе той же архитектуры.
Анализ дорожной карты Qwen, насколько она прослеживается по публичным релизам, показывает ускорение цикла разработки: между Qwen 1.5 и Qwen 2.0 прошло 6 месяцев, между Qwen 2.0 и Qwen 2.5 - 4 месяца. При сохранении темпа анонс 100B MoE в первой половине 2026 года технически реалистичен. Сдерживающий фактор - перераспределение ресурсов после кадровых изменений, которые мы разбирали ранее. Если мультимодальное направление продолжит доминировать, языковая MoE-модель может быть отложена до конца 2026 года.
Альтернативы и конкуренты: Qwen 100B MoE в сравнении с Mixtral и DeepSeek
Рынок MoE-моделей для инференса на CPU-кластерах пока не насыщен, и у Qwen есть окно возможностей. Прямое сравнение характеристик помогает оценить, насколько гипотетическая модель вписалась бы в текущий ландшафт.
| Характеристика | Mixtral 8x7B | DeepSeek-V2 | Qwen 100B MoE (прогноз) |
|---|---|---|---|
| Общие параметры | 46.7B | 236B | 100B |
| Активные параметры | 12.9B | 21B | ~15B |
| Контекстное окно | 32K | 128K | 128K (ожидается) |
| Поддержка Spark | Через сторонние адаптеры | Через vLLM/SGLang | Нативная (ключевое преимущество) |
| Лицензия | Apache 2.0 | DeepSeek License | Apache 2.0 (ожидается) |
| Квантование | GPTQ, AWQ, GGUF | FP8 нативно | GPTQ 4-bit, GGUF |
| Память в 4-bit (ГБ) | ~26 | ~130 | ~55 |
Ключевое преимущество Qwen - потенциальная нативная интеграция со Spark. Mixtral требует написания кастомных обвязок для распределённого инференса, DeepSeek-V2 слишком тяжела для CPU-кластеров среднего размера. Qwen 100B MoE с 55 ГБ в 4-битном квантовании помещается на два узла с 32 ГБ RAM каждый - это минимальный порог для Spark-кластера, который есть даже у небольших компаний. Лицензия Apache 2.0, если команда её сохранит, снимет юридические барьеры для коммерческого использования, которые есть у DeepSeek.
Прогноз: когда ждать Qwen 100B MoE и как подготовиться уже сейчас
Точная дата релиза неизвестна, но анализ публичной активности команды Qwen и типичных циклов разработки позволяет сделать обоснованное предположение. Релиз Qwen 2.5 состоялся в марте 2025 года, Qwen 3.0 - в сентябре 2025. Если команда сохранит полугодовой цикл, следующее крупное обновление придётся на март-апрель 2026 года. Вероятность, что в него войдёт 100B MoE модель, оценивается как умеренная: команда последовательно наращивает размер моделей и экспериментирует с MoE, но параллельно развивает мультимодальное направление, которое конкурирует за вычислительные ресурсы.
Три шага для подготовки к возможному релизу. Первый: разверните тестовый Spark-кластер на версии 3.5 с поддержкой TorchDistributor и протестируйте инференс небольших MoE-моделей, например Qwen 1.5 MoE-A2.7B. Это даст понимание узких мест вашей инфраструктуры: сетевая задержка, скорость сериализации, доступный объём памяти на воркер. Второй: изучите квантование GPTQ и GGUF для MoE-архитектур. Модели с разреженной активацией чувствительны к способу квантования маршрутизатора, и неправильный выбор может обрушить качество. Третий: отслеживайте репозиторий Qwen на GitHub и модельные карточки на Hugging Face - команда часто публикует препринты и чекпоинты за 2-3 недели до официального анонса.
Если 100B MoE не выйдет в 2026 году, альтернативой остаётся связка из существующих моделей и адаптеров. Mixtral 8x7B с кастомными Spark UDF уже используется в production-сценариях, хотя и требует ручной оптимизации под каждый кластер. DeepSeek-V2 в квантованном виде может работать на Spark-кластерах с 256+ ГБ суммарной памяти, но стоимость такой инфраструктуры приближается к бюджету на GPU-узел. В любом случае, тренд на CPU-инференс больших моделей усиливается, и инвестиции в Spark-пайплайны окупятся независимо от того, кто именно выпустит следующую MoE-модель.