Qwen 3.6 35B MoE заработала на Xiaomi 12 Pro с 12 ГБ ОЗУ. Генерация 2.4 токена/с, префилл 4.4 токена/с, контекст до 8192 токенов. Это не гипотетический расчёт, а зафиксированные метрики реального запуска через проект BigMoeOnEdge. Модель отвечает связно, но медленно - для чата в реальном времени скорость недостаточна, для фоновой обработки документов вполне приемлема.
Главное ограничение не в скорости, а в памяти. 12 ГБ ОЗУ хватает только на 8192 токенов контекста. Дальше начинается свопинг, который роняет производительность до непригодных значений. Разберёмся, куда уходят гигабайты, как работает BigMoeOnEdge и когда ждать запуска vision-моделей на телефонах.
Результаты запуска: 2.4 токена/с на смартфоне - что это значит?
2.4 токена/с на генерации и 4.4 токена/с на префилле - это медленно по меркам десктопных GPU, но ожидаемо для мобильного процессора без выделенной VRAM. Модель загружена полностью, все 35 миллиардов параметров доступны, архитектура Mixture of Experts отрабатывает штатно. Факт работающей 35B-модели на телефоне важнее цифр скорости.
Скорость генерации: 2.4 токена/с - комфортно ли это?
2.4 токена/с - около 1-2 слов в секунду. Ответ из 50 слов формируется 25-50 секунд. Для сравнения: комфортное общение с чат-ботом требует 10-15 токенов/с, быстрые десктопные инференсы на GPU выдают 50-100 токенов/с. На том же Xiaomi 12 Pro квантованные 7B-модели в GGUF формате дают 8-12 токенов/с - в 3-5 раз быстрее, но с качественно меньшим объёмом знаний.
Практический вывод: интерактивный диалог с Qwen 3.6 35B на смартфоне требует терпения. Сценарий «задал вопрос - отложил телефон - через минуту прочитал ответ» рабочий. Сценарий «быстрый чат в мессенджере» - нет. Для офлайн-суммаризации, анализа документов, генерации отчётов в фоне скорость достаточна.
Префилл 4.4 токена/с: почему это важно для первого токена
Префилл обрабатывает входной контекст перед началом генерации. 4.4 токена/с означает, что промпт длиной 2000 токенов будет обработан за 7.5 минут, а полный контекст в 8192 токена - почти за полчаса. После этого начнётся генерация ответа со скоростью 2.4 токена/с.
Это узкое место для задач с длинным контекстом: загрузить статью и попросить саммари - ожидание десятки минут. Короткие запросы до 500 токенов обрабатываются за 2 минуты, что уже ближе к практическому применению. Разрыв между префиллом и генерацией меньше, чем на GPU, потому что оба этапа упираются в пропускную способность памяти LPDDR5, а не в вычислительные ядра.
Ключевое ограничение: контекст 8192 токенов и борьба за память
12 ГБ ОЗУ - это предельно мало для 35B-модели. Даже с 4-битным квантованием веса занимают около 18-20 ГБ. BigMoeOnEdge решает проблему через динамическую подгрузку экспертов: в памяти постоянно находятся только разделяемые слои и активные эксперты для текущего токена, остальные выгружены. Но KV-кэш растёт линейно с длиной контекста и съедает доступную память.
Куда уходит память: веса модели vs KV-кэш
Распределение памяти на Xiaomi 12 Pro при запуске Qwen 3.6 35B MoE выглядит так:
- Разделяемые веса (attention, embedding, shared experts) - 2.5-3 ГБ в 4-битном квантовании
- Активные эксперты (2-3 из 16 на токен) - 1.5-2 ГБ
- KV-кэш при 8192 токенах - 3.5-4 ГБ
- Системные нужды и фреймворк - 1.5-2 ГБ
Итого 9-11 ГБ из 12 доступных. Свободного пространства практически нет, любое расширение контекста упирается в OOM. KV-кэш растёт пропорционально числу слоёв и размеру скрытого состояния: каждый слой хранит ключи и значения для всех предыдущих токенов. У Qwen 3.6 35B около 48 трансформерных слоёв со скрытым состоянием 4096 измерений - при 8192 токенах это миллионы float16-значений.
Почему 8192 токенов - это потолок для данной конфигурации
Увеличение контекста до 16К токенов удваивает KV-кэш: дополнительные 3.5-4 ГБ. Суммарное потребление достигает 13-15 ГБ при доступных 12 ГБ. Начинается свопинг в UFS-накопитель, скорость падает на порядок - генерация уходит ниже 0.5 токена/с, префилл становится многоминутным даже для коротких промптов.
Теоретически можно уменьшить размер кэша через квантизацию ключей и значений до 8 или 4 бит. Это даст 16К контекста ценой незначительной деградации качества. Пока такие оптимизации в BigMoeOnEdge не реализованы, 8192 токенов остаётся жёстким пределом.
BigMoeOnEdge: как запустить 35B модель на телефоне
BigMoeOnEdge - открытый проект для инференса Mixture-of-Experts моделей на устройствах без дискретных GPU. Ключевая идея: эксперты MoE-модели используются редко, держать их все в памяти неэффективно. Фреймворк подгружает нужных экспертов с накопителя по мере необходимости, а неиспользуемых выгружает.
Архитектура MoE: почему именно она подходит для слабого железа
Mixture of Experts активирует 2-3 эксперта из 16 на каждый токен. При 35B общих параметров активны только 5-7B. Плотная 35B-модель требует все 35B параметров в памяти постоянно - около 70 ГБ в FP16 или 18-20 ГБ в 4-битном квантовании. MoE-модель в 4-битном квантовании с динамической подгрузкой экспертов укладывается в 5-6 ГБ на веса и активных экспертов.
Этот же принцип работает на десктопах. В нашем тесте Qwen3.5 122B против Qwen3 Next 80B на 64 ГБ RAM более тяжёлая MoE-модель с 10B активных параметров дала качественно лучшие ответы, чем меньшая плотная модель, несмотря на низкое квантование. Архитектура MoE принципиально меняет соотношение размера модели и требований к памяти.
Конфигурация запуска на Xiaomi 12 Pro: что было сделано
Для запуска потребовался модифицированный Xiaomi 12 Pro с разблокированным загрузчиком и root-доступом. Стандартная MIUI агрессивно выгружает фоновые процессы при достижении 80% использования ОЗУ, что несовместимо с долгим инференсом. Кастомное ядро с отключённым ZRAM и зафиксированным свопом на 2 ГБ решило проблему.
Параметры запуска:
- Модель: Qwen 3.6 35B MoE в 4-битном квантовании (Q4_K_M)
- Фреймворк: BigMoeOnEdge v0.3.2
- Контекст: 8192 токенов
- Активных экспертов: 2 на токен
- Треды CPU: 4 больших ядра Cortex-X2, 4 средних Cortex-A710
- Бэкенд: llama.cpp с кастомными оптимизациями под ARMv9
Модель загружается 3-4 минуты, после чего готова к инференсу. Первый запрос с длинным контекстом требует дополнительного времени на инициализацию кэша. Для углублённого понимания техник запуска MoE на ограниченном железе рекомендуем руководство по оптимизации VRAM-кэша в llama.cpp - методы управления памятью применимы и к мобильным устройствам.
Сравнение с альтернативами: MoE на телефоне vs квантованные плотные модели
На том же Xiaomi 12 Pro можно запустить квантованную 7B-плотную модель (Mistral, Llama, Qwen) через стандартный llama.cpp. Сравним:
| Параметр | Qwen 3.6 35B MoE | Плотная 7B Q4_K_M |
|---|---|---|
| Скорость генерации | 2.4 токена/с | 8-12 токенов/с |
| Контекст | 8192 токенов | 32К+ токенов |
| Объём знаний | Высокий (35B параметров) | Средний (7B параметров) |
| Качество на сложных задачах | Сопоставимо с 13B плотной | Базовое |
| Потребление ОЗУ | 10-11 ГБ | 4-5 ГБ |
| Время загрузки | 3-4 минуты | 30-60 секунд |
MoE-подход выигрывает в качестве ответов на сложные запросы, требующие широких знаний. Плотные 7B-модели выигрывают в скорости, длине контекста и стабильности. Выбор зависит от задачи: нужна эрудиция - MoE, нужна скорость - плотная модель.
Отдельный интерес представляет сравнение с десктопным инференсом той же модели. В тесте Strix Halo на Ryzen AI Max+ 395 Qwen 3.6-35B-A3B выдаёт 14.2 токен/с под 32 параллельными запросами - разрыв с мобильным инференсом в 6 раз, но и энергопотребление отличается на порядок.
Перспективы: когда мы запустим vision-модели на смартфонах?
Vision-модели добавляют энкодер изображений, который требует отдельных 1-2 ГБ памяти и вычислительных ресурсов. На текущем поколении флагманов с 12 ГБ ОЗУ это означает дальнейшее урезание контекста до 2-4К токенов и падение скорости генерации ниже 1 токена/с.
Два фактора изменят ситуацию в ближайшие 1-2 года. Первый - аппаратный: смартфоны с 16-24 ГБ ОЗУ уже появляются у производителей (ASUS ROG Phone, Nubia Red Magic), а LPDDR6 увеличит пропускную способность памяти на 30-50%. Второй - софтверный: квантизация KV-кэша до 4 бит и энкодеров изображений до 8 бит снизит потребление памяти на 40-60% без заметной потери качества.
Архитектурные улучшения MoE-моделей также играют роль. Меньшее число активных экспертов, разделяемые энкодеры для текста и изображений, спекулятивная выгрузка неиспользуемых компонентов - эти техники уже тестируются в llama.cpp. Результаты тестов Multi-Token Prediction на MoE-моделях показывают, что программные оптимизации дают прирост скорости до 50% на том же железе.
Практические выводы: для каких задач подходит такой инференс?
Запуск Qwen 3.6 35B MoE на Xiaomi 12 Pro - работающая демонстрация технологии, а не готовый пользовательский продукт. Практические сценарии, где этот подход оправдан:
- Офлайн-суммаризация длинных документов: загрузили текст, оставили телефон на 10-15 минут, получили саммари
- Генерация отчётов и структурированных данных из неструктурированного ввода в фоновом режиме
- Анализ и классификация текстов с высокими требованиями к качеству, где 7B-модели ошибаются
- Исследовательские задачи и эксперименты с запуском больших моделей на edge-устройствах
Сценарии, где подход не оправдан: интерактивные чат-боты, голосовые ассистенты, задачи реального времени, работа с длинным контекстом (более 4-5 тысяч токенов).
С выходом устройств с 16-24 ГБ ОЗУ и оптимизацией KV-кэша ситуация изменится. Контекст расширится до 16-32К токенов, скорость генерации поднимется до 5-8 токенов/с - этого достаточно для комфортного чтения ответа в реальном времени. Мобильный инференс больших моделей перейдёт из разряда экспериментов в практическую плоскость.