В апреле 2025 года Meta представила Llama 4 Scout и Llama 4 Maverick, мультимодальные модели на архитектуре Mixture of Experts, MoE. Scout получила около 109 млрд общих параметров, 16 экспертов, 17 млрд активных параметров и заявленное контекстное окно до 10 млн токенов. Maverick насчитывает около 400 млрд общих параметров, использует 128 экспертов, активирует около 17 млрд параметров и поддерживает контекст до 1 млн токенов.
Главное практическое различие между версиями связано с контекстом, масштабом полной модели и требованиями к инфраструктуре. Scout выглядит более подходящей для экспериментов со сверхдлинными документами и сценариев, где интересен 4-битный запуск на одном серверном GPU. Maverick рассчитана на инфраструктуру с несколькими ускорителями и задачи, где оправдана более крупная конфигурация. Обе модели доступны на Hugging Face Hub и интегрированы с transformers, начиная с версии 4.51.0.
Llama 4 Scout и Maverick в двух словах: какую модель выбрать
Scout стоит рассматривать, когда приоритетом служит контекст до 10M токенов, анализ больших наборов документов и более доступный вариант локального запуска. У модели есть код для 4-битного квантования, который позволяет запускать её на одном серверном GPU при подходящей конфигурации памяти и программного окружения.
Maverick предлагает контекст до 1M токенов и значительно большее общее число параметров. Это не означает автоматическое превосходство в каждой задаче: итог зависит от режима оценки, промпта, длины входа, формата весов и конкретного рабочего сценария. Для Maverick нужно заранее планировать многокарточную конфигурацию или другой серверный вариант размещения.
Ключевые характеристики в одной таблице
| Параметр | Llama 4 Scout | Llama 4 Maverick |
|---|---|---|
| Тип | Мультимодальная MoE-модель | Мультимодальная MoE-модель |
| Общее число параметров | Около 109B | Около 400B |
| Количество экспертов | 16 | 128 |
| Активные параметры | Около 17B | Около 17B |
| Максимальный заявленный контекст | До 10M токенов | До 1M токенов |
| Доступность | Hugging Face Hub | Hugging Face Hub |
| Практический сценарий запуска | Tensor Parallelism, device_map="auto", 4-битное квантование | Tensor Parallelism и распределение по нескольким устройствам |
Общее число параметров описывает размер всей сети, включая экспертов, которые хранятся в весах модели. Активные параметры показывают, какая часть вычислительной сети выбирается маршрутизатором для обработки конкретного токена. Поэтому показатель 17B нельзя использовать как прямую оценку размера файла или необходимого объёма VRAM.
Что означает «17B активных параметров»
В плотной языковой модели каждый токен проходит через один и тот же набор основных слоёв. В MoE-модели несколько блоков, называемых экспертами, специализируются на разных шаблонах данных. Маршрутизатор выбирает подмножество экспертов для конкретного токена, после чего их результаты объединяются с остальными слоями.
У Llama 4 Scout и Maverick около 17 млрд активных параметров на один шаг обработки, хотя полный набор весов значительно больше. Такой подход может снизить вычисления на токен по сравнению с плотной моделью сопоставимого общего размера. Хранить при этом приходится всю модель, если веса не распределены между устройствами или не сжаты квантизацией.
На требования к памяти влияют несколько факторов:
- формат весов, например FP16 или 4-битное представление;
- объём KV-кэша;
- длина входного контекста;
- размер batch size;
- служебная память PyTorch и CUDA;
- число GPU и способ распределения модели.
Разбор компактных MoE-моделей с небольшим числом активных параметров есть в статье о MoE-моделях с 2B активных параметров. Масштаб Llama 4 существенно выше, поэтому прямое сравнение требований к железу здесь некорректно.
Как устроена архитектура Llama 4: MoE, NoPE и чанкованное внимание
Архитектура Llama 4 объединяет маршрутизацию Mixture of Experts с решениями для обработки сверхдлинных последовательностей. В описании моделей отдельно упоминаются слои без позиционного кодирования, NoPE, чанкованное внимание с блоками по 8192 токена и температурная настройка softmax.
MoE без лишней математики: что происходит при обработке токена
Представьте несколько специализированных вычислительных блоков внутри одного слоя. Для одного токена маршрутизатор может выбрать одну комбинацию экспертов, для другого, другую. Вход с фрагментом исходного кода, естественным языком или визуальными признаками проходит через выбранные блоки, а модель продолжает генерацию с учётом их результатов.
Число экспертов увеличивает ёмкость модели, но не превращает её в набор независимых небольших моделей. Общие слои, маршрутизатор, все веса экспертов и механизм внимания остаются частью общей системы. При инференсе требуется учитывать и хранение полного набора параметров, и вычисление активной части сети.
MoE особенно интересна для серверных сценариев, где модель можно разделить между несколькими GPU. Поддержка Tensor Parallelism в transformers помогает распределять вычисления, но реальная эффективность зависит от межсоединения между ускорителями, драйверов, версии библиотек и размера запроса.
Зачем Llama 4 нужны слои NoPE
NoPE расшифровывается как отсутствие позиционного кодирования в отдельных слоях. Обычно модель получает информацию о порядке токенов через специальный механизм позиционных признаков. В Llama 4 часть слоёв работает без такого кодирования, что входит в общий архитектурный подход к поддержке длинного контекста.
Для пользователя это означает возможность обрабатывать последовательности гораздо большего размера, чем у большинства обычных локальных моделей. NoPE не даёт гарантии, что модель одинаково хорошо найдёт любой факт в 10 млн токенов. Качество зависит от расположения информации, формулировки запроса, плотности данных и фактической длины входа.
Максимальное окно в карточке модели и комфортный рабочий диапазон, разные характеристики. Перед использованием в приложении их нужно проверить на собственных документах и измерить долю корректно извлечённых фактов.
Чанкованное внимание и блоки по 8192 токена
При чанкованном внимании длинная последовательность обрабатывается блоками. Для Llama 4 указывается длина блока 8192 токена. Такой размер позволяет организовать работу с большими входами и контролировать вычислительную нагрузку, которая при полном внимании к каждому токену быстро растёт.
Разбиение на чанки не означает, что модель автоматически получает одинаковый доступ ко всем удалённым фрагментам. Связи между частями последовательности и способ их обработки зависят от конкретной реализации. На практике пользователю следует проверять, как модель работает с перекрёстными ссылками, повторяющимися сущностями и фактами, расположенными далеко друг от друга.
Чанкование помогает управлять памятью и временем вычислений, но длинный запрос всё равно остаётся дорогим. При росте окна увеличивается размер KV-кэша, а генерация ответа требует сохранять состояние для уже обработанных токенов.
Температурная настройка softmax в длинном контексте
Softmax превращает оценки внимания в распределение весов. Температура меняет форму этого распределения: при одном значении внимание становится более концентрированным, при другом, более равномерным. В Llama 4 температурная настройка softmax используется как один из элементов конструкции для работы с длинными последовательностями.
Этот механизм помогает управлять распределением внимания, но сам по себе не гарантирует точное чтение всего контекста. На длинных входах сохраняются риски пропуска нужного фрагмента, смешения похожих сведений и уверенного ответа при неполном извлечении данных.
Контекст до 10M токенов: где это помогает, а где начинаются ограничения
Практические сценарии для длинного контекста
Контекст Scout до 10M токенов может пригодиться для анализа связанных документов, если их объём действительно нужно рассматривать совместно. Среди возможных задач:
- сопоставление большой технической спецификации с несколькими версиями требований;
- поиск противоречий в комплекте договоров, регламентов или проектной документации;
- анализ крупного репозитория с несколькими связанными модулями;
- обработка архивов переписки и внутренних инструкций;
- сравнение длинных текстовых материалов с изображениями и другими мультимодальными данными, если это поддерживает конкретная конфигурация.
Maverick с окном до 1M токенов подходит для похожих сценариев меньшего масштаба. Например, можно проверять большой набор исходников, проектную документацию или коллекцию отчётов в одном запросе, если аппаратные ресурсы позволяют обработать такой вход.
Большое окно особенно полезно там, где разбиение документов на независимые фрагменты теряет связи между сущностями. В задачах поиска по базе знаний RAG часто остаётся более практичным: индексирование сокращает вход, снижает стоимость обработки и позволяет обновлять документы без повторной передачи всего корпуса.
Почему 10M токенов не означает «можно загрузить всё»
Заявленное окно задаёт верхнюю границу последовательности, которую модель может принимать в поддерживаемом режиме. Оно не гарантирует одинаковую скорость и качество на каждом значении длины. Большой вход увеличивает время предобработки, расход памяти и размер KV-кэша.
При поиске конкретного факта в огромном корпусе возможны ошибки позиционирования и извлечения. Модель может обнаружить нужную информацию, смешать её с похожим фрагментом или построить ответ по наиболее заметным частям текста. Поэтому для рабочих систем нужны контрольные вопросы, цитирование фрагментов внутри приложения, индексация и тестовый набор документов.
На результат влияют формат весов, batch size, число GPU, реализация инференса и фактическая длина запроса. Максимальные 10M токенов могут быть недоступны в выбранном режиме квантизации или при ограниченном запасе VRAM.
Llama 4 Hugging Face: как запустить Scout и Maverick через transformers
Подготовка окружения и проверка версии transformers
Для интеграции нужен Python-стек с PyTorch, CUDA и версией transformers, которая официально поддерживает конкретную модель. В день релиза для Llama 4 указывалась интеграция с transformers 4.51.0. Перед установкой проверьте текущую версию:
python -c "import transformers, torch; print(transformers.__version__); print(torch.__version__); print(torch.cuda.is_available())"
Сверьте версию transformers с карточкой модели и документацией конкретного запуска. Авторизация в Hugging Face может потребоваться для моделей с ограниченным доступом. Идентификатор репозитория, параметры процессора и формат входных данных нужно брать из актуальной карточки выбранной версии.
Минимальная диагностика перед загрузкой должна включать проверку свободной памяти GPU, доступности CUDA, установленного драйвера и поддержки нужного типа квантизации. Для длинного контекста оставляйте запас памяти: веса занимают лишь часть общего бюджета.
Минимальный пример загрузки модели через Python
Ниже приведён общий шаблон для transformers. Значение MODEL_ID нужно заменить на точный официальный идентификатор Scout или Maverick из карточки модели. Такой подход не подменяет проверку совместимости конкретного репозитория.
import torch
from transformers import AutoProcessor, AutoModelForCausalLM
MODEL_ID = "УКАЖИТЕ_ОФИЦИАЛЬНЫЙ_ID_МОДЕЛИ"
dtype = torch.bfloat16 if torch.cuda.is_available() else torch.float32
processor = AutoProcessor.from_pretrained(MODEL_ID)
model = AutoModelForCausalLM.from_pretrained(
MODEL_ID,
torch_dtype=dtype,
device_map="auto",
)
messages = [
{"role": "user", "content": "Кратко объясни принцип работы MoE-модели."}
]
inputs = processor.apply_chat_template(
messages,
add_generation_prompt=True,
return_tensors="pt",
return_dict=True,
)
inputs = {key: value.to(model.device) for key, value in inputs.items()}
with torch.inference_mode():
output = model.generate(
**inputs,
max_new_tokens=256,
do_sample=False,
)
answer = processor.batch_decode(output, skip_special_tokens=True)
print(answer[0])
У мультимодальной конфигурации формат messages и вызов процессора могут отличаться. Если карточка модели требует специальный класс, шаблон чата или параметры изображений, используйте их вместо универсального примера. Для первого теста задайте небольшой контекст и низкий max_new_tokens, чтобы отделить ошибки окружения от проблем с объёмом памяти.
Tensor Parallelism и автоматическое распределение по устройствам
device_map="auto" распределяет компоненты модели по доступным устройствам и CPU, если это разрешает конфигурация. Такой режим удобен для проверки загрузки, но распределение отдельных слоёв не всегда даёт оптимальную скорость.
Tensor Parallelism делит вычисления внутри отдельных операций между несколькими GPU. Для этого нужны поддержка в конкретной конфигурации transformers, совместимое оборудование и корректно настроенный запуск. Межсоединение между картами влияет на задержку: передача тензоров между устройствами может стать узким местом.
Для серверной эксплуатации измеряйте время загрузки, latency первого токена, скорость генерации, использование VRAM и поведение при параллельных запросах. Успешная загрузка модели ещё не подтверждает пригодность конфигурации для постоянной нагрузки.
4-битное квантование Scout для одного серверного GPU
Для Scout предоставлен код, рассчитанный на 4-битное квантование и запуск на одном серверном GPU. Квантизация уменьшает объём весов, однако итоговый расход памяти зависит от метода сжатия, вычислительного типа, KV-кэша, длины контекста и размера batch size.
Общий шаблон с BitsAndBytesConfig выглядит так:
import torch
from transformers import AutoProcessor, AutoModelForCausalLM, BitsAndBytesConfig
MODEL_ID = "УКАЖИТЕ_ОФИЦИАЛЬНЫЙ_ID_SCOUT"
quantization_config = BitsAndBytesConfig(
load_in_4bit=True,
bnb_4bit_compute_dtype=torch.bfloat16,
bnb_4bit_quant_type="nf4",
bnb_4bit_use_double_quant=True,
)
processor = AutoProcessor.from_pretrained(MODEL_ID)
model = AutoModelForCausalLM.from_pretrained(
MODEL_ID,
quantization_config=quantization_config,
device_map="auto",
)
messages = [
{"role": "user", "content": "Проанализируй этот фрагмент конфигурации."}
]
inputs = processor.apply_chat_template(
messages,
add_generation_prompt=True,
return_tensors="pt",
return_dict=True,
)
inputs = {key: value.to(model.device) for key, value in inputs.items()}
with torch.inference_mode():
output = model.generate(**inputs, max_new_tokens=256)
print(processor.batch_decode(output, skip_special_tokens=True)[0])
Этот фрагмент показывает общий принцип и требует сверки с официальной реализацией Scout. Не задавайте сразу контекст максимальной длины. Начните с короткого запроса, затем постепенно увеличивайте вход и контролируйте память.
Llama 4 Scout или Maverick: выбор по задачам и железу
Когда имеет смысл рассматривать Llama 4 Scout
Scout логично выбрать для анализа больших входов, если контекст до 10M токенов нужен самому приложению, а инфраструктура допускает серверный GPU с 4-битным режимом. Модель подходит для экспериментов с длинными техническими материалами, исходным кодом и архивами документов.
Доступность 4-битного запуска не означает комфортную скорость на любой длине контекста. Для коротких запросов узким местом может стать не размер весов, а пропускная способность памяти. Для длинных запросов добавляются расходы на обработку входа и KV-кэш.
Когда нужен Llama 4 Maverick
Maverick содержит около 400B общих параметров, 128 экспертов, 17B активных параметров и поддерживает контекст до 1M токенов. Её стоит рассматривать при наличии многокарточной серверной инфраструктуры и задач, где крупная конфигурация оправдана требованиями к качеству или мультимодальному анализу.
Исходных данных недостаточно, чтобы обещать превосходство Maverick над Scout по каждому показателю. Сравнивайте модели на собственных запросах, особенно если важны кодинг, извлечение фактов, следование формату или работа с изображениями.
Как оценить требования к VRAM до установки
- Формат весов. FP16, BF16 и 4-битное представление дают разный расход памяти.
- Полный размер модели. У MoE нужно учитывать все хранимые эксперты, а не только активные параметры.
- Контекст. Рост длины входа увеличивает KV-кэш и время обработки.
- Batch size. Параллельные запросы требуют дополнительной памяти.
- Распределение. Проверьте число GPU, доступную VRAM, межсоединение и совместимость Tensor Parallelism.
- Запас. Оставьте память для CUDA, процессора, временных буферов и мультимодальных входов.
Количество активных параметров помогает оценить вычислительную часть MoE, но не даёт точного ответа о запуске. Точные требования нужно проверять по конфигурации модели и выбранному движку инференса.
Llama 4 против Llama 3.1 и 3.3: что показывают бенчмарки
Reasoning и общие текстовые задачи
В доступных материалах нет конкретных таблиц с результатами Llama 4 Scout и Maverick против Llama 3.1 и Llama 3.3. Поэтому корректно указывать проценты прироста или объявлять победителя по reasoning нельзя.
Для честного сравнения потребуется зафиксировать название теста, точную версию модели, шаблон промпта, число примеров, параметры генерации и способ подсчёта результата. Сравнение разных режимов легко создаёт видимость прироста, который связан с настройками оценки.
Кодинг и работа с большими репозиториями
Большой контекст и качество решения coding-задач описывают разные свойства. Модель может принять крупный репозиторий, но ошибиться при поиске зависимости между файлами. И наоборот, модель с меньшим окном способна хорошо решить задачу после предварительного отбора нужных фрагментов.
Для собственной проверки разделите тесты на две группы: обычная генерация и исправление небольших фрагментов кода, затем анализ репозитория с заранее известными связями. Фиксируйте размер входа, время ответа, число ошибок и долю задач, где модель изменила правильные файлы.
Практический контекст сравнения локальных моделей и серверных конфигураций приведён в гидах по экосистеме открытых LLM. Данные оттуда нельзя переносить на Llama 4 без отдельного теста.
Мультимодальные возможности
Llama 4 заявлена как мультимодальное поколение. Это отличает её от текстовых сценариев, где вход состоит только из токенов. Практическая ценность зависит от поддерживаемого процессора, формата входных данных и конкретной задачи.
В доступной фактуре нет сопоставимых числовых результатов Scout и Maverick с Llama 3.1 и Llama 3.3 по мультимодальным тестам. Не следует расширять список поддерживаемых форматов или приписывать моделям конкретные преимущества без проверки карточки выбранной модели.
Ограничения Llama 4 и итоговый выбор
Что проверить перед запуском в продакшене
- Уточнить официальный идентификатор Scout или Maverick и требования карточки модели.
- Проверить лицензию и условия использования для своего сценария.
- Сверить совместимость transformers, PyTorch, CUDA и драйвера.
- Рассчитать VRAM с учётом полного набора весов, квантизации, KV-кэша и batch size.
- Проверить, поддерживает ли выбранная конфигурация Tensor Parallelism.
- Измерить latency, скорость генерации и потребление памяти на собственных запросах.
- Проверить качество извлечения фактов на длинных документах.
- Определить рабочий контекст, который может оказаться меньше заявленного максимума.
Llama 4 Scout и Maverick объединяют MoE, мультимодальность и сверхдлинный контекст. Scout предлагает до 10M токенов и более доступный из заявленных вариантов локального запуска с 4-битным квантованием. Maverick имеет около 400B общих параметров, 128 экспертов и контекст до 1M токенов, поэтому требует более серьёзной серверной инфраструктуры.
Выбирайте Scout, если критичны сверхдлинные входы и возможность изучить 4-битную конфигурацию на одном серверном GPU. Выбирайте Maverick, если у вас есть многокарточная система и задачи, где оправдана крупная модель. В обоих случаях начните с небольшого тестового набора: заявленные характеристики задают потенциал, а пригодность определяется измерениями на ваших данных.