Введение: почему спор о 9B и 122B важен для вас
В сообществе локального запуска LLM часто звучит совет: «Просто используйте 122B-модель». Этот совет игнорирует реальность массового железа. Большинство пользователей работают на видеокартах с 8 ГБ VRAM и системах с 16 ГБ ОЗУ. Для них 122B-модель - это не практичный инструмент, а источник задержек и разочарования.
9B-модели решают эту проблему. Они помещаются в память типичной игровой видеокарты, генерируют текст со скоростью, достаточной для диалога, и закрывают большинство повседневных задач: чат, генерацию кода, работу с документами. Эта статья - практический разбор, почему компактные модели остаются разумным выбором, и как выбрать конкретную модель под ваше железо.
Мы не отрицаем пользу больших моделей. Мы показываем границы их применимости и даём алгоритм выбора, который экономит время и ресурсы.
Аппаратные ограничения массового пользователя: 8 ГБ VRAM и 16 ГБ ОЗУ
Конфигурация с 8 ГБ VRAM - это массовый стандарт. Видеокарты уровня RTX 3070, RTX 4060 и их аналоги занимают значительную долю рынка. Добавьте к этому 16 ГБ системной памяти, и вы получите типичную машину разработчика или энтузиаста, который хочет запускать LLM локально.
Что это значит для выбора модели? 122B-модель в формате FP16 требует около 244 ГБ памяти. Даже в 4-битном квантовании ей нужно примерно 70 ГБ. Это в разы больше, чем доступно на 8 ГБ VRAM. Единственный способ запустить такую модель - выгружать часть весов на диск или в системную память. Этот процесс называется offloading, и он превращает интерактивную работу в ожидание.
9B-модель в 4-битном квантовании занимает 5-6 ГБ. Она целиком помещается в VRAM. Скорость генерации на RTX 3070 достигает 30-50 токенов в секунду. Это комфортный темп для диалога и работы с кодом. Разница не в процентах, а в порядке величины.
Если вы хотите глубже понять, как малые модели ведут себя в условиях ограниченной памяти, посмотрите разбор пределов возможностей малых моделей.
Что такое offloading и почему он убивает производительность
Offloading - это выгрузка части весов модели из быстрой памяти (VRAM) в медленную (системная RAM или диск). Когда модели не хватает видеопамяти, она начинает хранить часть слоёв на CPU или SSD. При генерации каждого токена системе нужно обращаться к этим медленным хранилищам.
Результат - катастрофическое падение скорости. Модель, которая в VRAM выдаёт 40 токенов в секунду, при offloading на диск замедляется до 1-2 токенов в секунду. Это не просто медленно. Это делает интерактивную работу невозможной. Чат превращается в пинг-понг с задержкой в десятки секунд на каждый ответ.
Особенно болезненно offloading бьёт по задачам с длинным контекстом. Обработка промпта на CPU занимает секунды, а то и минуты. Для агентных сценариев, где модель должна быстро реагировать на изменения контекста, это неприемлемо. Практический пример такого компромисса описан в тесте Qwen3.5 122B на 64 ГБ RAM, где скорость генерации упала до 2.9 токенов в секунду.
9B-модели не требуют offloading. Они работают целиком в VRAM. Это главный технический аргумент в их пользу для массового пользователя.
9B-модели: какие они бывают и что могут
Класс 9B-моделей - это не одна модель, а целое семейство. Сюда входят Llama-3-8B, Mistral-7B, Gemma-9B, Qwen-9B и их производные. Каждая имеет свои особенности, но всех их объединяет одно: они запускаются на 8 ГБ VRAM с 4-битным квантованием и дают приемлемую скорость.
Llama-3-8B - универсальная модель с открытой лицензией. Mistral-7B славится эффективностью и хорошей работой с кодом. Gemma-9B - вариант от Google с сильными результатами в текстовых задачах. Qwen-9B - модель от Alibaba с хорошей поддержкой длинных контекстов.
Для локального запуска все они доступны в формате GGUF через llama.cpp или Ollama. Квантование Q4_K_M - стандартный выбор: оно сохраняет качество, близкое к FP16, при размере 5-6 ГБ.
Сравнение требований к памяти: 9B vs 122B
| Модель | FP16, ГБ | 4-bit, ГБ | Требуемая VRAM |
|---|---|---|---|
| 9B | ~18 | ~5-6 | 8 ГБ (влезает целиком) |
| 122B | ~244 | ~70 | 70+ ГБ (нужен offloading) |
Цифры говорят сами за себя. 122B-модель даже в 4-битном виде требует в 12 раз больше памяти, чем доступно на типичной видеокарте. 9B-модель помещается целиком и работает без компромиссов.
Практические сценарии: где 9B достаточно
Главный вопрос: хватает ли качества 9B-моделей для реальной работы? Ответ зависит от задачи. Для трёх ключевых сценариев - ежедневного инференса, генерации кода и работы с документами - ответ положительный.
Ежедневный инференс: чат и ответы на вопросы
Для диалогового режима 9B-модель на 8 ГБ VRAM выдаёт 30-50 токенов в секунду. Это скорость, при которой ответ появляется почти мгновенно. Сравните с 122B-моделью с offloading: 1-2 токена в секунду, ответ формируется минуту и дольше.
Пример промпта: «Объясни разницу между инференсом и обучением нейросети простыми словами». 9B-модель справляется за 2-3 секунды. Ответ точный, структурированный, без воды. Для ежедневных вопросов этого достаточно.
Генерация кода: помощник разработчика
9B-модели генерируют рабочий код для типовых задач. Запрос на функцию сортировки, API endpoint или SQL-запрос - всё это выполняется на уровне, достаточном для повседневной разработки.
Пример: «Напиши функцию на Python для чтения CSV и подсчёта среднего значения колонки». Модель выдаёт корректный код с обработкой ошибок. Для сложных архитектурных задач может потребоваться большая модель, но для рутинной разработки 9B хватает.
Работа с документами: суммаризация и извлечение
Загрузка PDF или длинного текста, запрос на суммаризацию или извлечение ключевых фактов - стандартный сценарий для бизнес-пользователей. 9B-модели справляются с документами среднего размера: до 10-20 страниц текста.
Пример: «Суммаризируй этот отчёт в 5 пунктов». Модель выделяет главное, сохраняя структуру. Для очень длинных документов с тонкими нюансами потребуется модель с большим контекстным окном, но для большинства офисных задач 9B достаточно.
Если вы ищете модели, которые работают на ещё более скромном железе, обратите внимание на MoE-модели с ~2B активных параметров.
Когда 122B действительно нужны: границы применимости малых моделей
Честность требует признать: 9B-модели не универсальны. Есть задачи, где они упираются в потолок. Сложные многошаговые рассуждения, тонкое понимание нюансов юридических или медицинских текстов, генерация больших объёмов кода с нетривиальной логикой - здесь 122B-модели показывают превосходство.
Пример: задача на логический вывод, требующая учёта десятка взаимосвязанных условий. 9B-модель может потерять часть контекста или дать упрощённый ответ. 122B-модель справляется лучше за счёт большего числа параметров и более глубокого понимания.
Для таких задач есть два пути: использовать облачные API или собирать машину с большим объёмом памяти. Если ваша работа требует регулярного решения сложных задач, посмотрите подборку LLM для систем с unified-памятью до 256 ГБ.
Рекомендации: как выбрать модель под своё железо
Алгоритм выбора прост. Определите свои ресурсы, затем выбирайте модель, которая помещается в память целиком.
- Проверьте объём VRAM. Если 8 ГБ или меньше - ваш выбор 9B с 4-битным квантованием.
- Если задачи простые (чат, базовая генерация кода, суммаризация), 9B достаточно.
- Если нужна максимальная производительность, рассмотрите 13B с частичным offloading или облачные сервисы.
- Если у вас 16 ГБ ОЗУ без дискретной GPU, запускайте 9B на CPU через llama.cpp с квантованием Q4_0. Скорость будет ниже, но работа возможна.
Примеры конфигураций и моделей
| Конфигурация | Рекомендуемая модель | Инструмент |
|---|---|---|
| 8 ГБ VRAM (RTX 3070/4060) | Llama-3-8B Q4_K_M | Ollama / llama.cpp |
| 16 ГБ ОЗУ без GPU | Llama-3-8B Q4_0 | llama.cpp |
| 12 ГБ VRAM | Qwen-9B Q5_K_M | Ollama / llama.cpp |
Для сравнения моделей на более мощном железе и понимания, где проходит граница между качеством и скоростью, изучите тест Minimax 2.7, DeepSeek V4 Flash и Laguna S 2.1 на 192 ГБ VRAM.
Заключение: практичность важнее трендов
9B-модели работают на массовом железе. Они помещаются в 8 ГБ VRAM, генерируют текст со скоростью 30-50 токенов в секунду и закрывают большинство повседневных задач. 122B-модели требуют offloading, который убивает интерактивность.
Выбирайте модель, которая работает на вашем железе, а не ту, что модная. Экспериментируйте с 9B, тестируйте разные квантования, делитесь результатами. Будущее за эффективными моделями, и 9B - разумный компромисс между качеством и доступностью.