Короткий ответ: с какой модели начать
На ПК с большим объёмом оперативной памяти и ограниченной видеопамятью локальный агентный кодинг возможен, но требует реалистичных ожиданий. Начните с модели среднего размера, ориентировочно 7-13B параметров, в формате GGUF с квантованием Q4 или Q5. Большая RAM компенсирует нехватку VRAM по объёму, но не устраняет потери скорости из-за CPU-offload. Интерактивные задачи требуют низкой задержки, пакетные сценарии допускают медленную генерацию.
Модель должна не только запускаться, но и оставаться пригодной для регулярной работы. Крупные модели 30B+ часто оказываются слишком медленными для повседневного агентного кодинга. Выбирайте баланс качества и скорости.
Почему максимальный размер модели не означает лучший выбор
Размер модели напрямую влияет на потребление памяти и скорость ответа. Модель 30B в квантовании Q4 занимает около 20 ГБ, а 70B уже более 40 ГБ. Даже при 64 ГБ RAM и 8 ГБ VRAM значительная часть вычислений уйдёт на CPU. Многошаговый агентный цикл порождает несколько последовательных запросов, поэтому задержка накапливается. Модель среднего размера может отвечать за 1-2 секунды, тогда как крупная за 10-15 секунд. Для интерактивной работы это критично.
Стабильность агентного цикла важнее пикового качества. Модель, которая быстро генерирует код и удерживает контекст, полезнее медленной, но чуть более точной. Начните с 7-13B, оцените скорость и качество на реальных задачах.
Кому имеет смысл смотреть на модели 30B+
Крупные модели оправданы для сложного анализа кода, пакетной генерации, подготовки патчей и исследовательских задач, где качество важнее мгновенной реакции. Если вы готовы ждать 30-60 секунд на ответ и запускаете задачи в фоне, 30B+ может быть полезной. Но не обещайте себе высокую производительность без данных о конкретном железе и настройках. Проверьте скорость на вашей конфигурации, прежде чем переходить.
Что именно ограничивает запуск: RAM, VRAM и размер контекста
В памяти должны помещаться веса модели, служебные структуры и KV-кэш контекста. RAM позволяет загрузить больше, а VRAM и пропускная способность памяти влияют на отзывчивость. Длинный контекст репозитория увеличивает требования даже при неизменном размере модели.
Почему большая RAM помогает, но не превращает ПК в GPU-сервер
RAM расширяет пространство для загрузки модели и контекста. CPU-offload делает запуск возможным, но перенос вычислений с GPU на CPU увеличивает задержку и снижает скорость генерации. Пропускная способность системной памяти (DDR4/DDR5) в 5-10 раз ниже, чем у видеопамяти GDDR6. Поэтому модель, размещённая в RAM, будет генерировать токены медленнее. Например, 7B модель на CPU может выдавать 5-10 ток/с, а на GPU 30-50 ток/с. Для агентного кодинга это разница между комфортной работой и ожиданием.
Контекст репозитория и память агентного цикла
Небольшая модель может внезапно потреблять много памяти при работе с большим проектом. Длина контекста, история диалога, содержимое файлов, результаты команд и промежуточные шаги агента увеличивают расход. KV-кэш для контекста 32K может занимать несколько гигабайт. Оценивайте модель в реальном рабочем контексте, а не только по факту успешной загрузки. Если агент читает файлы и выполняет команды, контекст быстро растёт. Проверьте, хватает ли памяти после 10-20 шагов.
Квантование: как выбрать Q4 или Q5 для первой модели
Квантование уменьшает точность весов, чтобы модель занимала меньше памяти. Формат GGUF поддерживает разные уровни: Q4_K_M, Q5_K_M и другие. Q4 обычно проще разместить и использовать как стартовый вариант, Q5 требует больше памяти и может быть предпочтительнее, если запас RAM/VRAM позволяет. Качество зависит от конкретной модели и реализации.
Когда начать с Q4
Q4 - практичный вариант для проверки совместимости, скорости и поведения агента. Модель 7B в Q4 занимает около 4-5 ГБ, 13B около 8-9 ГБ. Это позволяет разместить модель в RAM и частично в VRAM. Сначала проверьте базовый рабочий процесс: генерация кода, вызов инструментов, удержание контекста. Затем сравните результат с более тяжёлым квантованием.
Когда оправдан Q5 и более тяжёлые варианты
Q5 даёт небольшой прирост качества, но увеличивает потребление памяти на 15-20%. Если у вас 32 ГБ RAM и 8 ГБ VRAM, 13B Q5 может поместиться полностью в RAM с оффлоадом. Для задач, требующих точности кода, Q5 может быть полезнее. Но итоговый эффект зависит от модели и длины контекста. Не считайте Q5 универсально лучшим.
CPU-offload на практике: что происходит при ограниченной VRAM
CPU-offload распределяет модель между GPU и CPU/RAM. Параметр количества GPU layers определяет, сколько слоёв модели обрабатывается на видеокарте. Полный GPU-запуск предпочтительнее для интерактивного агента, но частичный оффлоад позволяет использовать более крупную модель на доступном ПК.
Как подобрать баланс между GPU layers и RAM
Начните с конфигурации, которая уверенно помещается в VRAM. Затем постепенно увеличивайте долю GPU и наблюдайте за стабильностью, скоростью и расходом памяти. Оптимальный баланс зависит от конкретного GPU, CPU, версии движка и модели. В llama.cpp параметр --n-gpu-layers управляет этим. Например, для 7B модели на 8 ГБ VRAM можно попробовать 20-30 слоёв на GPU, остальное на CPU.
Почему модель может запускаться, но оставаться неудобной
Техническая совместимость не гарантирует пригодность к ежедневному агентному кодингу. Задержка первого токена, скорость генерации, паузы на обращение к CPU и влияние длинного контекста определяют удобство. В агентных циклах одна задача порождает несколько последовательных запросов. Если каждый запрос занимает 10 секунд, цикл из 10 шагов займёт 100 секунд. Это утомительно. Проверьте реальную скорость на типичной задаче.
Windows или WSL2: какую среду выбрать для локального агента
Среда запуска влияет на доступ к GPU, совместимость, настройку оффлоада и удобство работы агентных инструментов. Перед выбором проверьте поддержку конкретного стека.
Нативный стек в Windows
Нативный запуск в Windows минимизирует количество промежуточных слоёв и позволяет запускать модель рядом с обычной средой разработки. Ollama, llama.cpp и Open WebUI имеют нативные сборки. Преимущества: простой доступ к локальным файлам и приложениям. Ограничения: возможные проблемы с драйверами и производительностью. Проверьте документацию конкретных сборок.
WSL2 для разработческих и агентных сценариев
WSL2 удобен для терминальных инструментов, контейнеров и интеграций. Linux-инструменты, работа с репозиториями и агентные команды часто лучше поддерживаются. Добавляется слой настройки доступа к GPU и файловой системе. WSL2 не следует выбирать автоматически, если вы не используете Linux-специфичные инструменты. Проверьте совместимость драйверов и backend.
Какие задачи агентного кодинга потянет локальная модель
Локальная модель лучше всего подходит для ограниченных и контролируемых задач: объяснения кода, небольших правок, генерации тестов, работы с локальным контекстом и автоматизации без постоянного ожидания сложных многошаговых циклов.
Сценарии, где локальный запуск особенно уместен
Приватный код, офлайн-работа, повторяемые задачи, локальный RAG и автоматизация вокруг репозитория. Выгода зависит от качества конкретной модели и удобства интеграции с инструментами. Например, модель 7B может хорошо справляться с генерацией документации или простых функций. Ссылка на статью о гибридных агентах: Гибридные AI-агенты.
Сценарии, где задержка станет главным ограничением
Длинные агентные цепочки, большие репозитории, частые итерации в реальном времени и задачи, требующие устойчивого выполнения множества команд. В таких случаях меньшая модель с лучшей отзывчивостью может быть полезнее крупной. Если агент должен быстро реагировать на изменения, задержка 10+ секунд неприемлема. Рассмотрите облачные API для таких задач.
Практический алгоритм выбора первой модели
Определите рабочие задачи и допустимую задержку; проверьте доступную VRAM и RAM; выберите модель среднего размера; начните с GGUF Q4 или Q5; настройте CPU-offload; проверьте работу на реальном репозитории; оцените качество исправлений, стабильность агентного цикла и расход памяти; затем решите, нужен ли более крупный вариант.
Минимальный чек-лист перед установкой
- Размер модели: 7B, 13B или другой.
- Формат и квантование: GGUF, Q4_K_M или Q5_K_M.
- Доступная RAM и VRAM.
- Длина контекста: 8K, 16K, 32K.
- Backend: llama.cpp, Ollama, LM Studio.
- Поддержка GPU в Windows или WSL2.
- Способ подключения к агенту: API, CLI, MCP.
- Типы задач: объяснение, правки, тесты, рефакторинг.
Как понять, что пора переходить на более крупную модель
Признаки: модель регулярно ошибается в сложных изменениях, не удерживает контекст, требует слишком много ручных уточнений или не справляется с задачами, для которых скорость уже приемлема. Перед переходом проверьте контекст, системные инструкции, инструменты агента и настройки оффлоада. Возможно, проблема не в размере модели, а в конфигурации.
Для интерактивного кодинга приоритетом является баланс качества и скорости, для пакетных задач допустим больший размер модели. Начните с 7-13B Q4, протестируйте на реальных задачах и постепенно увеличивайте размер, если качество не устраивает.