Что такое «GPU poor» и почему это важно для локальных LLM
«GPU poor» - это ситуация, когда видеопамяти не хватает под то, что вы хотите запускать локально. Модель либо не стартует, либо идёт в агрессивном квантовании, либо часть слоёв уходит в оперативную память, и генерация превращается в ожидание. Строгого технического определения у термина нет: владелец 8 ГБ и владелец 24 ГБ могут одновременно считать себя бедными, если первый гоняет 7B, а второй целит в 70B.
Масштаб виден на цифрах. Модель на 70B параметров в 4-битной квантизации занимает примерно 35-40 ГБ видеопамяти только под веса, плюс несколько гигабайт на KV-кэш под контекст. Массовая потребительская карта с 24 ГБ сюда не помещается целиком: её владелец получает хороший опыт на моделях класса 30B и остаётся GPU poor относительно 70B.
Смотреть на категорию стоит как на отношение ресурсов к задаче. Одна и та же 12-гигабайтная карта тянет чат с 8B-моделью на 8K контекста и не выдерживает разбор длинного документа на 32K.
Откуда взялся термин
Формулировка пошла из англоязычных сообществ локального AI: ветки на Reddit, тематические Discord-серверы, обсуждения под релизами новых моделей. Она удобна как сокращение. Вместо перечисления конфигурации человек пишет «я ещё GPU poor», и читателю сразу понятно, что крупные модели ему пока не по размеру.
Граница подвижная: каждая новая волна моделей поднимает планку. Пользователь под ником paulqq опубликовал пост о том, что больше не относит себя к категории GPU poor, приложив изображение со ссылкой на Reddit. Конфигурации и замеров в публикации нет, так что это пример личного ощущения «стало хватать», а не ориентир для сборки.
Как VRAM определяет возможности
Веса модели должны поместиться в видеопамять, иначе часть работы уедет в RAM или на диск. Выгрузка в системную память работает, но в разы медленнее: каждый токен требует прогона слоёв через CPU и шину. Объём VRAM остаётся первым фильтром, всё остальное - вторым.
| Размер модели | Веса в 4-битной квантизации | Что нужно на практике |
|---|---|---|
| 7-8B | 4-6 ГБ | 8 ГБ VRAM с коротким контекстом |
| 13-14B | 8-10 ГБ | 12 ГБ впритык, 16 ГБ комфортно |
| 27-34B | 18-22 ГБ | 24 ГБ без offload |
| 70B | 35-40 ГБ | несколько карт или выгрузка в RAM |
Цифры приблизительные: они зависят от формата квантования, размера словаря и реализации ядра внимания. KV-кэш считается отдельно:
KV = 2 × слоёв × KV-голов × head_dim × токенов × байт_на_элемент
Для модели с 32 слоями, 8 KV-головами и head_dim 128 в FP16 это около 0,13 МБ на токен, то есть примерно 4 ГБ на 32K контекста. Ошибка в расчёте на этапе выбора карты обходится дорого: модель влезает, а на первом же длинном промпте уходит в offload.
Ключевые параметры GPU: что именно нужно улучшать
Вашу границу определяют четыре характеристики: объём VRAM, пропускная способность памяти, поддержка форматов квантования и интерфейс подключения. Порядок важен: сначала память, потом скорость, потом софт.
Объём VRAM: сколько нужно для современных моделей
Грубые границы по квантизации Q4: 8 ГБ закрывают 7-8B с коротким контекстом; 12-16 ГБ дают комфорт для 13-14B; 24 ГБ открывают 30-34B; 48 ГБ и выше нужны для 70B. Квантизация Q8 и FP16 сдвигают планку примерно вдвое.
С ростом контекста требования растут линейно. 32K токенов добавляют к 8B-модели несколько гигабайт, а 128K на крупной модели съедает десятки гигабайт только под KV-кэш, если он хранится в FP16.
Запас в 1-2 ГБ под KV-кэш, графы вычислений и рабочее пространство нужен всегда. Карта, заполненная весами под завязку, будет уходить в offload при первой же смене промпта.
Пропускная способность памяти: почему она важна
При генерации одного потока токенов узкое место - не вычислительные блоки, а чтение весов. Чтобы выдать один токен, GPU должна прочитать всю модель целиком. Отсюда простая прикидка: потолок скорости равен пропускной способности памяти, делённой на размер модели в байтах.
Пример: модель с 8 ГБ весов на карте с 1 ТБ/с даёт теоретический потолок около 125 токенов в секунду. Реальные цифры ниже из-за накладных расходов, но порядок величины понятен. Топовые потребительские карты на GDDR6X выдают порядка 700-1000 ГБ/с, серверные ускорители с HBM переваливают за 3 ТБ/с, поэтому крупные модели на них генерируют заметно быстрее.
Обратная сторона: обработка промпта (prefill) упирается в вычисления, а не в память, так что длинные входящие запросы ускоряются другими средствами. Как на практике объём загруженных в VRAM весов и длина контекста меняют скорость, разбирали на примере Qwen3.8-Flash-Next в llama.cpp в отдельном материале: почему загрузка в 96 ГБ VRAM ускоряет модель и что происходит с длинным контекстом.
Поддержка форматов квантования
Популярные форматы: GGUF для llama.cpp и производных, GPTQ и AWQ для GPU-бэкендов вроде vLLM и ExLlamaV2, bitsandbytes для обучения и QLoRA. Формат выбирает софт, а не карта, но от архитектуры зависит аппаратное ускорение: тензорные ядра NVIDIA начиная с Turing умеют INT8, Ada и Hopper добавили FP8.
Карта без аппаратной поддержки низкой точности всё равно запустит Q4-модель через llama.cpp: ядро распакует веса на лету. Часть выигрыша от квантования при этом останется на бумаге, а разница проявится в скорости, не в возможности запустить модель.
Тип интерфейса: PCIe и его версии
Для одной карты, в которую модель влезает целиком, интерфейс почти не влияет на генерацию: веса читаются из видеопамяти, а шина нужна на этапе загрузки, где узким местом скорее станет NVMe. Картина меняется, когда слои разложены по двум и более GPU: тогда на каждом токене часть данных ходит по PCIe, и режим x8/x8 или тем более x4 начинает резать скорость.
Как распределяются линии на конкретных платах X570 и X870 и что это даёт при инференсе, разбирали на примере двух Radeon 7900 XT и XTX: PCIe x8/x8, VRAM в llama.cpp и сравнение с USB4 eGPU. Внешние решения через USB4 или Thunderbolt теряют ещё больше: пропускная способность канала ниже, чем у PCIe 4.0 x4.
Практические сценарии: что открывается после апгрейда
Апгрейд стоит оценивать по набору задач, которые перестают раздражать. Главных сдвигов три: влезают модели крупнее, живёт длинный контекст, растёт скорость генерации.
Запуск крупных моделей (30B+)
Модель класса 27-34B в 4-битной квантизации занимает примерно 18-22 ГБ под веса. На карте с 24 ГБ она стартует полностью в VRAM: без offload, с предсказуемой задержкой и без провалов при смене промпта. Для карт с 12-16 ГБ такие модели остаются либо вне доступа, либо требуют выгрузки части слоёв в RAM.
Разница между 8B и 30B заметна там, где важна связность: длинный рефакторинг, разбор технического задания, генерация кода в несколько файлов, диалог с удержанием контекста. На простых задачах выигрыш скромнее, а цена в железе ощутимее.
Пример конфигурации под модель 27B в FP8 и MXFP4 с расчётом VRAM, KV-кэша и PCIe 5.0 x8 есть в разборе двух Radeon AI PRO R9700: локальный сервер на 2× Radeon AI PRO R9700 и 64 ГБ DDR5. Там же показано, когда две карты оправданы по сравнению с одной флагманской.
Увеличение контекста и работа с длинными документами
Контекст оплачивается памятью KV-кэша, расход растёт линейно с числом токенов. 32K контекста для модели со скромным KV-кэшем - это несколько гигабайт поверх весов, на 128K счёт идёт на десятки гигабайт.
Практический результат: с запасом VRAM можно скормить модели целиком техдокументацию, лог или книгу и задавать вопросы по разным её частям без пересказа истории. При нехватке памяти приходится резать контекст, а значит терять связи между началом и концом документа.
KV-кэш умеют квантизовать, например в 8 бит: это экономит память, и цена по качеству зависит от модели. У одних падение почти незаметно, у других проявляется на длинных цепочках рассуждений. Проверять это нужно на своих задачах, а не по общей таблице.
Ускорение генерации и интерактивность
Скорость генерации определяется пропускной способностью памяти и тем, сколько слоёв ушло в offload. Пока модель целиком в VRAM, переход с карты на 8 ГБ на карту с 24 ГБ и высокой пропускной способностью даёт кратный рост токенов в секунду, потому что исчезает прогон слоёв через CPU. Точные цифры зависят от модели, бэкенда и квантования: называть «в 5 раз быстрее» без замера конкретной пары карт было бы некорректно.
Второй эффект менее очевидный: с ростом скорости становится практичным более точное квантование. Если Q4 выдаёт 4 токена в секунду, на Q6 будет 2-3, и такой режим никто не включит. Когда в запасе есть VRAM и пропускная способность, 5-6 бит превращаются из компромисса на грани терпения в рабочий вариант.
Где остаются ограничения даже после апгрейда
Модели 70B и выше: предел потребительских GPU
70B в 4-бит требует 35-40 ГБ только под веса. Одна потребительская карта с 24 ГБ этого не закрывает независимо от цены. Рабочие варианты: две-три карты с раскладкой слоёв по VRAM, выгрузка в RAM с падением до единиц токенов в секунду либо облако.
Существуют проекты, поднимающие совсем крупные модели на скромной памяти: в сообществе обсуждают Colibri, запускающий модель на 744 млрд параметров при 24 ГБ ОЗУ за счёт подкачки весов. Это работает, но скорость и задержка уходят в область экспериментов, а не ежедневной работы.
Качество vs скорость: компромисс квантования
Квантование не бесплатное. Q4 экономит память, но на сложных задачах (математика, длинные цепочки рассуждений, код на редких языках) деградация накапливается. Более высокие биты требуют больше памяти и снижают скорость генерации. Апгрейд GPU сдвигает точку, где вы вынуждены экономить, сам выбор при этом остаётся.
Практическое правило: для чата и суммаризации Q4 обычно достаточно, для reasoning-моделей и кода разница между Q4 и Q6 бывает заметна на длинных ответах.
Программные ограничения и оптимизация
Железо без софта не ускоряет ничего. llama.cpp, ExLlamaV2, vLLM, TensorRT-LLM и ollama по-разному используют одну и ту же карту: одни лучше работают с одной сессией, другие с батчингом, третьи требуют конкретных архитектур для FlashAttention и быстрых ядер.
Свежая карта на новой архитектуре первое время проигрывает прошлому поколению, потому что ядра под неё ещё не оптимизированы. Через несколько месяцев картина меняется. Апгрейд сам по себе не даёт прироста, если вы остались на старом бэкенде и дефолтных настройках.
Пример из сообщества: заявление paulqq
Пост paulqq - короткое заявление: человек больше не относит себя к GPU poor, к публикации приложено изображение со ссылкой на Reddit. Ни модели карты, ни объёма VRAM, ни замеров скорости там нет.
Ценность этого поста в другом: выход из категории люди фиксируют субъективно, по ощущению «перестало не хватать». Кто-то перешёл с 8 на 16 ГБ и закрыл свои задачи, кто-то собрал систему на 48 ГБ и всё равно упирается в 70B. Проверить, где находитесь вы, можно только на своих моделях и своих сценариях.
Практический вывод из таких постов один: сравнивайте не карты между собой, а список задач, которые хотите закрывать.
Как оценить своё железо и решить, нужен ли апгрейд
Инструменты для проверки
Объём и загрузку VRAM показывают nvidia-smi для NVIDIA и rocm-smi для AMD, в Windows - вкладка производительности в диспетчере задач, для детальных характеристик подойдёт GPU-Z. Пропускную способность памяти измерять не нужно: она указана в спецификации карты.
Проверять стоит поведение на вашей модели. llama.cpp и ollama при загрузке пишут, сколько слоёв отдано на GPU и сколько осталось на CPU. Если в логе видно offload, вы уже за границей комфорта, даже когда чат отвечает.
Второй шаг - оценка требуемой памяти до запуска. Сервисы проверки влезаемости периодически закрываются или теряют актуальность, поэтому считать надёжнее руками, с учётом весов, квантования, KV-кэша, контекста и CPU-offload: как самостоятельно оценить память локальной LLM.
Когда апгрейд оправдан, а когда нет
Признаки того, что апгрейд имеет смысл: модель нужного класса не влезает даже в Q4; вы ловите offload на длинных промптах; генерация идёт медленнее чтения; вы упираетесь в контекст, а не в качество ответов. Если всё перечисленное не про вас, деньги лучше оставить в покое.
Перед покупкой пройдитесь по альтернативам: сменить квантование, снизить контекст, перейти на другой бэкенд, арендовать GPU на время или отдать тяжёлые задачи облачному API. Часто выигрыш даёт настройка, а не железо.
Если решение об апгрейде принято, бюджет задаёт свои ограничения. Как выбирать карту до $700, что проверять у модифицированных версий и почему объём VRAM нельзя считать без KV-кэша и runtime, разобрано отдельно: бюджетная GPU для локальных LLM в 2026.