Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

GLM 5.2 3-bit: Бенчмарк скорости на гибридной конфигурации CPU+GPU за $900

Тестируем 3-битную GLM 5.2 на системе с 4×Xeon E5-8880 v4, 1 ТБ DDR3 и двумя RTX 3060 12 ГБ. Инференс 44 токена/с, генерация 8 токенов/с при контексте 20K. Счит

Коротко

Что будет в материале

  1. 01

    Результаты теста: 44 токена/с на инференсе, 8 токенов/с на генерации

  2. 02

    Тестовая конфигурация: железо за $900 и его роль в инференсе

  3. 03

    Анализ скорости: почему 8 токенов/с - это нормально для такой системы

  4. 04

    Метрика стоимость/производительность: насколько оправданы $900

Результаты теста: 44 токена/с на инференсе, 8 токенов/с на генерации

Пользовательский тест 3-битной версии GLM 5.2 на системе с 4×Xeon E5-8880 v4, 1 ТБ DDR3 и двумя RTX 3060 12 ГБ дал конкретные цифры. При длине контекста 20 000 токенов скорость префилла составила 44 токена в секунду. Генерация текста шла на 8 токенах в секунду.

Эти цифры сразу расставляют приоритеты. 44 tok/s на обработке промпта - показатель, достаточный для загрузки больших объёмов текста без длительного ожидания. 8 tok/s на декодировании - скорость, при которой ответ из 200 токенов формируется за 25 секунд. Для исследовательских задач и пакетной обработки это приемлемо. Для интерактивного чата - на грани комфорта.

Стоимость всей сборки - около $900. В пересчёте на производительность получаем 0.11 доллара за 1 tok/s генерации. Это один из самых дешёвых способов запустить модель такого размера локально, но с оговорками по отзывчивости.

Тестовая конфигурация: железо за $900 и его роль в инференсе

Система собрана из бывших в употреблении серверных компонентов. Четыре процессора Xeon E5-8880 v4 с 22 ядрами каждый дают 88 физических ядер. Терабайт оперативной памяти DDR3 распределён между всеми сокетами. Две видеокарты RTX 3060 с 12 ГБ VRAM каждая подключены через PCIe 3.0.

Распределение нагрузки выглядит так: основная часть весов модели размещается в оперативной памяти и обрабатывается центральными процессорами. GPU берут на себя отдельные вычислительно плотные слои, где параллелизм CUDA-ядер даёт ускорение. Это классическая гибридная схема - CPU как основной исполнитель, GPU как ускоритель узких мест.

Конфигурация не сбалансирована в привычном понимании. 1 ТБ DDR3 с пропускной способностью около 50-60 ГБ/с на сокет - серьёзное ограничение. Для сравнения: одна RTX 3060 имеет пропускную способность видеопамяти 360 ГБ/с. Но 12 ГБ VRAM не вместят модель, которая в 3-битном квантовании занимает около 150 ГБ. Отсюда и гибридный подход.

Почему 4×Xeon и 1 ТБ DDR3, а не просто мощный GPU?

Одна RTX 4090 за те же $900 имеет 24 ГБ видеопамяти. Этого хватит на 7-13B модели в 4-битном квантовании, но GLM 5.2 - модель на порядок крупнее. Даже в 3-битном формате ей требуется более 140 ГБ памяти. Покупка GPU с таким объёмом VRAM - это A100 80GB или H100, цены на которые начинаются от $10 000.

Серверная платформа с четырьмя Xeon и терабайтом DDR3 решает проблему объёма памяти радикально дёшево. Б/у модули DDR3 REG ECC стоят около $1 за гигабайт. Четыре процессора E5-8880 v4 обходятся в $80-120 за штуку. Материнская плата с четырьмя сокетами - ещё $200-300. В сумме выходит $700-900 за систему с 1 ТБ ОЗУ.

Этот подход оправдан для моделей от 100B параметров и выше. Когда объём памяти - главное ограничение, а не пиковая вычислительная мощность, старые серверные платформы становятся единственным бюджетным вариантом. Мы уже разбирали похожие кейсы - например, запуск GLM-5.2 на 16 AMD MI50 показал, что даже устаревшие ускорители дают 12.2 tok/s при правильной настройке RPC.

Анализ скорости: почему 8 токенов/с - это нормально для такой системы

Ожидать от сборки на DDR3 скоростей, сравнимых с GPU-инференсом, не приходится. Пропускная способность памяти - главный тормоз. Четыре канала DDR3-1866 на сокет дают теоретический максимум около 60 ГБ/с. На практике, с учётом NUMA-переходов между сокетами, эффективная пропускная способность падает до 30-40 ГБ/с.

GLM 5.2 в 3-битном квантовании при каждом токене генерации читает примерно 150 ГБ весов. При 30 ГБ/с эффективной пропускной способности только чтение весов занимает 5 секунд на токен. То, что система выдаёт 8 tok/s, говорит о хорошей работе кэша и частичной разгрузке на GPU. Без видеокарт скорость была бы в 3-4 раза ниже.

44 tok/s на префилле - более оптимистичный показатель. Обработка промпта лучше параллелится по ядрам, а вычислительная нагрузка на токен выше, что позволяет эффективнее использовать GPU. Две RTX 3060 вносят заметный вклад именно на этапе префилла.

Влияние 3-битного квантования на скорость и качество

3-битное квантование сжимает каждый параметр модели до 3 бит вместо 16. Веса упаковываются плотнее, что снижает требования к памяти примерно в 5 раз. GLM 5.2 в оригинале заняла бы около 700 ГБ, а в 3-битном формате умещается в 140-150 ГБ - как раз под конфигурацию с 1 ТБ ОЗУ.

Плата за сжатие - потеря точности. 3 бита дают всего 8 градаций значений. Модель огрубляет представление весов, что может проявляться в повторах, потере связности длинных ответов, ошибках в фактической информации. Субъективные наблюдения из теста не приводятся, но общая практика показывает: 3-битные версии крупных моделей сохраняют базовую логику и структуру ответов, но уступают 4-битным и 8-битным в детальности и точности.

Для задач суммаризации, классификации, извлечения фактов 3-битное квантование часто достаточно. Для генерации кода или творческих текстов деградация заметнее. Выбор формата - компромисс между возможностями железа и требованиями к качеству.

Метрика стоимость/производительность: насколько оправданы $900

Считаем прямо. 8 токенов в секунду генерации - это 480 токенов в минуту, 28 800 токенов в час. При непрерывной нагрузке система выдаёт около 690 000 токенов в сутки. Стоимость $900, делённая на производительность, даёт $0.0013 за 1 000 токенов генерации в первый месяц. Через год эта цифра падает до $0.0001 за 1 000 токенов.

Сравним с облачными API. OpenAI GPT-4o стоит около $10 за 1M выходных токенов, или $0.01 за 1 000 токенов. Локальная система окупается после генерации 90 миллионов токенов - примерно 3-4 месяца непрерывной работы. Для исследовательских задач с интенсивным использованием это выгодно.

Альтернатива в том же бюджете - одна RTX 3090 с 24 ГБ за $700-800. Она даст 50-80 tok/s на 7-13B моделях, но не запустит GLM 5.2 ни в каком виде. Выбор между скоростью на малых моделях и возможностью работать с большими - принципиальный. Гибридная сборка решает задачу доступа к крупным моделям, жертвуя скоростью.

Для более глубокого понимания компромиссов при сборке бюджетных систем полезен разбор конфигурации на RTX 5070 Ti с 64 ГБ ОЗУ, где показан подбор моделей под конкретные задачи и настройка llama.cpp для максимальной производительности.

Потенциал разгона: можно ли выжать больше из этой конфигурации

Разгон серверных Xeon E5-8880 v4 ограничен заблокированным множителем. Доступна только настройка базовой частоты через BCLK, что даёт прирост 3-5% при стабильной работе. Более перспективно направление - оптимизация таймингов DDR3. Серверная память REG ECC обычно работает на консервативных таймингах CL11-CL13. Ручная настройка до CL9-CL10 может дать 5-7% прироста пропускной способности.

RTX 3060 поддаются андервольтингу и небольшому разгону памяти. Снижение напряжения на ядре при сохранении частот уменьшает тепловыделение, а разгон VRAM на 500-800 МГц добавляет 5-10% пропускной способности. Суммарный эффект от всех мер - 10-20% прироста скорости. 8 tok/s могут превратиться в 9-9.5 tok/s.

Программные оптимизации: что можно сделать прямо сейчас

Без разгона доступны настройки инференс-движка. В llama.cpp ключевые параметры: -t 88 - количество потоков под все физические ядра, -ngl 40 - выгрузка 40 слоёв на GPU, -sm row - разделение вычислений по строкам матриц для лучшего использования кэша. Эксперименты с -ctk q8_0 и -ctv q8_0 - квантование KV-кэша - могут сэкономить память и ускорить обработку длинных контекстов.

Параметр --numa включает привязку потоков к NUMA-узлам, что критично для четырёхсокетной системы. Без него часть запросов к памяти идёт через межсокетные шины QPI, удваивая задержки. Правильная настройка NUMA может дать 15-25% прироста на генерации.

Более радикальный вариант - переход на vLLM с бэкендом CPU. Проект развивает поддержку инференса на процессорах с оптимизациями под AVX-512, которые есть в E5-8880 v4. Потенциальный прирост - до 30% на префилле за счёт лучшего использования векторных инструкций.

Выводы: для каких задач подходит такая система

Сборка за $900 с 4×Xeon, 1 ТБ DDR3 и двумя RTX 3060 решает конкретную задачу: запуск больших моделей без доступа к дорогим GPU. GLM 5.2 в 3-битном квантовании работает с достаточной для многих сценариев скоростью.

Система подходит для пакетной обработки текстов, офлайн-инференса на массивах данных, экспериментов с промптами, исследовательского прототипирования. В этих сценариях задержка в 25 секунд на ответ не критична, а объём памяти позволяет загружать контексты до 128K токенов.

Для интерактивных чат-ботов, голосовых ассистентов, real-time приложений 8 tok/s недостаточно. Пользователь ожидает ответа за 1-3 секунды, что требует минимум 30-40 tok/s. Здесь нужны другие решения - например, сборки на нескольких GPU с большим объёмом VRAM, подобные тем, что мы разбирали в тесте кластера из AMD MI50 и NVIDIA P40.

Главная ценность конфигурации - доступ к крупным моделям за минимальные деньги. Исследователи, студенты, энтузиасты получают платформу для работы с GLM 5.2 и аналогичными моделями, не арендуя облачные инстансы за $3-5 в час. При интенсивном использовании система окупается за несколько месяцев и позволяет экспериментировать без оглядки на счёт за API.

Подписаться на канал