Результаты теста: 44 токена/с на инференсе, 8 токенов/с на генерации
Пользовательский тест 3-битной версии GLM 5.2 на системе с 4×Xeon E5-8880 v4, 1 ТБ DDR3 и двумя RTX 3060 12 ГБ дал конкретные цифры. При длине контекста 20 000 токенов скорость префилла составила 44 токена в секунду. Генерация текста шла на 8 токенах в секунду.
Эти цифры сразу расставляют приоритеты. 44 tok/s на обработке промпта - показатель, достаточный для загрузки больших объёмов текста без длительного ожидания. 8 tok/s на декодировании - скорость, при которой ответ из 200 токенов формируется за 25 секунд. Для исследовательских задач и пакетной обработки это приемлемо. Для интерактивного чата - на грани комфорта.
Стоимость всей сборки - около $900. В пересчёте на производительность получаем 0.11 доллара за 1 tok/s генерации. Это один из самых дешёвых способов запустить модель такого размера локально, но с оговорками по отзывчивости.
Тестовая конфигурация: железо за $900 и его роль в инференсе
Система собрана из бывших в употреблении серверных компонентов. Четыре процессора Xeon E5-8880 v4 с 22 ядрами каждый дают 88 физических ядер. Терабайт оперативной памяти DDR3 распределён между всеми сокетами. Две видеокарты RTX 3060 с 12 ГБ VRAM каждая подключены через PCIe 3.0.
Распределение нагрузки выглядит так: основная часть весов модели размещается в оперативной памяти и обрабатывается центральными процессорами. GPU берут на себя отдельные вычислительно плотные слои, где параллелизм CUDA-ядер даёт ускорение. Это классическая гибридная схема - CPU как основной исполнитель, GPU как ускоритель узких мест.
Конфигурация не сбалансирована в привычном понимании. 1 ТБ DDR3 с пропускной способностью около 50-60 ГБ/с на сокет - серьёзное ограничение. Для сравнения: одна RTX 3060 имеет пропускную способность видеопамяти 360 ГБ/с. Но 12 ГБ VRAM не вместят модель, которая в 3-битном квантовании занимает около 150 ГБ. Отсюда и гибридный подход.
Почему 4×Xeon и 1 ТБ DDR3, а не просто мощный GPU?
Одна RTX 4090 за те же $900 имеет 24 ГБ видеопамяти. Этого хватит на 7-13B модели в 4-битном квантовании, но GLM 5.2 - модель на порядок крупнее. Даже в 3-битном формате ей требуется более 140 ГБ памяти. Покупка GPU с таким объёмом VRAM - это A100 80GB или H100, цены на которые начинаются от $10 000.
Серверная платформа с четырьмя Xeon и терабайтом DDR3 решает проблему объёма памяти радикально дёшево. Б/у модули DDR3 REG ECC стоят около $1 за гигабайт. Четыре процессора E5-8880 v4 обходятся в $80-120 за штуку. Материнская плата с четырьмя сокетами - ещё $200-300. В сумме выходит $700-900 за систему с 1 ТБ ОЗУ.
Этот подход оправдан для моделей от 100B параметров и выше. Когда объём памяти - главное ограничение, а не пиковая вычислительная мощность, старые серверные платформы становятся единственным бюджетным вариантом. Мы уже разбирали похожие кейсы - например, запуск GLM-5.2 на 16 AMD MI50 показал, что даже устаревшие ускорители дают 12.2 tok/s при правильной настройке RPC.
Анализ скорости: почему 8 токенов/с - это нормально для такой системы
Ожидать от сборки на DDR3 скоростей, сравнимых с GPU-инференсом, не приходится. Пропускная способность памяти - главный тормоз. Четыре канала DDR3-1866 на сокет дают теоретический максимум около 60 ГБ/с. На практике, с учётом NUMA-переходов между сокетами, эффективная пропускная способность падает до 30-40 ГБ/с.
GLM 5.2 в 3-битном квантовании при каждом токене генерации читает примерно 150 ГБ весов. При 30 ГБ/с эффективной пропускной способности только чтение весов занимает 5 секунд на токен. То, что система выдаёт 8 tok/s, говорит о хорошей работе кэша и частичной разгрузке на GPU. Без видеокарт скорость была бы в 3-4 раза ниже.
44 tok/s на префилле - более оптимистичный показатель. Обработка промпта лучше параллелится по ядрам, а вычислительная нагрузка на токен выше, что позволяет эффективнее использовать GPU. Две RTX 3060 вносят заметный вклад именно на этапе префилла.
Влияние 3-битного квантования на скорость и качество
3-битное квантование сжимает каждый параметр модели до 3 бит вместо 16. Веса упаковываются плотнее, что снижает требования к памяти примерно в 5 раз. GLM 5.2 в оригинале заняла бы около 700 ГБ, а в 3-битном формате умещается в 140-150 ГБ - как раз под конфигурацию с 1 ТБ ОЗУ.
Плата за сжатие - потеря точности. 3 бита дают всего 8 градаций значений. Модель огрубляет представление весов, что может проявляться в повторах, потере связности длинных ответов, ошибках в фактической информации. Субъективные наблюдения из теста не приводятся, но общая практика показывает: 3-битные версии крупных моделей сохраняют базовую логику и структуру ответов, но уступают 4-битным и 8-битным в детальности и точности.
Для задач суммаризации, классификации, извлечения фактов 3-битное квантование часто достаточно. Для генерации кода или творческих текстов деградация заметнее. Выбор формата - компромисс между возможностями железа и требованиями к качеству.
Метрика стоимость/производительность: насколько оправданы $900
Считаем прямо. 8 токенов в секунду генерации - это 480 токенов в минуту, 28 800 токенов в час. При непрерывной нагрузке система выдаёт около 690 000 токенов в сутки. Стоимость $900, делённая на производительность, даёт $0.0013 за 1 000 токенов генерации в первый месяц. Через год эта цифра падает до $0.0001 за 1 000 токенов.
Сравним с облачными API. OpenAI GPT-4o стоит около $10 за 1M выходных токенов, или $0.01 за 1 000 токенов. Локальная система окупается после генерации 90 миллионов токенов - примерно 3-4 месяца непрерывной работы. Для исследовательских задач с интенсивным использованием это выгодно.
Альтернатива в том же бюджете - одна RTX 3090 с 24 ГБ за $700-800. Она даст 50-80 tok/s на 7-13B моделях, но не запустит GLM 5.2 ни в каком виде. Выбор между скоростью на малых моделях и возможностью работать с большими - принципиальный. Гибридная сборка решает задачу доступа к крупным моделям, жертвуя скоростью.
Для более глубокого понимания компромиссов при сборке бюджетных систем полезен разбор конфигурации на RTX 5070 Ti с 64 ГБ ОЗУ, где показан подбор моделей под конкретные задачи и настройка llama.cpp для максимальной производительности.
Потенциал разгона: можно ли выжать больше из этой конфигурации
Разгон серверных Xeon E5-8880 v4 ограничен заблокированным множителем. Доступна только настройка базовой частоты через BCLK, что даёт прирост 3-5% при стабильной работе. Более перспективно направление - оптимизация таймингов DDR3. Серверная память REG ECC обычно работает на консервативных таймингах CL11-CL13. Ручная настройка до CL9-CL10 может дать 5-7% прироста пропускной способности.
RTX 3060 поддаются андервольтингу и небольшому разгону памяти. Снижение напряжения на ядре при сохранении частот уменьшает тепловыделение, а разгон VRAM на 500-800 МГц добавляет 5-10% пропускной способности. Суммарный эффект от всех мер - 10-20% прироста скорости. 8 tok/s могут превратиться в 9-9.5 tok/s.
Программные оптимизации: что можно сделать прямо сейчас
Без разгона доступны настройки инференс-движка. В llama.cpp ключевые параметры: -t 88 - количество потоков под все физические ядра, -ngl 40 - выгрузка 40 слоёв на GPU, -sm row - разделение вычислений по строкам матриц для лучшего использования кэша. Эксперименты с -ctk q8_0 и -ctv q8_0 - квантование KV-кэша - могут сэкономить память и ускорить обработку длинных контекстов.
Параметр --numa включает привязку потоков к NUMA-узлам, что критично для четырёхсокетной системы. Без него часть запросов к памяти идёт через межсокетные шины QPI, удваивая задержки. Правильная настройка NUMA может дать 15-25% прироста на генерации.
Более радикальный вариант - переход на vLLM с бэкендом CPU. Проект развивает поддержку инференса на процессорах с оптимизациями под AVX-512, которые есть в E5-8880 v4. Потенциальный прирост - до 30% на префилле за счёт лучшего использования векторных инструкций.
Выводы: для каких задач подходит такая система
Сборка за $900 с 4×Xeon, 1 ТБ DDR3 и двумя RTX 3060 решает конкретную задачу: запуск больших моделей без доступа к дорогим GPU. GLM 5.2 в 3-битном квантовании работает с достаточной для многих сценариев скоростью.
Система подходит для пакетной обработки текстов, офлайн-инференса на массивах данных, экспериментов с промптами, исследовательского прототипирования. В этих сценариях задержка в 25 секунд на ответ не критична, а объём памяти позволяет загружать контексты до 128K токенов.
Для интерактивных чат-ботов, голосовых ассистентов, real-time приложений 8 tok/s недостаточно. Пользователь ожидает ответа за 1-3 секунды, что требует минимум 30-40 tok/s. Здесь нужны другие решения - например, сборки на нескольких GPU с большим объёмом VRAM, подобные тем, что мы разбирали в тесте кластера из AMD MI50 и NVIDIA P40.
Главная ценность конфигурации - доступ к крупным моделям за минимальные деньги. Исследователи, студенты, энтузиасты получают платформу для работы с GLM 5.2 и аналогичными моделями, не арендуя облачные инстансы за $3-5 в час. При интенсивном использовании система окупается за несколько месяцев и позволяет экспериментировать без оглядки на счёт за API.