16 ГБ Tesla P100 продаётся дешевле $100 и на реальных замерах выдаёт 54-60 токенов/с на прозе и 66-72 токена/с на коде. Цифры получены в llama.cpp с моделью Qwen3.6 35B A3B в квантовании UD_Q4_K_XL, включённым MTP и параметром --n-cpu-moe 22. Пользователь, который их опубликовал, перед покупкой спросил совета у Claude и услышал, что карта «абсолютно не стоит» своих денег.
Короткий ответ на главный вопрос: 16 ГБ VRAM за $100 с производительностью 55-70 токенов/с на MoE-модели класса 35B - рабочая история, но она требует подготовки. Патчи для llama.cpp, блок питания с подходящими разъёмами, активный обдув пассивной серверной карты и настройка BIOS входят в комплект. Без них роста скорости не будет, а проблем прибавится.
Ниже разбор по цифрам: что именно говорят против P100, сколько стоит вход целиком, как карта обошла RX 6600 XT, что дают патчи shinbunbun и где заканчиваются возможности этой платформы.
Почему Claude отговаривал от P100, и почему это не приговор
Разговор с Claude закончился вердиктом «абсолютно не стоит». Аргументы звучали убедительно: нет tensor cores, слабая поддержка int4/int8, отсутствие BF16, особые требования к питанию, опция Above 4G decoding в BIOS и полуэкзотическое охлаждение. Пользователь на время отказался от идеи и занялся настройкой RX 6600 XT в отчёте на r/LocalLLaMA.
Что именно говорит Claude: список претензий
Претензии сводились к шести пунктам:
- нет tensor cores;
- слабая поддержка int4/int8;
- нет BF16;
- нужны особые условия по питанию;
- нужна опция Above 4G decoding в BIOS;
- нужно полуэкзотическое охлаждение.
На практике это означает вот что. Без tensor cores карта не ускоряет матричные операции специализированными блоками, поэтому квантованные в int4 и int8 веса обрабатываются медленнее, чем на картах с этими блоками. BF16 не поддерживается аппаратно, и модель в этом формате на P100 просто не запустится. Питание и охлаждение - отдельная история: карта рассчитана на серверный продув и серверные разъёмы, а не на корпус под столом.
Ни один из этих пунктов не блокирует запуск квантованной модели в llama.cpp. GGUF-модель вроде UD_Q4_K_XL считается на обычных CUDA-ядрах, BF16 ей не нужен, а питание и охлаждение решаются деньгами и 3D-принтером. Ограничения реальны, но они про настройку, а не про принципиальную неработоспособность.
Почему категоричность frontier-моделей не всегда оправдана
Claude выдал корректный технический список и слишком широкий итоговый вывод. Причина в том, как такие модели строят ответ: они опираются на усреднённые данные и выбирают безопасную позицию. «Возьмите карту с tensor cores» звучит безобидно и почти всегда правильно. К бюджетному сегменту это правило применяют без оговорок.
Модель не знает про патчи от разработчика shinbunbun для llama.cpp. Не знает, что человек готов возиться с BIOS и печатать корпус для вентилятора. Не видит цифр после настройки. Отсюда категоричность, которая в конкретном сценарии оказывается лишней: тот же пользователь всё равно купил P100 и получил заметный рост скорости генерации.
Совет AI-модели по железу - это отправная точка для проверки, а не финальное решение. Особенно когда речь о б/у датацентровых картах, где половина результата зависит от сообщества.
Сколько стоит P100 16GB и что ещё понадобится
В начале года 16-гигабайтные Tesla P100 уходили по $60-80. К моменту покупки цена выросла примерно на $15 по всем предложениям, но карта всё ещё доступна дешевле $100 согласно тому же отчёту.
На этом расходы не заканчиваются. Реальный бюджет входа складывается из трёх позиций: сама карта, блок питания с нужными разъёмами и охлаждение. С ценами на момент публикации это примерно $150-200, если подходящего БП и кулера под рукой нет.
Питание: какой БП нужен и сколько это стоит
P100 рассчитана на серверное питание, и на старых потребительских блоках нужных коннекторов обычно нет. Автор купил новый БП с подходящими разъёмами за $100, взяв запас по мощности. Варианты от хороших брендов он встречал от $60. Перед покупкой стоит проверить две вещи: наличие нужных кабелей и запас по мощности для всей системы. Старый блок, скорее всего, придётся менять.
Охлаждение: 3D-печатный корпус и вентилятор Noctua
Tesla P100 - пассивная карта: собственного вентилятора у неё нет, в сервере её продувает общий поток корпуса. Дома этот поток нужно чем-то заменить. Автор напечатал на 3D-принтере корпус под 94-мм вентилятор Noctua. Его собственная оценка: статического давления вентилятора не хватает на этапе prefill, зато для генерации его более чем достаточно.
Что это значит на практике. Короткие промпты и обычный чат перегрева не вызовут. Длинный prefill (обработка документа на десятки тысяч токенов) нагружает карту сильнее, и 94-мм Noctua может не справиться. Более производительный вентилятор, турбина или водяное охлаждение решают вопрос, но добавляют расходов и шума.
P100 против RX 6600 XT: цифры до и после
До покупки P100 автор использовал RX 6600 XT и настраивал её в llama.cpp. Обе конфигурации гонялись на одной модели, и это делает сравнение осмысленным.
| Конфигурация | PP, 0 контекста | PP, 10k | TG, проза | TG, код |
|---|---|---|---|---|
RX 6600 XT, флаг --cpu-moe | ~800 ток/с | ~700 ток/с | 30-35 ток/с | 45-50 ток/с |
Tesla P100, патчи shinbunbun, --n-cpu-moe 22 | ~600 ток/с | 440-500 ток/с | 54-60 ток/с | 66-72 ток/с |
TG вырос примерно в 1,7-1,8 раза на прозе и в 1,5 раза на коде. PP просел: с ~800 до ~600 на нулевом контексте и до 440-500 на 10 тысячах токенов по замерам из отчёта.
Методика теста: модель, настройки, контекст
Модель Qwen3.6 35B A3B в квантовании UD_Q4_K_XL, MTP включён в обоих случаях. На RX 6600 XT использовался параметр --cpu-moe, на P100 - --n-cpu-moe 22. Замеры сделаны при нулевом контексте и на 10 000 токенов. Это бытовые замеры в llama.cpp, а не синтетический бенчмарк, поэтому цифры зависят от сборки, версии фреймворка и применённых патчей.
Что означают PP и TG для пользователя
PP (prompt processing) - скорость обработки промпта. Она определяет, сколько ждать перед первым токеном ответа: важно для длинных запросов, RAG и работы с документами. TG (token generation) - скорость генерации, то есть темп самого диалога.
Падение PP с ~800 до ~600 токенов/с выглядит неприятно, но в абсолюте это доли секунды на промпте в тысячу токенов. В пересчёте на 10 тысяч токенов разница доходит до нескольких секунд. Рост TG с 30-35 до 54-60 токенов/с человек замечает сразу: текст появляется быстрее, чем его успеваешь читать. Для чата и генерации кода TG важнее, чем PP.
Патчи shinbunbun и --n-cpu-moe: как выжать скорость из P100
Без дополнительных патчей P100 в llama.cpp работает неоптимально. Рост TG, о котором шла речь выше, получен с патчами от разработчика shinbunbun.
Что дают патчи shinbunbun на практике
Патчи добавляют поддержку архитектуры Pascal и улучшают работу с квантованными моделями. Без них такого роста TG, скорее всего, не было бы. Официальной поддержкой это не назвать: патчи собираются из исходников, могут ломаться при обновлении llama.cpp и требуют навыков работы с git и сборкой. Зато именно этот фактор Claude в своём ответе не учёл.
Как --n-cpu-moe влияет на контекст и скорость
Qwen3.6 35B A3B - модель со смесью экспертов (MoE). Параметр --n-cpu-moe управляет тем, сколько слоёв MoE остаётся на CPU, а не грузится в VRAM. Чем больше слоёв уйдёт на процессор, тем больше видеопамяти освободится под контекст и тем медленнее пойдёт генерация.
Автор выставил 22, чтобы уместить 32k контекста. Это компромисс, а не оптимум: меньше значение - выше TG и меньше контекст, больше значение - контекст влезает, а генерация замедляется. Универсального числа нет, настройка подбирается под сценарий.
Ограничения P100, о которых стоит знать до покупки
Список проблем, с которым столкнётся покупатель, короткий, но обязательный к прочтению.
- Нет BF16. Модели в этом формате на P100 не запустятся, работают только квантованные версии.
- Нет tensor cores. int4 и int8 обрабатываются медленнее, чем на картах с этими блоками.
- Питание. Нужен блок с подходящими разъёмами и запасом мощности.
- Охлаждение. Карта пассивная, нужен активный обдув.
- BIOS. Без Above 4G decoding карта может не определиться.
- Контекст. 32k - комфортный практический предел при текущих настройках.
Above 4G decoding и другие BIOS-настройки
Above 4G decoding позволяет системе адресовать больше 4 ГБ памяти для устройств PCIe. Без этой опции P100 может не определиться или работать нестабильно. Включают её в BIOS до установки карты. Отдельный момент: P100 не поддерживает PCIe Gen4, так что на пропускную способность новой шины рассчитывать не стоит.
Контекст 32k: почему не больше
Автор держит 32k контекста, потому что его рабочий сценарий редко переваливает за 30k токенов. Формально можно вместить больше, подняв --n-cpu-moe, но за это придётся заплатить скоростью генерации. Если задача требует контекста 128k, P100 - не тот инструмент.
Есть и другая цифра из отдельного режима: с настройкой IQ3_K_XL автор получает около 9 токенов/с при включённом MTP и практически без реального контекста. В этом сценарии P100 комфортной скорости не даёт, и на фоне 54-60 токенов/с из основного сравнения он выглядит плохо.
Кому подходит P100 в 2026 году, а кому нет
Сценарии, где P100 раскрывается
- Чат с MoE-моделью класса 35B на 54-60 токенах/с.
- Генерация кода на 66-72 токенах/с.
- Локальный ассистент без облака с контекстом до 32k.
- Эксперименты с MoE-моделями и параметром
--n-cpu-moe.
Автор заказал вторую P100, чтобы полностью выгрузить модель на GPU и, возможно, начать эксперименты с Qwen 3.8 27B. Помогает ли разделение модели, которая и так помещается на одну карту, между двумя GPU, он пока не знает: это новая для него территория. Значит, даже автор ещё не выжал из связки всё.
Когда лучше смотреть на другие варианты
Нужен BF16 - мимо. Нужен контекст 128k и больше - мимо. Нужен plug-and-play без сборки патчей и печати корпусов - тоже мимо. Если бюджет позволяет взять карту с tensor cores, она будет быстрее и проще в настройке.
Тем, кто рассматривает именно б/у датацентровое железо, есть что сравнить. Например, майнинговые CMP 170HX, которые переделывают под AI-задачи: разбор модификации с 8 до 64 ГБ HBM2e. Практический кейс сборки на четырёх таких картах с 256 ГБ VRAM и замерами в llama.cpp разобран в отдельном материале. Ещё один сюжет оттуда же: разгон памяти CMP 170HX поднял пропускную способность с 1386,2 до 1890,1 ГБ/с и ускорил генерацию в Qwen 3.8 27B со 110 до 202 токенов/с, что показывает, насколько такие карты чувствительны к частоте памяти по данным отчёта о разгоне. Возни эти карты требуют не меньше, чем P100, зато дают другой объём памяти.
Главное: проверяйте советы AI-моделей на практике
История с P100 повторяет обычный паттерн. Frontier-модель выдаёт технически верный список ограничений, а вывод делает слишком широкий. Пользователь получает «не берите» там, где правильный ответ звучит как «берите, если готовы к настройке».
Проверять такие советы стоит цифрами. Метрики PP и TG, замеренные на своей модели и в своей сборке, говорят больше, чем общая рекомендация. Как читать подобные заявления о производительности GPU и отделять полезные цифры от маркетинга, разбирали в материале про «100% эффективности».
P100 за $100 не идеальная карта. У неё нет BF16, она не тянет длинный контекст без потери скорости, ей нужен обдув и подходящий блок питания. При этом на реальных замерах она обошла RX 6600 XT по скорости генерации в 1,5-1,8 раза, а автор уже заказал вторую. Если есть время на патчи, BIOS и 3D-печать, $150-200 за вход в локальный инференс с 16 ГБ VRAM - разумная сделка. Если времени нет, смотрите на карты с tensor cores и активным охлаждением.
Все цифры в статье взяты из одного пользовательского отчёта и на другой конфигурации могут отличаться.