Перейти к содержанию
Публикация AiManual

Tesla P100 за $100 для локального AI: реальный опыт, цифры и ограничения

Пользователь купил Tesla P100 16GB примерно за $100 и после патчей для llama.cpp получил 54-60 токенов/с на прозе и 66-72 на коде. Разбираем цифры, полную стоим

Коротко

Что будет в материале

  1. 01

    Почему Claude отговаривал от P100, и почему это не приговор

  2. 02

    Сколько стоит P100 16GB и что ещё понадобится

  3. 03

    P100 против RX 6600 XT: цифры до и после

  4. 04

    Патчи shinbunbun и --n-cpu-moe: как выжать скорость из P100

16 ГБ Tesla P100 продаётся дешевле $100 и на реальных замерах выдаёт 54-60 токенов/с на прозе и 66-72 токена/с на коде. Цифры получены в llama.cpp с моделью Qwen3.6 35B A3B в квантовании UD_Q4_K_XL, включённым MTP и параметром --n-cpu-moe 22. Пользователь, который их опубликовал, перед покупкой спросил совета у Claude и услышал, что карта «абсолютно не стоит» своих денег.

Короткий ответ на главный вопрос: 16 ГБ VRAM за $100 с производительностью 55-70 токенов/с на MoE-модели класса 35B - рабочая история, но она требует подготовки. Патчи для llama.cpp, блок питания с подходящими разъёмами, активный обдув пассивной серверной карты и настройка BIOS входят в комплект. Без них роста скорости не будет, а проблем прибавится.

Ниже разбор по цифрам: что именно говорят против P100, сколько стоит вход целиком, как карта обошла RX 6600 XT, что дают патчи shinbunbun и где заканчиваются возможности этой платформы.

Почему Claude отговаривал от P100, и почему это не приговор

Разговор с Claude закончился вердиктом «абсолютно не стоит». Аргументы звучали убедительно: нет tensor cores, слабая поддержка int4/int8, отсутствие BF16, особые требования к питанию, опция Above 4G decoding в BIOS и полуэкзотическое охлаждение. Пользователь на время отказался от идеи и занялся настройкой RX 6600 XT в отчёте на r/LocalLLaMA.

Что именно говорит Claude: список претензий

Претензии сводились к шести пунктам:

  • нет tensor cores;
  • слабая поддержка int4/int8;
  • нет BF16;
  • нужны особые условия по питанию;
  • нужна опция Above 4G decoding в BIOS;
  • нужно полуэкзотическое охлаждение.

На практике это означает вот что. Без tensor cores карта не ускоряет матричные операции специализированными блоками, поэтому квантованные в int4 и int8 веса обрабатываются медленнее, чем на картах с этими блоками. BF16 не поддерживается аппаратно, и модель в этом формате на P100 просто не запустится. Питание и охлаждение - отдельная история: карта рассчитана на серверный продув и серверные разъёмы, а не на корпус под столом.

Ни один из этих пунктов не блокирует запуск квантованной модели в llama.cpp. GGUF-модель вроде UD_Q4_K_XL считается на обычных CUDA-ядрах, BF16 ей не нужен, а питание и охлаждение решаются деньгами и 3D-принтером. Ограничения реальны, но они про настройку, а не про принципиальную неработоспособность.

Почему категоричность frontier-моделей не всегда оправдана

Claude выдал корректный технический список и слишком широкий итоговый вывод. Причина в том, как такие модели строят ответ: они опираются на усреднённые данные и выбирают безопасную позицию. «Возьмите карту с tensor cores» звучит безобидно и почти всегда правильно. К бюджетному сегменту это правило применяют без оговорок.

Модель не знает про патчи от разработчика shinbunbun для llama.cpp. Не знает, что человек готов возиться с BIOS и печатать корпус для вентилятора. Не видит цифр после настройки. Отсюда категоричность, которая в конкретном сценарии оказывается лишней: тот же пользователь всё равно купил P100 и получил заметный рост скорости генерации.

Совет AI-модели по железу - это отправная точка для проверки, а не финальное решение. Особенно когда речь о б/у датацентровых картах, где половина результата зависит от сообщества.

Сколько стоит P100 16GB и что ещё понадобится

В начале года 16-гигабайтные Tesla P100 уходили по $60-80. К моменту покупки цена выросла примерно на $15 по всем предложениям, но карта всё ещё доступна дешевле $100 согласно тому же отчёту.

На этом расходы не заканчиваются. Реальный бюджет входа складывается из трёх позиций: сама карта, блок питания с нужными разъёмами и охлаждение. С ценами на момент публикации это примерно $150-200, если подходящего БП и кулера под рукой нет.

Питание: какой БП нужен и сколько это стоит

P100 рассчитана на серверное питание, и на старых потребительских блоках нужных коннекторов обычно нет. Автор купил новый БП с подходящими разъёмами за $100, взяв запас по мощности. Варианты от хороших брендов он встречал от $60. Перед покупкой стоит проверить две вещи: наличие нужных кабелей и запас по мощности для всей системы. Старый блок, скорее всего, придётся менять.

Охлаждение: 3D-печатный корпус и вентилятор Noctua

Tesla P100 - пассивная карта: собственного вентилятора у неё нет, в сервере её продувает общий поток корпуса. Дома этот поток нужно чем-то заменить. Автор напечатал на 3D-принтере корпус под 94-мм вентилятор Noctua. Его собственная оценка: статического давления вентилятора не хватает на этапе prefill, зато для генерации его более чем достаточно.

Что это значит на практике. Короткие промпты и обычный чат перегрева не вызовут. Длинный prefill (обработка документа на десятки тысяч токенов) нагружает карту сильнее, и 94-мм Noctua может не справиться. Более производительный вентилятор, турбина или водяное охлаждение решают вопрос, но добавляют расходов и шума.

P100 против RX 6600 XT: цифры до и после

До покупки P100 автор использовал RX 6600 XT и настраивал её в llama.cpp. Обе конфигурации гонялись на одной модели, и это делает сравнение осмысленным.

КонфигурацияPP, 0 контекстаPP, 10kTG, прозаTG, код
RX 6600 XT, флаг --cpu-moe~800 ток/с~700 ток/с30-35 ток/с45-50 ток/с
Tesla P100, патчи shinbunbun, --n-cpu-moe 22~600 ток/с440-500 ток/с54-60 ток/с66-72 ток/с

TG вырос примерно в 1,7-1,8 раза на прозе и в 1,5 раза на коде. PP просел: с ~800 до ~600 на нулевом контексте и до 440-500 на 10 тысячах токенов по замерам из отчёта.

Методика теста: модель, настройки, контекст

Модель Qwen3.6 35B A3B в квантовании UD_Q4_K_XL, MTP включён в обоих случаях. На RX 6600 XT использовался параметр --cpu-moe, на P100 - --n-cpu-moe 22. Замеры сделаны при нулевом контексте и на 10 000 токенов. Это бытовые замеры в llama.cpp, а не синтетический бенчмарк, поэтому цифры зависят от сборки, версии фреймворка и применённых патчей.

Что означают PP и TG для пользователя

PP (prompt processing) - скорость обработки промпта. Она определяет, сколько ждать перед первым токеном ответа: важно для длинных запросов, RAG и работы с документами. TG (token generation) - скорость генерации, то есть темп самого диалога.

Падение PP с ~800 до ~600 токенов/с выглядит неприятно, но в абсолюте это доли секунды на промпте в тысячу токенов. В пересчёте на 10 тысяч токенов разница доходит до нескольких секунд. Рост TG с 30-35 до 54-60 токенов/с человек замечает сразу: текст появляется быстрее, чем его успеваешь читать. Для чата и генерации кода TG важнее, чем PP.

Патчи shinbunbun и --n-cpu-moe: как выжать скорость из P100

Без дополнительных патчей P100 в llama.cpp работает неоптимально. Рост TG, о котором шла речь выше, получен с патчами от разработчика shinbunbun.

Что дают патчи shinbunbun на практике

Патчи добавляют поддержку архитектуры Pascal и улучшают работу с квантованными моделями. Без них такого роста TG, скорее всего, не было бы. Официальной поддержкой это не назвать: патчи собираются из исходников, могут ломаться при обновлении llama.cpp и требуют навыков работы с git и сборкой. Зато именно этот фактор Claude в своём ответе не учёл.

Как --n-cpu-moe влияет на контекст и скорость

Qwen3.6 35B A3B - модель со смесью экспертов (MoE). Параметр --n-cpu-moe управляет тем, сколько слоёв MoE остаётся на CPU, а не грузится в VRAM. Чем больше слоёв уйдёт на процессор, тем больше видеопамяти освободится под контекст и тем медленнее пойдёт генерация.

Автор выставил 22, чтобы уместить 32k контекста. Это компромисс, а не оптимум: меньше значение - выше TG и меньше контекст, больше значение - контекст влезает, а генерация замедляется. Универсального числа нет, настройка подбирается под сценарий.

Ограничения P100, о которых стоит знать до покупки

Список проблем, с которым столкнётся покупатель, короткий, но обязательный к прочтению.

  • Нет BF16. Модели в этом формате на P100 не запустятся, работают только квантованные версии.
  • Нет tensor cores. int4 и int8 обрабатываются медленнее, чем на картах с этими блоками.
  • Питание. Нужен блок с подходящими разъёмами и запасом мощности.
  • Охлаждение. Карта пассивная, нужен активный обдув.
  • BIOS. Без Above 4G decoding карта может не определиться.
  • Контекст. 32k - комфортный практический предел при текущих настройках.

Above 4G decoding и другие BIOS-настройки

Above 4G decoding позволяет системе адресовать больше 4 ГБ памяти для устройств PCIe. Без этой опции P100 может не определиться или работать нестабильно. Включают её в BIOS до установки карты. Отдельный момент: P100 не поддерживает PCIe Gen4, так что на пропускную способность новой шины рассчитывать не стоит.

Контекст 32k: почему не больше

Автор держит 32k контекста, потому что его рабочий сценарий редко переваливает за 30k токенов. Формально можно вместить больше, подняв --n-cpu-moe, но за это придётся заплатить скоростью генерации. Если задача требует контекста 128k, P100 - не тот инструмент.

Есть и другая цифра из отдельного режима: с настройкой IQ3_K_XL автор получает около 9 токенов/с при включённом MTP и практически без реального контекста. В этом сценарии P100 комфортной скорости не даёт, и на фоне 54-60 токенов/с из основного сравнения он выглядит плохо.

Кому подходит P100 в 2026 году, а кому нет

Сценарии, где P100 раскрывается

  • Чат с MoE-моделью класса 35B на 54-60 токенах/с.
  • Генерация кода на 66-72 токенах/с.
  • Локальный ассистент без облака с контекстом до 32k.
  • Эксперименты с MoE-моделями и параметром --n-cpu-moe.

Автор заказал вторую P100, чтобы полностью выгрузить модель на GPU и, возможно, начать эксперименты с Qwen 3.8 27B. Помогает ли разделение модели, которая и так помещается на одну карту, между двумя GPU, он пока не знает: это новая для него территория. Значит, даже автор ещё не выжал из связки всё.

Когда лучше смотреть на другие варианты

Нужен BF16 - мимо. Нужен контекст 128k и больше - мимо. Нужен plug-and-play без сборки патчей и печати корпусов - тоже мимо. Если бюджет позволяет взять карту с tensor cores, она будет быстрее и проще в настройке.

Тем, кто рассматривает именно б/у датацентровое железо, есть что сравнить. Например, майнинговые CMP 170HX, которые переделывают под AI-задачи: разбор модификации с 8 до 64 ГБ HBM2e. Практический кейс сборки на четырёх таких картах с 256 ГБ VRAM и замерами в llama.cpp разобран в отдельном материале. Ещё один сюжет оттуда же: разгон памяти CMP 170HX поднял пропускную способность с 1386,2 до 1890,1 ГБ/с и ускорил генерацию в Qwen 3.8 27B со 110 до 202 токенов/с, что показывает, насколько такие карты чувствительны к частоте памяти по данным отчёта о разгоне. Возни эти карты требуют не меньше, чем P100, зато дают другой объём памяти.

Главное: проверяйте советы AI-моделей на практике

История с P100 повторяет обычный паттерн. Frontier-модель выдаёт технически верный список ограничений, а вывод делает слишком широкий. Пользователь получает «не берите» там, где правильный ответ звучит как «берите, если готовы к настройке».

Проверять такие советы стоит цифрами. Метрики PP и TG, замеренные на своей модели и в своей сборке, говорят больше, чем общая рекомендация. Как читать подобные заявления о производительности GPU и отделять полезные цифры от маркетинга, разбирали в материале про «100% эффективности».

P100 за $100 не идеальная карта. У неё нет BF16, она не тянет длинный контекст без потери скорости, ей нужен обдув и подходящий блок питания. При этом на реальных замерах она обошла RX 6600 XT по скорости генерации в 1,5-1,8 раза, а автор уже заказал вторую. Если есть время на патчи, BIOS и 3D-печать, $150-200 за вход в локальный инференс с 16 ГБ VRAM - разумная сделка. Если времени нет, смотрите на карты с tensor cores и активным охлаждением.

Все цифры в статье взяты из одного пользовательского отчёта и на другой конфигурации могут отличаться.

Подписаться на канал