Перейти к содержанию
Публикация AiManual

Кластер из пяти майнинговых плат BC-250 за $800: 71 ГБ VRAM и Qwen3-Coder-Next Q4

Пять бывших майнинговых плат BC-250 дают около 71 ГБ VRAM и запускают Qwen3-Coder-Next Q4 за сумму меньше $800. Разбираем архитектуру стенда на 1Gb Ethernet, за

Коротко

Что будет в материале

  1. 01

    Что за стенд: пять BC-250, 71 ГБ VRAM и Qwen3-Coder-Next Q4

  2. 02

    Как устроена связка: основная плата, headless-узлы и 1Gb Ethernet

  3. 03

    Производительность Qwen3-Coder-Next Q4: 40 ток/с на 30k и 30 ток/с на 100k

  4. 04

    Ограничения и подводные камни: энергопотребление, сеть, масштабирование

Что за стенд: пять BC-250, 71 ГБ VRAM и Qwen3-Coder-Next Q4

Пользователь под ником /u/Ok-Breadfruit-3523 собрал инференс-стенд из пяти бывших майнинговых плат BC-250 и запустил на нём Qwen3-Coder-Next в квантовании Q4. Одна плата работает как основная, четыре остальные отдают ресурсы в headless-режиме. Суммарный объём видеопамяти: около 71 ГБ.

Заявленная скорость генерации: примерно 40 токенов в секунду при контексте 30k. На контексте 100k она проседает до ~30 токенов в секунду. Связь между платами идёт по встроенному 1Gb Ethernet, выделенной высокоскоростной сети в сборке нет. Всё вместе обошлось дешевле $800, по словам автора (пост на r/LocalLLaMA).

Важная оговорка: все цифры ниже взяты из одного сообщения пользователя и независимо не проверялись. Это опыт одного человека с конкретным набором железа, а не воспроизводимый бенчмарк. Автор отдельно отмечает, что решение крайне неэффективно по энергопотреблению, но конкретных ватт не приводит.

Ключевые цифры: VRAM, скорость, контекст, цена

ПараметрЗначение
Плат в стенде5 BC-250 (1 основная + 4 headless)
КорпусASRock на 12 юнитов
Суммарная VRAMоколо 71 ГБ
МодельQwen3-Coder-Next, квантование Q4
Скорость на контексте 30k~40 токенов в секунду
Скорость на контексте 100k~30 токенов в секунду
Сетьвстроенный 1Gb Ethernet на платах
Стоимостьменее $800
Проверка данныходин источник, независимых замеров нет

Пара 40 и 30 токенов в секунду - это две точки на одной кривой, а не два разных режима работы. Чем длиннее контекст, тем больше KV-кэша нужно держать в памяти и пересчитывать на каждом шаге генерации.

Почему это интересно: бюджетный локальный AI из списанного железа

BC-250 массово закупались под майнинг и сейчас продаются на вторичном рынке. Пять таких плат дают около 71 ГБ VRAM меньше чем за $800. Собрать сопоставимый объём памяти на новых потребительских GPU за эти деньги не получится.

Цена покупки при этом не равна стоимости владения. Железо прошлых поколений проигрывает современным ускорителям по производительности на ватт, гарантии на б/у платы нет, а BC-250 не рассчитаны на стандартный ATX-корпус. Здесь их разместили в серверном корпусе ASRock на 12 юнитов, то есть семь слотов пока свободны.

Автор указывает общую сумму менее $800, но не детализирует компоненты. Из поста неясно, входят ли в неё корпус, блоки питания и охлаждение. Время на настройку и отладку в стоимость тоже не заложено.

Как устроена связка: основная плата, headless-узлы и 1Gb Ethernet

Пять плат BC-250 стоят в корпусе ASRock на 12 юнитов. Одна из них работает как основная, остальные четыре - headless. Между собой они связаны через встроенный гигабитный Ethernet: ни InfiniBand, ни 10GbE в сборке нет.

Почему 1Gb Ethernet может быть достаточно для инференса

Гигабитный линк даёт около 125 МБ/с теоретического максимума, на практике меньше из-за накладных расходов TCP. Для обучения такое соединение почти всегда становится узким местом: между узлами постоянно ходят градиенты и синхронизируются параметры. Инференс устроен иначе. Если модель разбита по слоям и узлы обмениваются только активациями, объём трафика на один ток оказывается заметно меньше.

Именно поэтому 1Gb Ethernet здесь не выглядит абсурдом. Автор не уточняет, как именно распределена модель: по слоям, по тензорам или как-то ещё. Без этих деталей нельзя провести границу применимости такого соединения. Что известно точно: 40 токенов в секунду на контексте 30k получены именно на гигабитной сети.

Отдельный фактор - длина контекста. Каждый новый токен добавляется в KV-кэш, и состояние приходится синхронизировать между узлами. На 100k трафик выше, чем на 30k, поэтому часть просадки может давать сеть, а не только вычисления. Разбивки по вкладам автор не приводит, поэтому оценить долю сети невозможно.

Headless-режим: зачем он нужен и как настроить

Headless означает работу платы без монитора, клавиатуры и прочей периферии. Управление идёт по сети, обычно через SSH. Для кластера это удобно: не нужны пять мониторов и пять комплектов USB-устройств, а корпус заполняется плотнее.

Настройка сводится к базовым вещам: платы должны получить адреса в одной подсети, подняться без графической сессии и быть доступными с основной платы. Конкретных шагов автор не приводит, как и названия дистрибутива или софта для распределённого инференса. Конфигурация описана на уровне результата, а не инструкции, поэтому копировать вслепую нечего.

Корпус на 12 юнитов оставляет запас для роста: пять плат занимают меньше половины слотов, и две из них автор уже планирует задействовать.

Производительность Qwen3-Coder-Next Q4: 40 ток/с на 30k и 30 ток/с на 100k

Цифры простые: около 40 токенов в секунду на контексте 30k и примерно 30 токенов в секунду на 100k. Просадка составляет порядка 25%. Это данные одного пользователя, независимых замеров нет, а методика тестирования в источнике не описана: неизвестно, чем именно измерялась скорость и как формировался контекст.

Что значит 71 ГБ VRAM для Qwen3-Coder-Next Q4

Квантование Q4 хранит веса в 4 битах вместо 16 в FP16, то есть примерно вчетверо компактнее по весам. Экономия касается только весов: активации и KV-кэш остаются в более высокой точности. Поэтому 71 ГБ - это общий бюджет памяти, куда входят веса, кэш и промежуточные буферы, а не размер модели, умноженный на четыре.

Такого запаса хватает, чтобы держать Qwen3-Coder-Next в Q4 и одновременно расти по контексту до 100k. Называть 71 ГБ минимально необходимым объёмом нельзя: автор не показывает, сколько памяти занято на каждом этапе и какая часть остаётся свободной.

Для ориентира по масштабам: на 12 ГБ VRAM помещается Qwen3.8-Flash-Next в квантовании IQ3_XXS с контекстом до 128K, и там скорость держится на уровне 14-15 токенов в секунду. Семь десятков гигабайт открывают заметно более крупные модели.

Падение скорости с ростом контекста: почему так происходит

KV-кэш растёт линейно с длиной контекста. На 100k токенов он в разы больше, чем на 30k, и каждый сгенерированный токен требует обращения ко всему кэшу. На этапе decode узкое место смещается с арифметики на пропускную способность памяти: чем длиннее контекст, тем меньше токенов в секунду выдаёт та же самая система.

Поведение типичное для LLM. Схожая картина наблюдается и на куда более скромных конфигурациях: в упомянутом выше кейсе с 12 ГБ VRAM скорость падает с 14-15 до 11,3 токена в секунду при выходе на 90-100K контекста. Разница в том, что там абсолютные значения в три раза ниже.

Для генерации кода 30 токенов в секунду на 100k - рабочий, но не комфортный темп. Одиночные запросы такая скорость терпит, а агентные циклы с десятками последовательных вызовов начинают упираться в ожидание.

Ограничения и подводные камни: энергопотребление, сеть, масштабирование

Энергопотребление: почему решение «крайне неэффективно»

Автор называет сборку «wildly inefficient with power» и не приводит ни одного числа. Оценить потребление по источнику нельзя. Общий принцип известен: у железа прошлых поколений, рассчитанного на хеширование, производительность на ватт при тензорных вычислениях ниже, чем у современных ускорителей. Пять плат плюс корпус с охлаждением потребляют заметно больше одной видеокарты.

Практический вывод: при круглосуточной работе счёт за электричество быстро перекрывает экономию на покупке. Если тариф высокий, дешёвое железо перестаёт быть дешёвым. Точные цифры потребления BC-250 стоит искать в документации на конкретную ревизию платы, а не в этом кейсе.

Сеть 1Gb Ethernet: достаточно для старта, но ограничивает рост

Гигабитный линк даёт около 125 МБ/с в идеальных условиях. Пять плат на такой сети выдают 40 токенов в секунду на коротком контексте, значит пропускной способности пока хватает. Дальше начинаются риски: каждая новая плата увеличивает объём обмена, а модели с большим числом активных параметров на ток генерируют больше трафика.

Автор планирует добавить ещё две платы. Если скорость не вырастет пропорционально, это укажет на сеть или на слабое масштабирование распределённого инференса, а не на нехватку VRAM.

Планы автора: добавить ещё две платы и проверить скорость

У автора есть ещё две BC-250, и он собирается их запустить, чтобы посмотреть, пойдёт ли «3.8 flash next» на приемлемой скорости. Результатов пока нет. Прогнозировать не из чего: неизвестно ни итоговое потребление, ни поведение гигабитной сети при семи узлах.

Стоит ли повторять: кому подойдёт такой стенд и какие есть альтернативы

Стенд из пяти BC-250 - это эксперимент с понятной ценой входа и неочевидной ценой эксплуатации. Повторять его имеет смысл только осознанно и с расчётом на свои условия.

Кому такой подход может быть интересен

Сборка оправдана для технических энтузиастов, готовых возиться с настройкой. Для тех, у кого уже лежит парк майнинговых плат или есть доступ к дешёвым BC-250. Для тех, кому нужен большой объём VRAM под эксперименты с моделями, которые не влезают в одну карту. И для тех, у кого низкий тариф на электричество.

Не подойдёт тем, кому нужен стабильный рабочий инструмент на каждый день, кто платит за электричество по обычному тарифу и кто не готов отлаживать распределённый инференс. Скорость 30-40 токенов в секунду и отсутствие гарантии на платы делают сборку плохим кандидатом на роль основной рабочей машины.

Альтернативы: современные GPU, готовые серверы, облако

Современные потребительские GPU дают меньше VRAM за те же деньги, зато предсказуемо поддерживаются в llama.cpp, vLLM и других движках, требуют меньше ватт на токен и имеют гарантию.

Б/у серверные ускорители - промежуточный вариант. Пример из смежного кейса: домашний инференс-сервер за ~$3000 на четырёх Radeon V620 с 128 ГБ VRAM и EPYC 7452, где замеренное потребление доходит до 700-900 Вт на prefill и 500-600 Вт на decode. Дороже в разы, зато с понятной архитектурой и поддержкой со стороны софта.

Облако убирает капитальные затраты и расходы на электричество. Насколько это выгодно, зависит от объёма задач: запуск AliceAI-Foundation-80B на арендованных 4×A100 обошёлся примерно в 1000 ₽ при рабочей схеме, тогда как неудачная попытка стоила около 6000 ₽. Для разовых экспериментов почасовая аренда почти всегда дешевле покупки железа.

Готовые мини-серверы и рабочие станции дороже за гигабайт VRAM, но работают из коробки и не требуют возни с корпусом, питанием и headless-настройкой.

Что проверить, прежде чем повторять сборку:

  • Продаются ли BC-250 в вашем регионе и по какой цене сейчас.
  • Сколько ватт съест стенд и какой у вас тариф на электричество.
  • Поддерживает ли выбранный движок распределённый запуск на таком железе.
  • Есть ли корпус, блок питания и охлаждение под серверный форм-фактор.
  • Готовы ли вы к отсутствию гарантии на б/у платы.

Итоговая цифра 71 ГБ VRAM за $800 выглядит привлекательно на бумаге. Реальная стоимость складывается из электричества, времени на настройку и терпимости к скорости 30-40 токенов в секунду. Все измерения в этом кейсе принадлежат одному пользователю и требуют проверки на своём железе.

Подписаться на канал