Что выбрать для локального AI: Zima Board 2 + RTX 2000 ADA или Mac Mini M5?
Zima Board 2 с установленной RTX 2000 ADA обходится примерно в $1100: около $411 за одноплатник и около $700 за видеокарту с 16 ГБ VRAM. Связка запускает модель уровня Qwen 27B через Ollama и даёт приемлемую для интерактивной работы скорость генерации токенов, при этом карта питается от штатного БП платы, а вся система занимает место на полке. Mac Mini M5 с 24 ГБ памяти доступен по предзаказу, даёт полноценный компьютер на macOS, но дискретной GPU в нём нет, поэтому скорость обработки промпта (prefill) с большой вероятностью окажется ниже.
Короткий ответ. Нужен самый дешёвый автономный endpoint под Qwen 27B и быстрый prefill на длинных запросах: выигрывает Zima Board 2 плюс RTX 2000 ADA. Нужна универсальная машина на каждый день, которая иногда запускает LLM: выигрывает Mac Mini M5. Опыт со сборкой на плате описан в видео Luke's Dev Lab, где карту подключили напрямую в PCIe-слот и получили работающий локальный сервер.
В сравнении участвуют только новые системы, которые можно купить или заказать сейчас. Б/у GPU на вторичке обошлись бы дешевле, но в этом разборе они не рассматриваются: для задач с длинным контекстом нужна предсказуемая скорость prefill, а у карт с неизвестной историей она непредсказуема.
| Параметр | Zima Board 2 + RTX 2000 ADA | Mac Mini M5, 24 ГБ |
|---|---|---|
| Цена | около $1100 (около $411 за плату, около $700 за карту) | в разборе не приводится, смотреть актуальный предзаказ |
| Память под модель | 16 ГБ VRAM | 24 ГБ unified memory, часть забирает система |
| Системная память | 16 ГБ RAM | 24 ГБ, общие с GPU |
| Накопитель | 64 ГБ eMMC плюс SATA-диск | штатный SSD, замена после покупки невозможна |
| Питание | штатный БП платы | штатный БП |
| Prefill на длинном промпте | ожидаемо выше за счёт дискретной GPU | ниже, GPU интегрирован в чип |
| Апгрейд | карта, накопитель, память в пределах возможностей платы | невозможен |
Zima Board 2 + RTX 2000 ADA: характеристики и стоимость
Zima Board 2 стоит около $411. В конфигурации: 16 ГБ оперативной памяти, 64 ГБ eMMC для системы, разъём SATA под дополнительный накопитель, Ethernet и слот PCIe для карты расширения. RTX 2000 ADA добавляет 16 ГБ VRAM и стоит около $700. Итого около $1100 за машину, которой для работы нужны только сеть и питание.
16 ГБ видеопамяти здесь ключевая цифра. Модель уровня Qwen 27B в 4-битной квантизации занимает ориентировочно 15-17 ГБ в зависимости от кванта, то есть в VRAM она укладывается впритык, а часть слоёв или KV-кэш уходит в системную память. 16 ГБ RAM у одноплатника для этого мало: заметную часть забирают ОС, драйверы и фоновые сервисы, под offload остаётся немного. Практический вывод: контекст придётся ограничивать, а 64 ГБ eMMC под модели закончатся быстро, поэтому SATA-диск в такой сборке нужен сразу.
В видео Luke's Dev Lab связка запускает модель через Ollama и выдаёт скорость, достаточную для диалога. Отдельный плюс: карта работает от штатной платы, дополнительный блок питания не нужен, сборка остаётся компактной и тихой.
Технические детали подключения RTX 2000 ADA к Zima Board 2
Карта встаёт напрямую в PCIe-слот Zima Board 2, без райзера и внешнего питания. Такой сценарий проходит из-за низкого энергопотребления модели ADA: линейка рассчитана на компактные рабочие станции, а не на игровые сборки с трёхслотовым охлаждением и дополнительными коннекторами.
Что проверить до покупки:
- Число линий PCIe у слота. Если ревизия платы отдаёт x4 вместо x8, загрузка модели в VRAM и обмен данными при offload замедлятся. На скорость генерации внутри VRAM это влияет слабо, на первый ответ после старта и на переключение моделей заметно.
- Совместимость по питанию. Штатного питания хватает именно этой карте; если планируется другая GPU, лимит придётся считать отдельно.
- Физические размеры и продув. Корпус одноплатника редко рассчитан на горячую карту, а при длительной генерации нагрев растёт. Открытая установка или корпус с вентилятором снимают вопрос.
- Драйверы. Для 16 ГБ VRAM и Ollama нужен рабочий NVIDIA-стек в Linux на этой плате; проверить это стоит до оплаты карты.
Mac Mini M5 с 24 ГБ: альтернатива от Apple
Mac Mini M5 с 24 ГБ памяти доступен по предзаказу. Это полноценный компьютер: macOS, порты Thunderbolt, штатное охлаждение, гарантия и никакой сборки. 24 ГБ unified memory делятся между системой и моделью, поэтому под веса остаётся меньше, чем 24 ГБ: часть занимает ОС, часть приложения и кэши.
Для Qwen 27B такой объём выглядит приемлемым при агрессивной квантизации, но запаса на длинный контекст почти нет. Как объём памяти влияет на выбор модели, разобрано в материале про локальную LLM на Mac со 128 ГБ: разница между небольшим и большим объёмом решается не скоростью, а тем, помещаются ли веса и KV-кэш целиком.
Вторая особенность - prefill. У Apple нет дискретной GPU с отдельной VRAM: вычисления идут на графических ядрах чипа, которые делят память с CPU. На длинных промптах это ограничивает скорость чтения контекста. Зато генерация на моделях, которые помещаются в память целиком, обычно ровная, а сама машина тихая и потребляет мало.
Апгрейд Mac Mini невозможен: память и накопитель выбираются один раз при заказе. Тот, кто через год захочет запускать модель крупнее, покупает новый компьютер.
Скорость генерации и prefill: как сравнивать системы
Две цифры, которые чаще всего путают при выборе железа, считаются по-разному. Скорость генерации в токенах в секунду - это число выходных токенов, делённое на время генерации, а не на общее время ответа. Время генерации равно общему времени ответа минус время до первого токена (TTFT). Пример: ответ занял 12,0 секунды, первый токен пришёл через 4,0 секунды, время генерации 8,0 секунды. Тысяча выходных токенов за это время даёт 125 токенов в секунду.
Prefill считают иначе: количество токенов промпта делят на время до первого токена. Пример: промпт на 77 000 токенов, первый токен через 4,9 секунды, получается около 15 600 токенов в секунду чтения контекста. Такую методику применяют сервисы замера скорости LLM, например Token Harbor, и её же удобно использовать для собственных сборок.
Три оговорки, без которых цифры врут:
- Для промптов короче 16k токенов TTFT ничего не говорит о пропускной способности. Он держится на уровне 2-6 секунд независимо от размера запроса, потому что измеряет round trip и очередь. Считать по нему prefill на коротком запросе бессмысленно.
- Prefill и генерацию не складывают. Это ответы на разные вопросы: как быстро система читает контекст и как быстро пишет ответ.
- Если фаза генерации заняла меньше 200 мс или движок буферизует ответ и отдаёт его одним куском, замер скорости генерации недостоверен.
Замеренное время всегда включает лишнее: очередь и инференс на стороне сервиса, сетевой round trip, маршрутизацию, аутентификацию и время, за которое клиент вычитывает поток. При сравнении двух локальных машин на одном клиенте эти накладные расходы примерно одинаковы, а при сравнении локальной сборки с облаком они ломают всю картину.
Почему prefill важен для локального AI-сервера
Prefill определяет, сколько ждать ответа на длинный запрос. Для чата с вопросом на 200 токенов разница между системами не видна. Для RAG, где в промпт подставляют десятки тысяч токенов из документов, для агентных цепочек и инструментов с большим системным промптом каждый запрос начинается с чтения полного контекста. Слабый prefill превращает такие задачи в ожидание, даже если генерация сама по себе бодрая.
Дискретная GPU с собственной VRAM обрабатывает prefill быстрее интегрированного решения, потому что вычисления идут на отдельных ядрах и не делят память с CPU. Именно поэтому в исходном разборе скорость prefill стоит выше объёма памяти: 16 ГБ у RTX 2000 ADA хватает для модели с квантизацией, а медленный prefill на большой выборке документов не лечится ничем, кроме другой железки.
Сравнение производительности на Qwen 27B: ожидания и реальность
Точных замеров по обеим системам в открытом доступе нет, и придумывать их не стоит. Что известно: связка Zima Board 2 + RTX 2000 ADA выдаёт приемлемую скорость генерации токенов на Qwen 27B через Ollama. Приемлемая здесь означает интерактивную работу в чате, а не высокий throughput для нескольких параллельных пользователей.
Для Mac Mini M5 прямых замеров на Qwen 27B в разборе тоже нет. Логика оценки такая: генерация будет зависеть от пропускной способности памяти, а prefill на длинных промптах, скорее всего, окажется ниже, чем у связки с дискретной картой. Насколько ниже, станет понятно после независимых замеров на финальном железе и финальной прошивке.
По вместимости картина такая. 27B в 4-битной квантизации требует ориентировочно 15-17 ГБ, и 16 ГБ VRAM у RTX 2000 ADA влезают с минимальным запасом: чем длиннее контекст, тем больше KV-кэш и тем чаще часть данных уходит в системную память. У Mac Mini M5 24 ГБ unified memory, из которых часть занята системой, поэтому запуск той же модели в более щадящей квантизации тоже упирается в потолок.
На результат влияет не только железо. Ollama, MLX, vLLM и SGLang по-разному работают с одним набором весов, и разница между движками бывает больше, чем между двумя похожими GPU. Сравнение движков для модели такого класса собрано в материале про инструменты локального запуска Qwen 27B. Плюс драйверы и настройки контекста в Ollama: они меняют скорость заметнее, чем кажется.
Ограничения и подводные камни обеих систем
Zima Board 2 + RTX 2000 ADA:
- 16 ГБ системной RAM. Для Ollama с offload этого мало, а фоновые сервисы съедают ещё часть.
- 64 ГБ eMMC. Несколько квантизаций по 15-20 ГБ займут весь диск, SATA-накопитель обязателен.
- Тепло и питание при длительной нагрузке. Штатного питания хватает этой карте, но запаса на будущую замену GPU почти нет.
- PCIe-линии. Если слот отдаёт x4, загрузка модели и offload замедляются.
- Обслуживание Linux на одноплатнике: обновления драйверов, мониторинг температур, автозапуск сервиса.
Mac Mini M5:
- 24 ГБ unified memory делятся с системой, запаса под длинный контекст мало.
- Нет дискретной GPU, поэтому prefill на длинных промптах ограничен.
- Память и накопитель не апгрейдятся после покупки.
- Цена конфигурации с 24 ГБ в разборе не приводится, поэтому сравнение по деньгам нужно делать отдельно, по актуальному прайсу.
Обе системы требуют настройки: подбор квантизации, лимит контекста, выбор движка, проверка охлаждения. Готового решения, которое включается и тянет любую задачу, здесь нет ни у одной.
Более дешёвые и производительные альтернативы
Если цель - быстрая генерация на модели сопоставимого размера и полностью автономная работа, смотреть стоит на другие одноплатники и мини-ПК с PCIe-слотом под низкопрофильную GPU. Логика та же, что у Zima Board 2: плата плюс карта с 16 ГБ VRAM. Разница в цене платы, количестве линий PCIe и наличии нормального охлаждения, а это как раз то, что определяет prefill на длинном контексте.
Второе направление - MoE-модели. Они меняют расчёт: при тех же 30+ млрд параметров активных весов в разы меньше, поэтому генерация быстрее, а требования к VRAM ниже. Пример из практики проекта: Macaron-V1 на Qwen3.6-35B-A3B выдаёт до 87 токенов в секунду на RTX 4090 при 3 млрд активных параметров, и это уже другой уровень отзывчивости в чате. Бенчмарки и готовые конфигурации для Ollama и vLLM собраны в разборе Macaron-V1.
Третье - реалистичный взгляд на бюджет. Стоимость вменяемых карт для локального инференса начинается около $1000, и AI-бум эту планку не снижает. Как менялись цены и сколько стоит вход в локальный AI в 2026 году, разобрано в статье про AI-налог на железо. На этом фоне $1100 за плату вместе с GPU на 16 ГБ VRAM выглядят скорее нормой, чем находкой.
Для многопользовательского инференса и длинного контекста без компромиссов существует отдельный класс рабочих станций уровня DGX Station: там другой бюджет и другое энергопотребление. Кому такие системы имеют смысл, разобрано в материале про NVIDIA DGX Station 2026.
Условие остаётся прежним: только новые системы, доступные к покупке или предзаказу. Б/у рынок дешевле, но предсказуемости prefill и гарантии там нет.
Практические сценарии: кому подойдёт каждая система
Zima Board 2 + RTX 2000 ADA:
- Выделенный endpoint, который работает круглосуточно: домашний API для автоматизаций, бот в мессенджере, фоновая обработка текстов.
- Задачи с длинным контекстом, где важна скорость чтения промпта: RAG по своим документам, суммаризация больших файлов, агентные цепочки.
- Сценарии, где нужен тихий и компактный узел без системного блока и лишнего тепла в комнате.
- Тем, кто готов возиться с Linux, драйверами и мониторингом.
Mac Mini M5:
- Основной рабочий компьютер, на котором LLM запускается время от времени, а не постоянно.
- Разработка и тестирование промптов, работа с небольшими моделями, эксперименты с агентами и RAG на коротком контексте.
- Сценарии, где важны macOS, тишина и одна розетка, а не максимум токенов в секунду.
- Тем, кто не хочет собирать и обслуживать железо.
Набор инструментов для обоих вариантов один: Ollama для быстрого старта, плюс более производительный движок, если упрётесь в потолок по скорости.
Итог: что выбрать для Qwen 27B в 2026 году
По деньгам и prefill выигрывает Zima Board 2 + RTX 2000 ADA: около $1100, 16 ГБ VRAM, работа от штатного питания и подтверждённый запуск Qwen 27B в Ollama. Это самый дешёвый из рассмотренных новых автономных вариантов под модель такого размера, с оговорками про 16 ГБ системной RAM, 64 ГБ eMMC и необходимость SATA-диска.
Mac Mini M5 с 24 ГБ берут не за скорость, а за универсальность: полноценный компьютер, который умеет запускать LLM, но уступает дискретной карте на длинных промптах и не апгрейдится.
Что сделать перед покупкой: уточнить число линий PCIe у нужной ревизии Zima Board 2, проверить актуальную цену Mac Mini M5 в конфигурации с 24 ГБ и оценить типовой контекст своих запросов. Если это 30-40 тысяч токенов документов, выбирайте вариант с дискретной GPU. Если 2-4 тысячи, разница в prefill окажется меньше разницы в удобстве повседневной работы.