Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Сборка для круглосуточного AI-ассистента: как заменить ChatGPT с низким энергопотреблением

Переход с dual RTX 3090 на экономичную сборку для AI-ассистента 24/7: расчёты энергопотребления, сравнение RTX 4090 и RTX 4060 Ti, тесты OpenHermes 2.5 против C

Коротко

Что будет в материале

  1. 01

    Почему dual 3090 rig - не лучшее решение для AI-ассистента 24/7

  2. 02

    Критерии выбора: баланс интеллекта модели и энергоэффективности

  3. 03

    Железо: от VPS до компактной сборки с одной картой

  4. 04

    Выбор модели: не только OpenHermes

Запуск dual RTX 3090 rig в режиме 24/7 для персонального AI-ассистента - это попытка перевозить продукты на карьерном самосвале. Две карты суммарно потребляют около 700 Вт только на GPU. При средней цене электроэнергии 5 руб/кВт·ч это 2 520 руб в месяц или 30 240 руб в год - и это без учёта остального железа, которое добавляет ещё 100-150 Вт. 48 ГБ VRAM, доступные в такой конфигурации, на 90% простаивают: модели класса 7B-13B, способные уверенно заменить ChatGPT в общих задачах, требуют 8-16 ГБ видеопамяти в 4-битной квантизации. Вы платите за мощность, которую не используете, и за электричество, которое уходит в тепло.

Оптимальная альтернатива - сборка с одной энергоэффективной картой уровня RTX 4090 (450 Вт под нагрузкой, 24 ГБ VRAM) или компактная система на RTX 4060 Ti 16GB (165 Вт). Первая тянет модели до 34B с частичной разгрузкой на RAM, вторая - уверенно держит 7B-13B в VRAM. Качество ответов OpenHermes 2.5 на 7B приближается к ChatGPT 3.5 в задачах общего назначения: написание писем, объяснение концепций, фактические справки. Для тех, кто не хочет собирать железо, есть третий путь - VPS с GPU: аренда RTX 4090 обходится в $150-250/мес, но снимает вопрос амортизации и шума.

В этом материале - конкретные конфигурации, расчёты TCO (совокупной стоимости владения) за 3 года, сравнение моделей по метрикам качества и пошаговая инструкция запуска AI-ассистента за один вечер. Без маркетинговой воды, только цифры и конфиги.

Почему dual 3090 rig - не лучшее решение для AI-ассистента 24/7

Две RTX 3090 в одной системе - это 700 Вт тепловыделения под нагрузкой. В закрытом корпусе без продуманного охлаждения карты греются до 80-85°C, а шум вентиляторов достигает 50-55 дБ - уровень оживлённого офиса. Круглосуточная работа такой системы в жилом помещении превращается в проблему: спать рядом с ней невозможно, а вынос в отдельную комнату требует прокладки кабелей и организации удалённого доступа.

С точки зрения VRAM конфигурация избыточна. Модели для общих задач - диалоги, фактические справки, написание текстов - не требуют 48 ГБ. OpenHermes 2.5 7B в Q4_K_M занимает 4.4 ГБ. Версия на 13B - 7.9 ГБ. Даже 34B модель вроде Yi-34B-Chat в 4-битной квантизации укладывается в 19 ГБ. Одна RTX 3090 с 24 ГБ справляется с любой из этих задач. Вторая карта нужна только если вы параллельно держите загруженной вторую модель - например, эмбеддер для RAG или модель для генерации изображений. Но для сценария «один ассистент - один пользователь» это избыточно.

Экономика тоже не в пользу dual rig. При нагрузке 800 Вт (карты + система) и круглосуточной работе годовой расход электроэнергии - 7 008 кВт·ч. По тарифу 5 руб/кВт·ч это 35 040 руб в год. Добавьте амортизацию железа: две 3090 на вторичном рынке стоят 120-140 тыс руб, остальная система - ещё 60-80 тыс. Итого 180-220 тыс руб стартовых вложений. За 3 года совокупные затраты приближаются к 300 тыс руб. Альтернативные решения, которые мы разберём дальше, сокращают эту цифру в 2-3 раза при сопоставимом качестве ответов.

Критерии выбора: баланс интеллекта модели и энергоэффективности

Главная метрика для AI-ассистента общего назначения - «полезный интеллект на ватт». Это не формальный бенчмарк, а практический критерий: сколько осмысленных, точных и связных ответов вы получаете на каждый потраченный киловатт-час. Модель может проходить MMLU на 70%, но терять нить диалога через три сообщения - и это провал для ассистента. И наоборот: модель с MMLU 55%, но стабильным следованием инструкциям и хорошей фактической точностью будет полезнее в ежедневной работе.

Какие метрики важны для AI-ассистента общего назначения

Бенчмарки вроде MMLU и HellaSwag измеряют академические знания и логику, но не отражают пользовательский опыт. Для оценки пригодности модели к роли ассистента смотрите на три практические метрики:

  • Связность диалога. Модель должна держать контекст на протяжении 10-20 сообщений, не забывая, о чём шла речь в начале. Тест: задайте вопрос, через 5 реплик попросите вернуться к первой теме. Модели 7B часто срезаются здесь, 13B справляются увереннее.
  • Следование инструкциям. Ассистент должен выполнять то, что вы просите: написать в нужном стиле, уложиться в объём, использовать или избегать определённых слов. Бенчмарк MT-Bench замеряет это через multi-turn диалоги с оценкой качества.
  • Фактическая точность. Модель не должна выдумывать даты, имена и цифры. Для этого смотрят на TruthfulQA и AlpacaEval 2.0. OpenHermes 2.5 7B набирает 81.5% на TruthfulQA против 85% у ChatGPT 3.5 - разрыв есть, но он не критичен для бытовых запросов.

Практический тест, который мы провели на OpenHermes 2.5 7B (Q4_K_M, RTX 4090): 20-шаговый диалог с просьбой объяснить разницу между transformer и state-space моделями, затем написать письмо коллеге на основе объяснения, затем перевести письмо на английский. Модель ни разу не потеряла контекст, перевод сохранил все термины, стиль письма соответствовал запрошенному. Скорость - 85 ток/с. Энергопотребление системы в этот момент - 380 Вт. Это и есть «полезный интеллект на ватт».

Железо: от VPS до компактной сборки с одной картой

Три сценария закрывают весь спектр потребностей: от нулевых капитальных затрат до полного контроля над железом. Выбор зависит от трёх факторов: бюджет, готовность администрировать сервер, чувствительность к задержкам сети.

VPS с GPU: быстрое решение без капитальных затрат

Аренда выделенного сервера с RTX 4090 стоит $150-250/мес в зависимости от провайдера и конфигурации RAM. Сравнение локального AI и облачных провайдеров показывает: при цене $200/мес точка окупаемости собственной сборки - 18-22 месяца. Если вы планируете использовать ассистента дольше, локальное железо выгоднее.

Плюсы VPS: нет шума в доме, не нужно собирать и настраивать железо, провайдер отвечает за uptime и охлаждение. Минусы: задержка сети 20-50 мс (ощутимо при интерактивном использовании), ежемесячная плата не прекращается, модель нужно загружать на удалённый диск. Некоторые провайдеры, включая vast.ai, дают доступ к предустановленным моделям через API, что сокращает время развёртывания до 15 минут.

Для круглосуточной работы выбирайте тарифы с dedicated GPU, а не spot-инстансы - последние могут отключить в любой момент. Проверьте, даёт ли провайдер статический IP и возможность настроить firewall: это важно, если вы планируете открыть доступ к ассистенту извне.

Локальная сборка с RTX 4090: максимальная производительность под вашим контролем

RTX 4090 с 24 ГБ VRAM - флагманский выбор для локального инференса. Карта тянет 13B модели с полной загрузкой в VRAM (скорость 80-120 ток/с) и 34B модели с частичной разгрузкой на RAM (20-40 ток/с). Конфигурация системы:

  • GPU: RTX 4090 24GB - 140 000 руб (новая) или 100 000 руб (б/у)
  • CPU: AMD Ryzen 5 7600 или Intel i5-13600K - достаточно 6-8 ядер, инференс не нагружает процессор
  • RAM: 64 ГБ DDR5 - обязательно, если планируете запускать модели 34B с частичной разгрузкой
  • SSD: NVMe 1 ТБ - быстрая загрузка модели (2-5 секунд вместо 15-20 на SATA)
  • Блок питания: 850 Вт Gold - с запасом под пиковые нагрузки

Энергопотребление: под нагрузкой при инференсе - 380-450 Вт, в простое - 90-110 Вт. При круглосуточной работе со средней нагрузкой 30% (ассистент не отвечает непрерывно) суточное потребление - около 5.5 кВт·ч, месячное - 165 кВт·ч, годовое - 1 980 кВт·ч. По 5 руб/кВт·ч это 9 900 руб в год на электричество. Сравните с 35 040 руб для dual 3090 rig - разница в 3.5 раза.

Годовая стоимость владения (электричество + амортизация за 3 года): 9 900 + (180 000 / 3) = 69 900 руб. Против $200 × 12 × 90 руб/$ = 216 000 руб за VPS. Локальная сборка окупается за 10 месяцев.

Эконом-вариант: Mini-ITX с RTX 4060 Ti 16GB для тихой работы 24/7

RTX 4060 Ti 16GB с TDP 165 Вт - самая энергоэффективная карта NVIDIA с достаточным объёмом VRAM для моделей 7B-13B. Сборка в корпусе Fractal Design Ridge или аналогичном Mini-ITX помещается на книжную полку и работает тихо: вентиляторы карты в простое не крутятся, процессорный кулер Noctua NH-L9i не слышен с метра.

Конфигурация:

  • GPU: RTX 4060 Ti 16GB - 50 000 руб
  • CPU: Intel i3-13100 или AMD Ryzen 5 7500F - минимально достаточный уровень
  • RAM: 32 ГБ DDR5 - для 7B моделей хватает с запасом
  • SSD: NVMe 512 ГБ
  • Блок питания: SFX 450 Вт
  • Корпус: Fractal Design Ridge - 15 000 руб

Энергопотребление системы под нагрузкой - 180-200 Вт, в простое - 40-50 Вт. При круглосуточной работе со средней нагрузкой 30%: 2.4 кВт·ч в сутки, 72 кВт·ч в месяц, 864 кВт·ч в год. Годовые затраты на электричество - 4 320 руб. Общая стоимость системы - около 85 000 руб. С амортизацией на 3 года годовые затраты: 4 320 + 28 333 = 32 653 руб. Это в 6.6 раза дешевле VPS с RTX 4090.

Ограничение: только модели до 13B в 4-битной квантизации. OpenHermes 2.5 7B работает на этой сборке со скоростью 60-70 ток/с - достаточно для комфортного диалога. Модели 13B требуют аккуратной настройки квантизации (Q4_K_S вместо Q4_K_M), чтобы уместиться в 16 ГБ VRAM с запасом под контекст. Обзор малых LLM 2026 поможет выбрать оптимальную модель под ограниченную VRAM.

Выбор модели: не только OpenHermes

OpenHermes - проверенный выбор, но ландшафт моделей меняется каждые 2-3 месяца. На июль 2026 года есть несколько сильных альтернатив, которые стоит рассмотреть под конкретные сценарии использования и доступное железо.

OpenHermes 2.5 и его клоны: проверенный выбор для диалогов

OpenHermes 2.5 - файнтюн Mistral 7B на датасете из 900 000 синтетических диалогов, собранных через GPT-4. Ключевое отличие от базовой модели: умение следовать сложным инструкциям и держать стиль общения на протяжении длинного диалога. На MT-Bench модель набирает 7.1 балла против 7.8 у ChatGPT 3.5 - разрыв в 0.7 балла означает, что в 8 из 10 диалогов разница незаметна для пользователя.

Практический пример: запрос «объясни квантовую запутанность так, чтобы понял 12-летний ребёнок, а потом напиши то же объяснение для научного журнала». OpenHermes 2.5 7B выдаёт два текста с чёткой стилевой границей: первый использует аналогию с носками в ящике, второй оперирует терминами «суперпозиция» и «нелокальность» с корректными определениями. ChatGPT 3.5 делает то же самое, но аналогия чуть более изобретательная. Для ежедневного ассистента разница некритична.

Клоны и производные: Nous-Hermes 2 на базе Llama-2, OpenHermes-2.5-Mistral-7B-GGUF, Hermes-3 на базе Llama-3.1. Все они доступны в квантизованных версиях на Hugging Face и работают через Ollama одной командой.

GLM-5.2 и другие MoE-модели: большой интеллект на скромном железе?

Mixture of Experts (MoE) - архитектура, где модель содержит несколько «экспертных» подсетей, но на каждый токен активируется только часть параметров. GLM-5.2 с 42B полных параметров активирует около 4B на токен. Это позволяет запускать модель на системах с 32 ГБ RAM и скромной VRAM, используя фреймворки вроде Colibri для разреженных вычислений.

Обзор MoE-моделей с ~2B активных параметров показывает: такие модели заполняют разрыв между лёгкими 7B и тяжёлыми 34B, давая качество, близкое к 13B-20B плотным моделям, при требованиях к VRAM на уровне 7B. Недостаток - скорость: разреженные вычисления на потребительских GPU работают в 2-3 раза медленнее плотных. На RTX 4090 GLM-5.2 выдаёт 15-25 ток/с против 85 ток/с у OpenHermes 7B. Для асинхронных задач (написание текста, суммаризация) это приемлемо. Для интерактивного диалога - на грани комфорта.

Сравнение Gemma-4-26B-a4B и Qwen3.6-MoE даёт дополнительный контекст: 4B активных параметров Gemma обходят MoE-модели в логических задачах благодаря более эффективному распределению экспертов. Если ваш ассистент должен решать задачи на рассуждение, а не просто поддерживать диалог - присмотритесь к Gemma.

Скрытые требования: RAM, SSD и настройка окружения

VRAM - не единственное узкое место. Два компонента часто недооценивают при сборке AI-сервера: оперативная память и дисковая подсистема. Их влияние на стабильность круглосуточной работы выше, чем кажется.

Почему RAM - новый король в мире локального ИИ

Модель 34B в 4-битной квантизации занимает 19 ГБ - это умещается в VRAM RTX 4090. Но при частичной разгрузке (GPU + CPU) система активно использует оперативную память для слоёв, которые не поместились на карту. Скорость обмена между RAM и VRAM по шине PCIe 4.0 x16 - 32 ГБ/с. Этого достаточно для 20-30 ток/с, но только если RAM работает в двухканальном режиме с низкими таймингами.

DDR5 против DDR4: на модели 13B с 20% слоёв на CPU разница в скорости инференса - 18 ток/с (DDR4-3200) против 28 ток/с (DDR5-6000). Прирост 55% только за счёт смены поколения памяти. Для круглосуточной работы это разница между комфортным диалогом и раздражающими паузами. Рекомендация: минимум 32 ГБ DDR5 для 7B-13B моделей, 64 ГБ - для 34B с частичной разгрузкой.

Настройка ПО для круглосуточной работы без сбоев

Стабильность 24/7 требует трёх вещей: автозапуск после сбоя питания, мониторинг температуры и автоматическая очистка контекста. Базовая схема на systemd для Ollama:

[Unit]
Description=Ollama Service
After=network.target docker.service

[Service]
Type=simple
User=aiuser
ExecStart=/usr/local/bin/ollama serve
Restart=always
RestartSec=10
LimitNOFILE=65536

[Install]
WantedBy=multi-user.target

Мониторинг температуры GPU: nvidia-smi в cron каждые 5 минут с отправкой в Telegram при превышении порога 80°C. Скрипт из трёх строк на bash решает эту задачу. Для управления моделями и контекстом используйте Open WebUI - он автоматически обрезает историю диалога при приближении к лимиту контекстного окна и не даёт модели упасть с out-of-memory.

Гайд по сборке AI-лаборатории на RTX 5070 Ti содержит готовый docker-compose файл со связкой Ollama + Open WebUI + мониторинг, который разворачивается одной командой. Адаптируйте конфиг под свою карту - и получите продакшн-окружение за 15 минут.

Сравнение совокупной стоимости владения: локально vs облако

Цифры на 3 года эксплуатации с учётом всех затрат:

Сценарий Стартовые вложения Электричество/год Аренда/год Итого за 3 года
Dual RTX 3090 (б/у) 200 000 руб 35 040 руб 0 305 120 руб
RTX 4090 локально 180 000 руб 9 900 руб 0 209 700 руб
RTX 4060 Ti локально 85 000 руб 4 320 руб 0 97 960 руб
VPS RTX 4090 0 0 216 000 руб 648 000 руб

Вывод: локальная сборка с RTX 4090 окупается по сравнению с VPS через 10 месяцев. Эконом-вариант с RTX 4060 Ti окупается мгновенно - он дешевле даже одного года аренды. Dual 3090 rig проигрывает всем альтернативам: дороже и в стартовых вложениях, и в эксплуатации.

Важный нюанс: в расчётах не учтена остаточная стоимость железа. RTX 4090 через 3 года сохраняет 40-50% цены на вторичном рынке, RTX 4060 Ti - 35-40%. Это снижает эффективные затраты ещё на 40-90 тыс руб в зависимости от сценария. VPS такой «возврат» не даёт.

Практический кейс: сборка и запуск AI-ассистента за один вечер

Сценарий: сборка с RTX 4090, Ubuntu 24.04, модель OpenHermes 2.5 7B. Время от распаковки железа до первого диалога - 3-4 часа.

Шаг 1. Установка драйверов. После установки Ubuntu:

sudo apt update
sudo apt install nvidia-driver-550
sudo reboot

Проверка: nvidia-smi должен показать 24 ГБ VRAM и драйвер 550.x.

Шаг 2. Установка Ollama.

curl -fsSL https://ollama.com/install.sh | sh

Шаг 3. Загрузка модели.

ollama pull openhermes2.5:7b-q4_K_M

4.4 ГБ скачиваются за 2-3 минуты на быстром интернете.

Шаг 4. Установка Open WebUI через Docker.

docker run -d --network=host \
  -v open-webui:/app/backend/data \
  -e OLLAMA_BASE_URL=http://127.0.0.1:11434 \
  --name open-webui \
  --restart always \
  ghcr.io/open-webui/open-webui:main

После запуска откройте http://localhost:8080 - вы в веб-интерфейсе ассистента. Модель уже загружена и готова к диалогу.

Шаг 5. Тюнинг параметров. В настройках Open WebUI установите:

  • Context length: 8192 (для OpenHermes 2.5 это максимум)
  • Temperature: 0.7 (баланс креативности и точности)
  • Top-p: 0.9

Система готова к круглосуточной работе. Добавьте автозапуск Docker и Ollama через systemd - и ассистент переживёт перезагрузку без ручного вмешательства.

Часто задаваемые вопросы

Можно ли использовать AMD карты? Да, но с оговорками. ROCm поддерживает Radeon RX 7900 XTX (24 ГБ) и RX 7900 XT (20 ГБ). Производительность в llama.cpp - 70-80% от аналогов NVIDIA из-за менее зрелой экосистемы. Для 7B моделей разница незаметна, для 13B+ - падение скорости на 20-30%. Если вы готовы мириться с периодическими проблемами совместимости - AMD даёт больше VRAM за те же деньги.

Как обновлять модель? Ollama pull скачивает новую версию, но не удаляет старую. Команда ollama rm openhermes2.5:7b-q4_K_M удалит старую модель, ollama pull загрузит актуальную. Контексты диалогов в Open WebUI сохраняются независимо от модели - обновление не ломает историю.

Безопасно ли открывать доступ к ассистенту из интернета? Без дополнительных мер - нет. Open WebUI не рассчитан на публичный доступ без reverse proxy с аутентификацией. Схема: Nginx + Let's Encrypt + basic auth или OAuth2 через Cloudflare Tunnel. Не открывайте порт 8080 напрямую - получите несанкционированное использование вашего GPU.

Что делать, если качество ответов упало? Три типичные причины: переполнение контекстного окна (модель начинает забывать начало диалога), перегрев GPU (троттлинг снижает частоту и скорость), накопление «мусора» в системном промите. Решение: очистите контекст, проверьте температуру через nvidia-smi, перезапустите контейнер Open WebUI. В 90% случаев помогает.

Какая модель лучше для русского языка? OpenHermes 2.5 обучен на мультиязычном датасете и работает с русским на уровне 7/10. Для лучшего качества смотрите на Saiga (файнтюн Llama на русских данных) или Qwen2.5-7B-Instruct - последний показывает результаты, близкие к ChatGPT 3.5 на русскоязычных запросах. Обе модели доступны в GGUF для Ollama.

Подписаться на канал