Что сделать в первую очередь, если AI-риг греет комнату
Начните с измерений. Зафиксируйте мощность всей системы через ваттметр, потребление каждой GPU по телеметрии, температуры GPU и CPU, обороты вентиляторов, температуру воздуха в комнате и фактическую скорость генерации в токенах в секунду. Без исходной точки легко принять изменение кривой вентиляторов за снижение тепловой нагрузки.
Затем установите умеренный power limit для каждой видеокарты, при необходимости уменьшите рабочие частоты и проверьте воздушный поток в корпусе. После каждого изменения повторите сопоставимый сеанс инференса: та же модель, тот же runtime, похожий контекст и близкая длина ответа. Сравнивайте мощность, установившиеся температуры, шум, скорость генерации и стабильность длинного запроса.
Для нагрева комнаты главным показателем служит средняя потребляемая мощность всей системы. Снижение температуры ядра GPU само по себе не гарантирует заметного охлаждения помещения. Если вентиляторы просто стали работать быстрее, электрическая энергия по-прежнему превращается в тепло и уходит в комнату. Практический ориентир для выбора режима можно найти в разборе энергоэффективности GPU при ограничении мощности, но чужие значения нельзя переносить на другую видеокарту.
- Снять исходную телеметрию и измерить мощность всей системы.
- Проверить фильтры, впуск, вытяжку и расстояние между двумя GPU.
- Установить умеренный лимит мощности отдельно для каждой видеокарты.
- При необходимости скорректировать частоты.
- Сравнить скорость инференса, температуры, шум и ошибки runtime.
Почему AI-сервер сильно греется при локальном инференсе LLM
Домашний AI-риг с двумя GPU и современным CPU может выделять постоянный поток тепла даже при умеренной пиковой мощности. Локальная LLM держит вычислительные устройства под продолжительной нагрузкой, а память, накопители, вентиляторы и блок питания добавляют собственное потребление. В установившемся режиме почти вся электроэнергия компьютера в итоге превращается в тепло.
Игровой запуск или короткий рендеринг часто заканчивается раньше, чем корпус и помещение успевают заметно прогреться. Инференс длинного ответа, RAG-процесса или агента может продолжаться значительно дольше. Поэтому допустимая температура чипа и комфортная температура комнаты описывают разные проблемы.
Роль двух GPU и CPU в общей тепловой нагрузке
Вторая видеокарта увеличивает доступный объем VRAM и вычислительный ресурс, но одновременно добавляет собственный энергобюджет, вентиляторы и источник горячего воздуха. Карты могут загружаться неравномерно: одна занимается вычислениями, другая принимает часть слоёв модели, хранит KV-кэш или простаивает в ожидании передачи данных. Средняя температура одной GPU не описывает состояние всей системы.
CPU отвечает за подготовку запросов, токенизацию, планирование, работу runtime и операции, которые не попали на GPU. При частичном offload процессор может получать заметную нагрузку даже при невысокой загрузке видеокарт. Смотрите показатели устройств раздельно: мощность GPU 1, мощность GPU 2, загрузку и частоты каждой карты, загрузку и температуру CPU.
Многокартовые рабочие станции требуют отдельного расчета питания и охлаждения. Практический контекст для сравнения домашних систем с более крупными решениями есть в материале о рабочих AI-системах с несколькими ускорителями.
Почему длительный инференс ощущается хуже кратковременной нагрузки
Температура компонента показывает состояние конкретного чипа в конкретный момент. Нагрев комнаты определяется тем, сколько ватт система отдает в воздух и как долго это происходит. Риг, который держит стабильную нагрузку на протяжении всего рабочего дня, может нагревать помещение сильнее, чем система с более высоким кратким пиком.
При долгом сеансе прогреваются радиаторы, внутренний воздух корпуса, стол и ближайшие поверхности. Вентиляторы поддерживают отвод тепла, но не уничтожают его. Если горячий поток возвращается к впускным отверстиям, эффективность охлаждения падает, а обороты растут.
Как в этой схеме участвуют runtime и параметры запроса
Одинаковое название модели не означает одинаковую нагрузку. На результат влияют формат файла, способ размещения слоёв, доступная память, размер контекста, число параллельных запросов и настройки генерации. Большой контекст увеличивает объем работы с KV-кэшем, а несколько одновременных пользователей меняют профиль загрузки GPU и CPU.
Для локальной Qwen это особенно заметно при сравнении разных runtime и режимов загрузки. В связке Qwen 3.8 27B с Blender 5.x через MCP модель, inference runtime, MCP-клиент и Blender образуют цепочку из нескольких компонентов. Каждый вызов инструмента может добавлять обработку запроса и обмен данными. Точную совместимость файла модели, формата, runtime и версии Blender нужно проверять отдельно, поскольку готовая универсальная сборка для такой связки не подтверждена.
Перед измерением убедитесь, что генерация действительно проходит в нужном режиме. Проверьте логи успешного вызова, список инструментов, размер контекста и состояние проекта. Разбор поведения Qwen в разных режимах загрузки VRAM и памяти помогает понять, почему один и тот же класс модели может по-разному нагружать систему: Qwen в llama.cpp и влияние VRAM на скорость.
Как уменьшить температуру GPU при запуске LLM с помощью power limit
Power limit задает верхнюю границу энергопотребления видеокарты в единицу времени. Когда GPU упирается в этот предел, драйвер может снизить частоту или перестать удерживать прежний производительный режим. При прочих равных меньший энергобюджет дает меньший тепловой поток, но цена в скорости зависит от модели карты и характера инференса.
Настройку нужно проводить как эксперимент с контрольными точками. Сначала запишите исходные значения, затем выберите умеренное ограничение, проверьте длинную генерацию и сравните показатели. Одного короткого ответа недостаточно: корпус может еще не выйти на установившийся тепловой режим.
Что меняется после ограничения энергопотребления
При снижении лимита GPU получает меньше энергии для поддержания высоких частот. Если исходная нагрузка упиралась в энергопотребление, температура ядра и горячих зон обычно снижается, а вентиляторы получают меньше работы. Если узким местом служит пропускная способность памяти, PCIe, CPU или передача данных между картами, падение скорости может оказаться заметным при небольшом изменении температуры.
Измеряйте среднюю мощность, а не только краткий пик. Для комнаты важна интегральная нагрузка за сеанс: система, потребляющая меньше ватт, но работающая существенно дольше, может дать сопоставимое количество тепла за весь процесс.
Почему power limit часто снижает и шум
Меньший тепловой поток обычно позволяет системе удерживать нужную температуру на меньших оборотах вентиляторов. Это снижает шум GPU, а иногда и корпуса. Эффект пропадает, если горячий воздух застаивается внутри, верхняя карта перекрывает нижней доступ к воздуху, фильтры забиты или кривая вентиляторов настроена слишком агрессивно.
Шум нужно оценивать рядом с рабочим местом и в установившемся режиме. Две карты на низких оборотах могут быть комфортнее одной карты на максимальной кривой, если корпус правильно выводит воздух. Обратная ситуация тоже возможна.
Когда одного power limit недостаточно
Лимит мощности не исправляет плохой контакт охлаждения, загрязненный радиатор, высокую температуру воздуха на входе и рециркуляцию выхлопа. Он не меняет расстояние между картами и не создает свободное место перед вентиляторами.
Если GPU уже ограничена пропускной способностью памяти или загрузка остается далекой от максимальной, уменьшение лимита может почти не повлиять на температуру, но снизить скорость. В такой ситуации сначала ищите реальный ограничитель по телеметрии и логам runtime.
Частоты, напряжение и режим работы: где проходит разумный компромисс
После power limit можно корректировать частоты. Этот шаг нужен, когда требуется более предсказуемое поведение GPU при длительной нагрузке или когда автоматический алгоритм постоянно меняет частоту и обороты. Андервольтинг требует осторожности: результат зависит от конкретной видеокарты, прошивки, драйвера и используемой утилиты.
Снижение частоты GPU против ограничения мощности
Power limit ограничивает доступный энергобюджет, а фиксация частоты задает верхнюю границу производительного режима. Лимит мощности обычно проще использовать первым: он оставляет автоматике возможность выбрать рабочую частоту внутри заданного бюджета.
Снижение частоты дает более прямой контроль, но может сильнее повлиять на скорость генерации. Если runtime меняет профиль нагрузки между обработкой промпта и выдачей токенов, фиксированная частота может по-разному сказаться на этих фазах. Меняйте один параметр за раз.
Как оценивать потерю скорости локального инференса
Записывайте скорость генерации в токенах в секунду, время до первого токена, длительность полного ответа и стабильность частот. Для агента добавьте время выполнения инструментов и количество ошибок. Для RAG полезно отдельно фиксировать время поиска, обработки контекста и генерации.
Сравнение должно проходить на одинаковом запросе или на наборе похожих запросов. Контекст, формат модели, число слоёв на GPU и максимальная длина ответа способны изменить результат сильнее, чем небольшое изменение лимита мощности.
Режимы для коротких запросов и длительных задач
Для короткого интерактивного диалога может подойти профиль с более высокой частотой и быстрым откликом. Для долгих ответов, RAG, фоновых агентов и постоянного сервиса разумнее проверить экономичный профиль с меньшей мощностью и более низким шумом.
Выбирайте режим по стоимости ожидания и длительности сеанса. Потеря части пиковой скорости может окупиться меньшим нагревом комнаты за несколько часов работы. Универсального порога здесь нет: разработчику, который ждет ответ в чате, нужен один баланс, а фоновой задаче обработки документов подойдет другой.
Вентиляция корпуса и отвод тепла от двух GPU
Программные лимиты уменьшают источник тепла, а вентиляция убирает горячий воздух от компонентов. Оба направления нужно проверять вместе. Хороший airflow не снижает потребление, зато помогает удерживать рабочие температуры и обороты на разумном уровне.
Что проверить в корпусе перед заменой комплектующих
- Воздухозаборники не закрыты стеной, мебелью или плотным пылевым фильтром.
- Фильтры, радиаторы и лопасти вентиляторов очищены от пыли.
- Кабели не перекрывают путь воздуха к видеокартам.
- Вытяжные вентиляторы действительно выбрасывают воздух, а не создают локальную завихренную зону.
- Горячий выхлоп не возвращается к передним или нижним впускам.
- Температура воздуха на входе сопоставлена с температурой внутри корпуса и показателями GPU.
Открытая боковая панель может временно показать, есть ли проблема с рециркуляцией. Если при открытом корпусе температуры резко меняются, ищите причину в воздушном потоке. Постоянная работа с открытой панелью не заменяет нормальную защиту от пыли и организованный впуск.
Почему вторая GPU усложняет охлаждение
Видеокарты, рассчитанные на работу с большим свободным пространством вокруг корпуса, могут плохо охлаждаться в плотной двухкарточной конфигурации. Верхняя карта получает уже нагретый воздух, нижняя теряет часть площади для забора воздуха, а вентиляторы работают на повышенных оборотах.
Проверьте расстояние между картами, ориентацию их кулеров, расположение слотов и фактическую температуру каждой GPU. Размеры видеокарт, материнской платы и корпуса определяют результат сильнее абстрактного количества вентиляторов. Дополнительный вентилятор без понятного направления потока иногда лишь перемешивает горячий воздух.
Как вывести тепло из комнаты, а не только из корпуса
Корпусные вентиляторы перемещают тепло от радиаторов в помещение. Для снижения температуры комнаты нужен воздухообмен самого помещения: проветривание, работающая вытяжка или организованный вывод теплого воздуха в другую хорошо проветриваемую зону.
Разместите системный блок так, чтобы выхлоп не упирался в стену и не возвращался к впуску. Не направляйте горячий поток на место пользователя и не перекрывайте вентиляционные отверстия случайным коробом или тканью. Температура воздуха в комнате ограничивает эффективность любого кулера: чем горячее входящий воздух, тем меньше запас до температурного лимита GPU и CPU.
Как измерить нагрев при локальном инференсе LLM, а не оценивать его на глаз
Температура корпуса рукой и шум вентиляторов дают субъективную оценку. Для воспроизводимого сравнения нужен набор показателей, снятый до и после изменения конфигурации. Измеряйте отдельные компоненты и систему целиком.
Какие данные смотреть в телеметрии GPU и CPU
| Компонент или результат | Что фиксировать | Зачем это нужно |
|---|---|---|
| Каждая GPU | Мощность, загрузка, температура ядра, hotspot при наличии, частота, обороты вентиляторов | Показывает источник тепла и причину роста шума |
| VRAM | Температуру памяти, если датчик доступен | Помогает обнаружить локальный перегрев, который не виден по температуре ядра |
| CPU | Загрузку, температуру, частоту и потребление при доступности показателя | Выявляет нагрузку при offload, токенизации и обработке запросов |
| Вся система | Мощность через ваттметр и температуру воздуха в комнате | Отделяет нагрев помещения от температуры отдельного чипа |
| LLM | Токены в секунду, время до первого токена, длительность ответа и ошибки | Показывает цену более холодного режима в производительности |
Для видеокарт с доступным датчиком VRAM полезно смотреть память отдельно от ядра. Методика мониторинга температуры видеопамяти на RTX 3090 разобрана в материале о температуре VRAM при инференсе LLM. Конкретные безопасные пределы зависят от устройства и его системы охлаждения.
Как сравнивать режимы корректно
Снимите базовый профиль на исходных настройках. Используйте одинаковую модель, файл, формат, runtime, контекст, параметры генерации и число параллельных запросов. Для честного сравнения дождитесь прогрева корпуса и записывайте установившийся режим, а не первую минуту работы.
После этого сравните три состояния: исходная конфигурация, ограничение мощности и ограничение мощности вместе с улучшенным airflow. Если менялись частоты, вынесите их в отдельный этап. Иначе станет непонятно, какой параметр дал результат.
Контролируйте продолжительность тестового сеанса и температуру воздуха в комнате. Один и тот же риг при холодном старте и после нескольких часов непрерывной работы дает разные показатели.
Как понять, что проблема уже не в настройках LLM
- Температура воздуха на входе в корпус уже высокая.
- Обороты вентиляторов резко растут при умеренной мощности GPU.
- Между двумя видеокартами наблюдается сильная разница температур.
- Частоты нестабильны, хотя лимит мощности не достигнут.
- Температуры резко меняются при открытии боковой панели.
- Радиаторы, фильтры или вентиляторы загрязнены.
- Runtime сообщает ошибки, связанные с нехваткой памяти, offload или передачей данных.
Эти признаки задают направление диагностики. Они не заменяют измерения и не доказывают неисправность конкретного компонента.
Для систем, которые работают постоянно, полезно ориентироваться на практики наблюдения за GPU, VRAM, очередями и температурой, описанные в runbook мониторинга production-инференса LLM. Домашний риг проще, но набор базовых метрик остается похожим.
Практический профиль для домашнего AI-рига: порядок настройки и контроль результата
Настраивайте систему последовательно. Сначала исключите ошибки запуска и проблемы с корпусом, затем меняйте энергопотребление и частоты. Такой порядок оставляет понятную точку возврата.
Базовый режим без экстремального тюнинга
- Проверьте точный файл модели, формат, runtime, версию драйвера и логи загрузки.
- Убедитесь, что модель размещается в памяти так, как вы ожидаете, и не уходит в неожиданный offload.
- Снимите телеметрию обеих GPU, CPU, ваттметра и температуры комнаты.
- Проверьте фильтры, направление потока, расстояние до стены и положение второй GPU.
- Установите умеренный
power limitотдельно для каждой карты. - Повторите длительный сеанс с той же моделью и тем же запросом.
- Корректируйте частоты только после сравнения первого изменения.
Консервативный профиль обычно строится на штатном драйвере, исправном runtime, свободном воздушном потоке и умеренном ограничении мощности. Не переносите значение лимита, частоты или кривую вентиляторов с другой видеокарты: одинаковое название GPU не учитывает конкретный кулер, корпус, прошивку и температуру помещения.
Как понять, что настройки пора откатить
Вернитесь к последнему стабильному профилю при появлении ошибок runtime, зависаний, сбоев генерации, резкого падения скорости, нестабильных частот или проблем во время длинного контекста. Отдельно проверьте ситуацию, когда короткий ответ проходит успешно, а длительный сеанс завершается ошибкой.
Меняйте по одному параметру и сохраняйте его значение вместе с результатами измерения. Такой журнал может содержать мощность всей системы, показатели каждой GPU, скорость токенов в секунду, температуру комнаты и замечания по шуму. Без записи легко вернуться к неудачной комбинации случайно.
Что важнее для постоянной работы: скорость или ватт
Для интерактивного чата приоритетом часто служит время до первого токена и привычная скорость выдачи. Для фонового агента важнее стабильная работа, умеренный шум и предсказуемое потребление на протяжении всего сеанса.
Сравнивайте эффективность как полезный результат на единицу энергии: скорость генерации, деленная на среднюю мощность, дает более содержательную картину, чем один показатель токенов в секунду. Учитывайте цену ожидания, нагрев комнаты, длительность задачи и количество параллельных запросов. Экономичный профиль оправдан, когда он сохраняет нужную скорость и заметно снижает постоянную нагрузку на помещение.
Частые вопросы о нагреве домашнего AI-рига
Поможет ли power limit GPU уменьшить нагрев комнаты?
Да, если ограничение снижает среднее потребление всей системы. Температура GPU и температура комнаты связаны через тепловой поток, но не совпадают. Смотрите ваттметр и длительность сеанса, а не один датчик на видеокарте.
Можно ли снизить нагрев только кривой вентиляторов?
Кривая вентиляторов может изменить температуру компонентов и шум. Она не убирает энергию из системы. Для охлаждения комнаты нужно снизить среднюю мощность или улучшить воздухообмен помещения.
Что настроить первым: power limit или вентиляцию?
Если проблема выражается в высокой суммарной мощности и постоянном нагреве комнаты, начните с измерений и power limit. При большой разнице между GPU, резком росте оборотов или быстром перегреве корпуса сначала проверьте airflow и расположение карт.
Почему после снижения температуры скорость LLM может упасть?
Ограничение энергопотребления или частот уменьшает доступный запас производительности GPU. Падение зависит от модели видеокарты, runtime, формата модели, размера контекста и характера нагрузки. Сравнивайте токены в секунду, время до первого токена и стабильность длинных запросов.