Температура видеопамяти (VRAM) на RTX 3090 при инференсе больших языковых моделей (LLM) стабильно достигает 96–104°C. Это не дефект конкретного экземпляра, а массовое явление, подтверждённое сотнями отчётов на Reddit, в GitHub-issues и профильных Discord-каналах. Данные с GPU-Z (параметр Memory Junction Temperature) показывают, что при загрузке модели Llama 2 70B с квантизацией Q4_K_M на 30-минутном прогоне температура памяти выходит на плато в диапазоне 100–104°C, тогда как температура GPU-ядра держится на 20–25°C ниже.
Производитель устанавливает Tj max для чипов GDDR6X на отметке 110°C. Формально работа в пределах этого лимита допустима. Практика показывает: длительная эксплуатация выше 100°C ускоряет деградацию термоинтерфейсов и повышает риск нестабильности. В статье собраны проверенные методы мониторинга, безопасные температурные диапазоны и конкретные шаги по снижению нагрева - от настройки кривой вентиляторов до замены термопрокладок с цифрами «до и после».
Типичные температуры VRAM на RTX 3090 при инференсе LLM: данные сообщества
Сводка реальных замеров, собранная из открытых отчётов пользователей, выглядит так:
- Mistral 7B (FP16, batch size 1): VRAM 86–92°C после 20 минут, GPU 62–68°C.
- Llama 2 13B (Q5_K_M, непрерывная генерация 40 минут): VRAM 90–98°C, GPU 65–72°C.
- Llama 2 70B (Q4_K_M, инференс 30+ минут): VRAM 96–104°C, GPU 70–78°C.
- Mixtral 8x7B (Q4_K_M, batch-обработка): VRAM 94–102°C, GPU 68–75°C.
Разброс в 6–8°C между одинаковыми моделями карт объясняется различиями в корпусах, ambient-температуре в помещении и заводском качестве термопрокладок. Карты Founders Edition в среднем греются на 3–5°C сильнее кастомных версий ASUS TUF или MSI Suprim X из-за менее агрессивного stock-профиля вентиляторов.
Эти цифры - точка отсчёта. Если показатели укладываются в указанные диапазоны, система работает штатно для данного класса оборудования.
Почему VRAM греется сильнее GPU: конструктивные особенности RTX 3090
RTX 3090 использует 24 чипа GDDR6X, размещённых с двух сторон печатной платы: 12 на лицевой стороне (под основным радиатором) и 12 на тыльной. Тыльные чипы контактируют с задней металлической пластиной через термопрокладки, но давление прижима этой пластины значительно слабее, чем у основного кулера. Плюс сама пластина не имеет развитого оребрения и охлаждается только конвекцией внутри корпуса.
GDDR6X работает на частоте 19,5 Гбит/с (эффективная частота памяти 9750 МГц) и потребляет до 60–70 Вт на всю подсистему памяти при полной загрузке. При инференсе LLM нагрузка на VRAM постоянная: модель полностью resides в памяти, и каждое обращение к весам вызывает активную работу чипов. В играх нагрузка циклическая - есть пики и спады, поэтому средняя температура памяти ниже. Инференс LLM создаёт стационарный тепловой режим без окон охлаждения, что и даёт +10–15°C к привычным игровым температурам.
Безопасные диапазоны температур: что говорят спецификации и практика
Разделим температурные зоны на три категории с чёткими порогами:
- Зелёная зона (до 95°C): безопасный диапазон для круглосуточной работы. Никаких деградационных процессов за пределами естественного старения кремния не наблюдается. Большинство кастомных карт с настроенной кривой вентиляторов укладываются в этот диапазон на моделях до 30B.
- Жёлтая зона (95–105°C): допустимо для периодических нагрузок длительностью до нескольких часов. При постоянной работе в этом диапазоне рекомендуется улучшить охлаждение. Производитель не считает это нарушением условий эксплуатации, но практика майнинговых ферм на GDDR6X показывает: после 12–18 месяцев непрерывной работы при 100°C термопрокладки теряют эластичность и температура начинает ползти вверх.
- Красная зона (выше 105°C): непосредственный риск троттлинга. При 110°C чипы GDDR6X начинают пропускать такты, что вызывает резкое падение пропускной способности памяти. Длительная работа в этом режиме за 3–6 месяцев приводит к необратимой деградации - появлению ошибок даже на штатных частотах.
Кратковременные скачки до 108–110°C при старте инференса или смене модели не критичны. Опасность представляет именно плато на этих значениях при установившемся режиме.
Инструменты мониторинга: как правильно измерять температуру VRAM
Для RTX 3090 критичен параметр Memory Junction Temperature - температура внутри корпуса чипа GDDR6X, измеряемая встроенным датчиком. Поверхностная температура платы или радиатора всегда ниже на 15–25°C и не даёт реальной картины.
Три инструмента, которые корректно считывают этот параметр:
- GPU-Z: вкладка Sensors, строка «Memory Temperature (Hot Spot)». Умеет логировать в файл через галочку «Log to file». Самый простой способ для разового замера.
- HWiNFO64: параметр «GPU Memory Junction Temperature» в секции GPU. Даёт детальную статистику: текущее, минимальное, максимальное, среднее значение за сессию. Поддерживает запись в CSV.
- nvidia-smi: на RTX 3090 стандартная команда
nvidia-smiне показывает температуру памяти. Параметрmemory.temperatureв запросах--query-gpuвозвращает N/A. Для консольного мониторинга используйте обёртки вродеnvtopили скрипты, парсящие вывод HWiNFO.
Настройка логирования для длительного инференса
Пример скрипта на Python для записи температур с интервалом 5 секунд через HWiNFO Shared Memory:
import time
import csv
import struct
import mmap
# Подключаемся к shared memory HWiNFO (требуется запущенный HWiNFO с включенным Shared Memory Support)
# Смещения для конкретной версии смотрим в HWiNFO SDK
# Здесь псевдокод - реальные смещения зависят от версии
def read_gpu_memory_temp():
# Чтение через mmap - детали опущены для краткости
# Возвращает температуру VRAM Junction
pass
with open('vram_log.csv', 'w', newline='') as f:
writer = csv.writer(f)
writer.writerow(['timestamp', 'vram_temp', 'gpu_temp', 'memory_used_mb'])
while True:
timestamp = time.strftime('%Y-%m-%d %H:%M:%S')
vram_temp = read_gpu_memory_temp()
writer.writerow([timestamp, vram_temp, 0, 0])
time.sleep(5)
После завершения теста CSV-файл открывается в Excel или Python (matplotlib) для построения графика. Анализируйте плато, а не пики: стабилизировавшаяся температура после 20–30 минут нагрузки - это реальный рабочий показатель.
Практические методы снижения температуры VRAM
Методы ранжированы по соотношению «эффективность / сложность»:
- Настройка кривой вентиляторов в MSI Afterburner: снижение на 2–5°C. Установите 100% оборотов при достижении VRAM 85°C. Шум вырастет, но температура упадёт. Подходит как первый шаг без разборки карты.
- Андервольтинг и снижение частот памяти: снижение на 5–10°C. Уменьшение частоты памяти с 9750 МГц до 9000 МГц в Afterburner снижает энергопотребление VRAM примерно на 10–12 Вт. Потеря скорости инференса - 3–5% токенов в секунду, что некритично для домашнего использования.
- Замена термопрокладок на задней пластине: снижение на 10–20°C. Самый результативный метод. Требует разборки карты и потери гарантии.
- Дополнительный вентилятор на заднюю пластину или водоблок: снижение на 8–15°C. Актуально для сборок в тесных корпусах. Вентилятор 120 мм, направленный на заднюю пластину, даёт +5–8°C снижения без модификаций.
Замена термопрокладок: пошаговый подход и результаты
Для RTX 3090 Founders Edition потребуются термопрокладки Gelid GP-Ultimate 1.5 мм (лицевая сторона) и 2.0 мм (тыльная сторона), плюс термопаста Arctic MX-6 или аналог. Для ASUS TUF толщина может отличаться - 1.5 мм с обеих сторон. Уточняйте параметры в гайдах по конкретной модели.
Последовательность:
- Открутить винты задней пластины и основного кулера.
- Аккуратно разделить плату и кулер (шлейфы вентиляторов - сначала отщёлкнуть).
- Удалить старые прокладки и остатки термопасты изопропиловым спиртом.
- Нарезать новые прокладки точно по размеру чипов памяти.
- Нанести термопасту на GPU и собрать в обратном порядке, равномерно затягивая винты крест-накрест.
Типичные результаты: на Llama 2 70B Q4_K_M температура VRAM падает с 104°C до 82°C при той же нагрузке. GPU-ядро остывает на 5–7°C за счёт снижения общего теплового фона в карте.
Андервольтинг и управление частотами памяти
Программный метод без разборки. В MSI Afterburner:
- Откройте Curve Editor (Ctrl+F).
- Снизьте частоту памяти на 500–750 МГц (до 9000–9250 МГц).
- Зафиксируйте напряжение GPU на 0.850–0.875 В (Flat voltage curve).
- Примените и протестируйте стабильность прогоном llama-bench на 10 минут.
Снижение частоты памяти с 9750 до 9000 МГц даёт падение пропускной способности с 936 ГБ/с до 864 ГБ/с. Для инференса большинства моделей это узкое место не проявляется: скорость генерации на Llama 2 13B падает с 48 до 46 токенов/с (потеря 4.2%). На 70B моделях разница ещё меньше - 2–3%, так как bottleneck смещается в compute.
Влияние температуры на производительность и стабильность инференса
При достижении 110°C (Tj max) чипы GDDR6X включают механизм троттлинга: контроллер памяти начинает пропускать такты для снижения тепловыделения. Частота памяти падает ступенчато - с 9750 МГц до 8100 МГц, затем до 5000 МГц и ниже. Пропускная способность VRAM обрушивается, и скорость генерации токенов падает кратно.
Пример из практики: на Llama 2 13B при штатных 96°C скорость генерации 45 токенов/с. После 15 минут работы в корпусе с плохой вентиляцией температура VRAM достигает 110°C, срабатывает троттлинг, и скорость падает до 15 токенов/с. Модель продолжает работать, но время ответа утраивается.
GDDR6X использует ECC-коррекцию ошибок на уровне контроллера. При умеренном перегреве (100–105°C) ECC маскирует единичные сбои, и пользователь не видит проблем. При длительной работе выше 105°C количество ошибок растёт экспоненциально, ECC перестаёт справляться, и начинаются битовые ошибки в весах модели. Результат - некорректные выводы, нарушение связности текста, «галлюцинации» на ровном месте. Диагностировать эту проблему сложно: внешне карта работает, троттлинга нет, но качество ответов модели деградирует.
Сравнение с другими видеокартами: почему RTX 3090 - особый случай
RTX 3080 использует те же чипы GDDR6X, но только 10 ГБ на односторонней компоновке. Все чипы контактируют с основным радиатором, и температура VRAM редко превышает 88°C даже при полной загрузке. Проблема 3090 - именно в двустороннем размещении и слабом охлаждении тыльной стороны.
RTX 4090 перешла на GDDR6X с улучшенным техпроцессом и полностью переработанной системой охлаждения. Все 24 ГБ размещены на лицевой стороне, кулер имеет сквозной продув, и температура памяти под нагрузкой LLM держится в пределах 72–80°C. Это снимает проблему аппаратно.
NVIDIA RTX A6000 (Ampere, 48 ГБ GDDR6 с ECC) использует память с вдвое меньшим TDP на гигабайт и профессиональную систему охлаждения с испарительной камерой. Температура VRAM под нагрузкой - 65–75°C. Цена в 4–5 раз выше, чем у 3090, но для круглосуточных industrial-нагрузок это оправданный выбор.
RTX 3090 остаётся популярной для локального инференса именно из-за 24 ГБ VRAM при относительно доступной цене на вторичном рынке. Плата за этот объём - необходимость контролировать температуру памяти. При грамотном охлаждении карта способна работать годами без деградации, что подтверждается опытом сборки инференс-серверов на базе RTX 3090 и смежных решений.
При выборе между несколькими картами для сборки AI-станции учитывайте не только объём VRAM, но и тепловой пакет всей системы. Конфигурации с несколькими GPU создают взаимный подогрев, и без продуманной вентиляции корпуса температура памяти выходит в красную зону за 10–15 минут. Статья о memory-bound архитектуре при инференсе на нескольких картах детально разбирает, как распределение модели влияет на загрузку и нагрев каждого GPU. Если рассматриваете альтернативы с большим объёмом VRAM, обратите внимание на сборку на двух RTX 3080 20GB - это даёт 40 ГБ суммарно при сравнимой цене, но с иным тепловым профилем.