RTX 5070 Ti может уронить длительную CUDA-задачу так, что в системном журнале останется строка NVRM: krcWatchdog_IMPL: RC watchdog: GPU is probably locked! Notify Timeout Seconds: 7, а повторно воспроизвести падение не получится. Ровно такой случай описал пользователь в обсуждении на r/LocalLLaMA: новая карта работала нормально, пока он не оставил её на шестичасовой CUDA-задаче, ближе к концу которой GPU отказала. До этого у автора были RTX 3090, RTX 4090 и RTX 2080 Ti, и на них длительные вычислительные нагрузки шли стабильно.
Короткий ответ на главный вопрос: подтверждён только сам инцидент и строка в логе. Причина не установлена. Связь с PCIe Gen 5 у Blackwell, упоминания XID 79 и GSP timeout, а также слова об официальном признании проблемы компанией Nvidia идут со слов автора кейса и из сторонних обсуждений, без первоисточника. Пока это единичный случай, а не измеренная статистика отказов.
Что произошло: разбор реального случая с RTX 5070 Ti
Хронология из исходного сообщения короткая. Пользователь купил RTX 5070 Ti, карта вела себя нормально, а затем он запустил CUDA-задачу длительностью около шести часов. Ближе к завершению GPU перестала отвечать, и в системном журнале появилась запись NVRM: krcWatchdog_IMPL: RC watchdog: GPU is probably locked! Notify Timeout Seconds: 7. Повторный запуск той же задачи сбой не воспроизвёл.
Автор подчёркивает, что его код стабильно работал на RTX 3090, RTX 4090 и RTX 2080 Ti, поэтому не склонен винить собственную реализацию. Это его оценка, а не проверенный факт: отдельного теста, который доказал бы корректность кода, в источнике нет. Версия драйвера, сборка CUDA, модель материнской платы, блок питания, температуры и режим питания карты в сообщении не указаны, поэтому восстановить конфигурацию по одной строке лога невозможно.
Что означает сообщение NVRM krcWatchdog
krcWatchdog - это сторожевой таймер в драйвере Nvidia. Его задача простая: следить, отвечает ли GPU на запросы драйвера. Если ответа нет дольше заданного окна, драйвер фиксирует вероятную блокировку. В этом логе окно равно 7 секундам, и именно оно попало в текст сообщения.
Дальше начинается важное. Формулировка "GPU is probably locked" описывает симптом, а не диагноз. Она не говорит, что именно сломалось: питание, линк PCIe, прошивка GSP, состояние чипа, драйвер или сочетание нескольких факторов сразу. Из строки про таймаут 7 секунд нельзя вывести ни причину, ни виновника.
XID 79 и GSP timeout: чем они отличаются от krcWatchdog
Три термина часто смешивают, хотя означают они разное.
- krcWatchdog - сообщение драйвера о том, что GPU не отвечает в отведённом окне.
- XID 79 - код ошибки Nvidia, который в обсуждениях связывают с падением GPU с шины (GPU has fallen off the bus). Упоминается как тема дискуссий, без деталей проявления и без привязки к конкретному сценарию.
- GSP timeout - таймаут GPU System Processor, отдельного процессора на карте, который берёт на себя часть служебных задач. Оговорка та же: в источнике это только упоминание из обсуждения на Reddit, а не разобранный кейс.
Практический вывод простой. Если в логе есть только krcWatchdog, у вас нет оснований писать в багрепорте про XID 79. Если видите XID 79 или GSP timeout, не факт, что дело в том же механизме, что дал строку про RC watchdog.
Blackwell и PCIe Gen 5: что подтверждено, а что слухи
Дальше кейс переходит из плоскости "одна карта, один лог" в плоскость "поколение целиком". Здесь стоит расставить три уровня достоверности.
- Подтверждено: единичный инцидент с RTX 5070 Ti и конкретная строка в системном журнале.
- Со слов автора кейса: что от зависаний страдают RTX 5070, RTX 5080 и RTX 5090, что жалобы уже появлялись на Reddit и что Nvidia признала проблему лишь в последние несколько месяцев.
- Предположение: что причина в сбое PCIe Gen 5.
Второй и третий пункты не стоит читать как первый. Даже если жалобы на Reddit действительно есть, это не статистика отказов: никто не считал, сколько карт работает без сбоев, на каких нагрузках и на каком железе.
Почему PCIe Gen 5 считают вероятной, но недоказанной причиной
PCIe Gen 5 работает на более высокой частоте, чем Gen 4, и требования к целостности сигнала у него выше. Проблемы с линком на высоких скоростях - известный класс сложностей, и не только у Nvidia: тут важны качество разъёмов и контактов, длина трасс, состояние райзера, настройки BIOS материнской платы.
Логика "высокая скорость, значит виноват линк" выглядит правдоподобно, но проверяемой связи в предоставленных материалах нет: ни официального заявления Nvidia, ни измерений, ни анализа сигнальной целостности. Поэтому корректная формулировка звучит так: PCIe Gen 5 обсуждается как возможная причина. Утверждать "причина в PCIe Gen 5" оснований нет.
Что значит «Nvidia признала проблему» и почему это надо перепроверять
Фраза об официальном признании дана со слов автора кейса. Ссылки на релиз, документ, запись в базе знаний или release notes драйвера в источнике нет. Это не значит, что признания не было. Это значит, что здесь оно не подтверждено первоисточником.
Проверить можно за несколько минут самостоятельно: release notes драйверов Nvidia на предмет упоминаний Blackwell, PCIe и известных проблем; база знаний и официальный форум Nvidia; тикеты и статусы у вендора карты. Если в release notes нет ни слова про ваш сценарий, рассчитывать на "уже починили" не стоит.
Почему сбой не воспроизводится и что это говорит о проблеме
Интермиттентные сбои обычно живут на границах режимов. Температура подошла к порогу троттлинга. Линк PCIe пересогласовал скорость. Питание просело в момент пика. Драйвер и GSP разошлись по таймингам. Каждый фактор по отдельности безобиден, вместе они дают отказ раз в несколько часов подряд.
Шестичасовая задача - как раз тот сценарий, где такие условия накапливаются. Десятиминутный тест их не поймает, поэтому и воспроизведение с первого раза не срабатывает.
Практический смысл этого прост. Неудачная попытка воспроизвести сбой не доказывает ни того, что проблема была разовой, ни того, что она системная. Это отсутствие данных, а не вывод. По той же причине неверно списывать инцидент на "плохой код": доказательств нет ни в одну, ни в другую сторону.
Обходные пути: что обсуждает сообщество и чего они стоят
Оговорка перед списком: в исходных материалах нет ни одного подтверждённого обходного пути для этой проблемы. Ниже направления, которые логично следуют из контекста и обсуждаются в сообществе. Ни одно из них не стоит считать рабочим решением.
Переключение PCIe Gen 5 на Gen 4: кому и зачем
Понижение скорости линка в BIOS - типовой приём диагностики. Если сбой связан с целостностью сигнала на высокой частоте, Gen 4 может его убрать. Если причина в другом, ничего не изменится, только линк станет медленнее.
Цена вопроса обычно невелика: в CUDA-задачах, где данные уже лежат в VRAM, пропускная способность PCIe редко оказывается узким местом. Другой разговор, когда идёт активный обмен между CPU и GPU, выгрузка слоёв LLM в системную память или работа через внешний бокс. Там потеря линий и скорости линка ощущается сразу, и мы отдельно разбирали, как плохой райзер и слабый контакт превращают PCIe x4 в x1.
Конкретных процентов потери производительности при переходе на Gen 4 в источниках нет, поэтому цифры лучше измерять на своей задаче, а не брать из форумов.
BIOS, драйверы и GSP: что имеет смысл обновлять
Что реально можно обновить и проверить:
- BIOS материнской платы, особенно на новых платформах, где производители выпускают версии с правками по PCIe.
- Драйвер Nvidia: смотреть release notes на упоминания Blackwell, PCIe и известных проблем.
- Прошивка GPU, если вендор публикует обновления через официальные утилиты.
Отключение GSP в сообществе иногда обсуждают как обход таймаутов GPU System Processor. Это нестандартный шаг с побочными эффектами, и в предоставленных материалах нет ни методики, ни подтверждения, что он помогает. Как рабочую рекомендацию его давать нельзя.
Отдельный пункт, который часто упускают: питание и райзер. Если карта подключена через переходник, а БП работает на пределе, сбой линка и просадка питания дают похожую картину в логе. Проверить дешевле, чем менять карту.
Что делать прямо сейчас, если у вас зависла Blackwell в CUDA
Порядок действий при сбое:
- Зафиксировать точное время падения задачи.
- Выгрузить логи ядра с фильтром по NVRM, XID и krcWatchdog, пока их не вытеснили новые записи.
- После перезагрузки проверить состояние GPU через
nvidia-smi. - Сохранить версии драйвера, BIOS материнской платы, модель GPU, версию CUDA и состав библиотек.
- Если сбой повторяется, воспроизвести его на минимальном скрипте, чтобы отделить код от железа.
- При повторяемости открывать тикет у Nvidia и у вендора карты.
Без логов и повторяемости и багрепорт, и заявка на RMA почти бесполезны.
Как читать логи: journalctl, dmesg, nvidia-smi
Базовый набор команд в Linux выглядит так:
journalctl -k --since "2026-10-08 12:00" | grep -i nvrm
dmesg | grep -iE "nvrm|xid|krcwatchdog|gsp"
nvidia-smi -q
Искать стоит строки с NVRM, krcWatchdog, GSP и XID с числовым кодом. Вывод nvidia-smi -q полезен тем, что показывает текущую ширину и скорость линка PCIe относительно максимальных, температуры и потребление. Расхождение текущей ширины линка с максимальной - повод проверить слот, райзер и настройки BIOS, а не сразу грешить на чип.
Когда стоит задуматься об RMA
Критерии, по которым проблема похожа на дефект карты: сбой повторяется на разных задачах и разных версиях драйвера; воспроизводится на другой материнской плате; в логах стабильно появляется XID 79 или другие аппаратные XID.
Если сбой был единичным и больше не повторялся, RMA маловероятно поможет: вендор не сможет подтвердить дефект и вернёт карту с формулировкой "неисправность не выявлена". Практическая логика та же, что при любом отказе железа, и мы разбирали её на примере реальной истории отказа AI-станции и процедуры RMA: сначала доказательства, потом заявка.
Стоит ли покупать Blackwell под длительные CUDA-нагрузки
Взвешенный ответ без категоричности. Если задача - длительные CUDA-нагрузки (локальные LLM, обучение, инференс), а рабочая RTX 3090 или RTX 4090 уже есть, спешить с апгрейдом на Blackwell смысла мало, пока ситуация не прояснится. Если карта покупается впервые, учитывайте два факта: подтверждённой статистики отказов нет, но и гарантий стабильности в многочасовых задачах тоже никто не даёт.
Для локальных LLM у 3090 остаётся козырь в виде 24 ГБ VRAM, и это часто важнее скорости линка. На Blackwell под большие модели смотрят в том числе из-за объёма памяти и поддержки новых форматов квантизации, но конфигурации вроде двух RTX 5090 без NVLink требуют отдельной проверки: длинный контекст на двух RTX 5090 через PCIe упирается в обмен по шине и в то, как реально расходуется KV-кэш.
Категоричных "берите" или "не берите" тут быть не может. Решение зависит от того, сколько простоев вы готовы терпеть на текущей задаче.
Куда сообщать о проблеме и где следить за обновлениями
Обращаться стоит по цепочке: официальный форум и база знаний Nvidia, тикет в поддержку Nvidia, вендор карты (ASUS, MSI, Gigabyte и другие). В сообществе тема живёт в r/nvidia и r/LocalLLaMA, именно там, судя по исходному обсуждению, всплывали GSP timeout и XID 79. Конкретные ветки и темы лучше искать поиском по коду ошибки.
К обращению приложите строки логов с NVRM и XID, точную версию драйвера, версию BIOS, модель материнской платы и GPU, а также описание нагрузки и её длительности. Чем воспроизводимее описание, тем выше шанс, что обращение не закроют шаблонным ответом.
И главное напоследок: один зависший RTX 5070 Ti на шестичасовой задаче - это повод проверять своё железо и собирать логи, а не доказательство того, что всё поколение Blackwell нестабильно. Разница между этими утверждениями и есть разница между техническим разбором и слухом.