Энтузиасты нашли способ мониторинга температуры каждого чипа памяти на видеокартах Nvidia RTX 30 и RTX 40
Разгадка скрытой возможности видеокарт NVIDIA
Команда бразильского специалиста по ремонту Пауло Гомес успешно разработала метод получения данных о температуре каждого отдельного модуля видеопамяти на видеокартах NVIDIA серий RTX 30 и RTX 40. Ранее пользователи систем мониторинга могли наблюдать лишь общее значение нагрева VRAM, теперь же стали доступны индивидуальные показания температуры для микросхем GDDR6 и GDDR6X. 
Техническая реализация и методика
Для доступа к данным энтузиасты использовали механизм MMIO (Memory-Mapped I/O), позволяющий определять температуру, связанную с каждым каналом памяти. При этом средство выявляет не только активные каналы, но и отключенные или недоступные в конкретной конфигурации графического процессора.
Эксперименты продемонстрировали важную особенность привычных утилит: показания GPU-Z отражают температуру самого горячего модуля памяти. Так, при тестировании GeForce RTX 3080 выяснилось, что лишь один из чипов достиг 86 °C, в то время как остальные работали при более низких температурах. 
Программное решение для Linux
На основе полученных данных была создана утилита GDDR6/GDDR6X GPU Memory Temperature Reader for Linux. Она считывает температуры VRAM с поддерживаемых графических процессоров NVIDIA, используя результаты обратного инжиниринга драйверов. Для запуска требуется добавить параметр загрузки ядра iomem=relaxed, отключить Secure Boot и установить зависимости libpci-dev.
Программа поддерживает широкий спектр видеокарт, включая RTX 4090, RTX 4080 Super, RTX 4070 Ti Super, RTX 3090 Ti, RTX 3080 и профессиональные модели серии RTX A2000/A4500/A5000/A6000. Экспериментальная поддержка также добавлена для RTX 5090 с памятью GDDR7. 
Практическая значимость метода
Разработанный метод позволяет точно диагностировать перегрев отдельных микросхем памяти, что особенно ценно при ремонте и обслуживании видеокарт. Это дает возможность выявлять проблемы, когда общая температура VRAM находится в норме, но отдельный чип перегревается из-за плохого контакта с термопрокладкой или других факторов.
Для использования утилиты достаточно выполнить команду sudo gddr6 для получения температуры горячей точки памяти или sudo gddr6 --per-module для мониторинга каждого из модулей отдельно. Данные помогают оптимизировать систему охлаждения и продлить срок службы компонентов. 