自英偉達GeForce RTX 50 Blackwell系列顯卡發布以來,一個關于溫度監控的重要變化引發了廣泛關注。
TechPowerUp技術評論員、GPU-Z開發者Wizzard最早確認,英偉達已從RTX 50系列顯卡中移除了熱點溫度的API支持。

GPU-Z、HWiNFO、HWMonitor、MSI Afterburner等主流硬件監控工具再也無法讀取這一關鍵參數,此前曾一度顯示熱點溫度為255℃的異常數值,255在軟件系統中代表無效值。
熱點溫度是GPU芯片表面多個溫度傳感器所報告的最高數值,即核心上最熱的那一個點。
在以往顯卡上,熱點溫度通常比GPU平均溫度高出10℃以上,對于診斷散熱器安裝不當、水冷頭接觸不良或導熱介質涂抹問題非常實用。
如今英偉達只保留GPU溫度和顯存溫度兩個讀數,前者只能反映核心平均溫度,無法暴露局部過熱問題。
巴西硬件改裝者兼維修頻道博主Paulo Gomes通過技術手段成功解鎖了RTX 50系列顯卡上的熱點溫度監測功能。英偉達雖然屏蔽了熱點溫度監測功能,但并未移除對應的熱點溫度傳感器。
戈麥斯的維修工作室陸續收到多張RTX 50系列顯卡,用戶普遍反映游戲性能異常、風扇轉速偏高,但GPU平均溫度讀數仍在正常范圍內。

通過解鎖后的熱點傳感器檢測發現,當GPU平均溫度顯示在70至80℃時,熱點溫度實際已飆升至107℃,顯卡因此觸發了溫度墻的降頻保護機制。
更棘手的是,每次降頻后溫度短暫回落,很快又會再次觸及107℃極限,這是散熱器與芯片接觸不良導致的惡性循環。更換導熱硅脂后,熱點溫度降至100℃左右,顯卡性能隨即恢復正常。

戈麥斯表示,維修實驗室已診斷多塊出現類似癥狀的RTX 50系列顯卡,根源無一例外都是散熱器接觸不良或導熱介質涂抹不當。
這些問題只有通過熱點傳感器才能更準確識別,NVIDIA目前并未提供此項支持。

另外據美國銀行全球研究部最新估算,英偉達下一代Rubin Ultra Kyber機架預估售價高達2100萬美元(約合人民幣1.42億元)。
值得一提的是,僅HBM4e內存一項成本就飆升至153.4萬美元(約合人民幣1017萬元),是標準Rubin Oberon機架的4倍,較Blackwell Ultra提高近5倍。

Rubin VR200 Oberon機架配置72顆Rubin V200 GPU,每顆配備288GB HBM4內存。單機柜合計20.7TB HBM4及54TB LPDDR5X內存。

HBM4成本約18.40美元/GB,較Blackwell的HBM3e高出60%以上。整機售價約600萬美元,是Blackwell NVL72的兩倍。
Rubin Ultra V300每顆GPU集成576GB HBM4e內存。NVL144 Kyber機架采用144顆GPU,整機HBM4e總容量達82,944GB。
盡管每GB成本與Rubin持平約18.49美元,但單機柜HBM總成本膨脹至153.4萬美元。HBM成本占整機售價的7.3%。
建設與運營成本同樣驚人。富士康評估顯示,Vera Rubin AI數據中心每吉瓦建設成本超470億美元,年電費高達13億美元。
盡管如此,英偉達認為Rubin平臺憑借領先的AI性能可實現業內最低的總體擁有成本和Token成本。頭部AI企業已開始部署首批系統。
