近日亞利桑那州立大學研究員公開了針對英偉達CMP 170HX專用礦卡的破解方案。通過利用GPU安全協處理器的棧溢出漏洞,研究人員成功繞過了官方的物理熔絲鎖定,實現了算力與顯存的雙重解鎖。
破解后該卡最高顯存可以達到80GB,AI算力提升約31倍,消息一經傳出,該卡二手市場價格迅速飛漲,目前國內價格已經從300-500元,飆升到3000-4000元,國外市場甚至賣到1500美元(約合人民幣10131元)。

礦卡起源與安全機制
CMP 170HX是英偉達于2021年加密貨幣挖礦熱潮期間推出的專用礦卡,搭載與數據中心旗艦A100完全相同的GA100核心及HBM2e顯存封裝,首發售價約5000美元(約合人民幣33772元)。
2022年以太坊轉向權益證明(PoS)機制后,該卡迅速退役,二手價格一度跌至400-500美元(約合人民幣2880-3600元)。
英偉達官方此前聲明,該卡通過OTP熔絲(一次性可編程熔絲,物理熔斷后不可恢復)在出廠時施加了多層硬件限制,理論上不可逆轉。

但實際上CMP 170HX是一張被固件和OTP熔絲聯合鎖定的閹割版A100,其GA100芯片物理完整,HBM2e顯存帶寬高達1500 GB/s,但出廠時被施加了四道硬限制:
第一、FP32 FMA/MAD吞吐量壓制至0.39 TFLOPS,僅為完整A100標稱FP32算力(約19.5 TFLOPS)的2%。
第二、顯存容量通過固件限制在8GB或10GB,而物理封裝的HBM裸片遠超此容量。
第三、PCIe從Gen4 x16降至Gen1 x1,實際帶寬僅約1GB/s,且PCB上有12對差分信號線的交流耦合電容在出廠時直接省略未焊接。
第四、NVLink多卡互連功能完全禁用。
破解原理
研究團隊在破解該卡時沒有嘗試直接對抗OTP熔絲的物理鎖定,而是從英偉達GPU的安全架構本身找到了突破口。
英偉達GPU的安全模型分為三層:底層是OTP熔絲,記錄物理熔斷狀態。中層是運行在硬件隔離區的固件,負責讀取熔絲并執行對應限制。頂層是簽名校驗與棧保護等內存安全機制,用于阻止中層固件被篡改。

該論文展示的攻擊鏈利用了其中三個設計缺陷,首先是Falcon安全協處理器的棧保護參考值(stack canary)被工具鏈默認放置在可寫的數據段末尾,且該區域沒有MPU只讀映射,也沒有RELRO保護。
攻擊者通過簽名緩沖區的線性溢出,用一個統一值同時覆蓋canary副本和返回地址,使棧校驗直接通過。
其次是由于攻擊入口是一個無邊界檢查的DMA傳輸,簽名驗證例程通過DMA從主機拉取簽名數據時,傳輸長度由攻擊者可控的結構體字段決定,目標緩沖區不做邊界校驗。
因為DMA傳輸在代碼層面僅為幾條寄存器寫入指令,常規靜態分析工具無法將其識別為一次內存拷貝,導致該漏洞近乎隱形,無法觸發代碼審計。
最后的缺陷則是Falcon微碼在HS模式下的執行環境完全確定,無并發、無中斷、無動態內存分配。
實操方法
研究團隊據此搭建了周期精確的離線模擬器,可精確還原溢出瞬間的內存布局,無需實時反饋即可完成攻擊。

具體操作路徑為,利用無界DMA溢出漏洞在HS模式下劫持程序計數器,獲取HS權限后重寫特權級掩碼(PLM),將原本只讀的熔絲覆蓋寄存器開放為可寫。
隨后通過PCIe BAR0逐一修改SM速率、顯存配置和PCIe速度的寄存器值,由于這些寄存器位于常開電源域,寫入后即使功能級復位或重裝驅動也不會被清除,整個解鎖操作只需執行一次。
解鎖后性能數據
解鎖后的實測數據顯示,FP32算力從0.39 TFLOPS提升至94 TFLOPS(原文稱提升約31倍,但按原始數據計算約為241倍,差異可能源于不同測試精度或基準口徑,論文未做進一步說明)。
FP64從0.2 TFLOPS提升至12 TFLOPS,Tensor Core負載幅度提升約15倍,顯存從10GB擴展至80GB,經全地址寫入不同哈希值再讀回的嚴格方式驗證,確認所有地址均映射至真實物理內存,PCIe從Gen1 x1(約250 MB/s)恢復至Gen2 x16(約8 GB/s)。

國內影響
論文公開后,國內技術社區迅速跟進驗證,B站多位UP主展示了在Windows環境下使用解鎖后的CMP 170HX運行ComfyUI進行AI圖像和視頻生成的實際效果,也有用戶嘗試跑大語言模型推理。
因為GA100核心原生支持標準英偉達驅動,解鎖后的卡在Windows和Linux下均可被系統直接識別為計算設備,無需額外修改驅動。
除此之外社區還發現,不同批次的CMP 170HX使用不同供應商的HBM顆粒,三星16Gb顆粒版本(出廠標稱10GB)可解鎖至40GB或80GB,SK海力士顆粒版本(出廠標稱8GB)理論上限約64GB。

雖然破解后的卡很好用,但購買前需還注意多個風險因素,該論文發表至今不足兩個月,破解的長期穩定性、持續負載下的溫度與顯存錯誤率等均缺乏獨立第三方測試數據。
每張卡的芯片缺陷區域分布不同,并非所有卡都能穩定解鎖至80GB,原卡的機房強制風冷設計在家用機箱中通常需要改裝水冷散熱。
此外也不排除部分商家可能借破解消息抬價,實際出貨為未解鎖或無法解鎖的卡。
還有個題外話,十年前的8月2日,NVIDIA正式發售基于Pascal架構的TITAN X顯卡,這款產品在7月21日公布,定價1200美元,國內首發價9499元。
該卡的官方名稱就是NVIDIA TITAN X,后來又加上去Pascal后綴,用于區分2015年3月基于Maxwell GM200核心的GeForce GTX TITAN X。
不過顯卡頂部依然有“GeForce GTX”字樣的信仰燈,輔助背板上也印著完整的“GeForce GTX Titan X”。
規格方面,TITAN X(Pascal)搭載GP102核心,采用臺積電16nm FinFET工藝,晶體管數量約120億個,3584個CUDA核心,基礎頻率1417MHz,加速頻率1531MHz。
顯存為12GB GDDR5X,384-bit位寬,等效速率10Gbps,帶寬約480GB/s,整卡功耗250W,供電接口為一個6針加一個8針。
TITAN X(Pascal)發售后四天,NVIDIA又公布了完整版GP102的Quadro P6000專業卡,啟用全部3840個CUDA核心并將顯存翻倍至24GB,但TITAN X是首款實際到達消費者手中的GP102產品。
七個月后的2017年3月10日,NVIDIA用同一顆GP102核心推出了被許多玩家視為史上最經典高端顯卡的GeForce GTX 1080 Ti。
這款卡擁有與TITAN X相同的3584個CUDA核心,定價卻只有699美元(國內為5699元),顯存容量縮減至11GB,位寬降至352-bit,但GDDR5X速率提升到11Gbps,帶寬反而達到484GB/s。NVIDIA官方表示GTX 1080 Ti的游戲性能超過了TITAN X。
2017年4月,完整啟用3840個CUDA核心的GP102又以TITAN Xp的身份回歸消費市場。


