AMD近日將GFX1171目標(biāo)代碼并入開源圖形棧Mesa 26.3,為下一代核顯鋪路。該代碼為RADVulkan與RadeonSI的OpenGL驅(qū)動(dòng)提供支持。
GFX1171是AMD代號(hào)RDNA 4m的圖形架構(gòu),歸屬GFX11家族。它并非獨(dú)立顯卡架構(gòu),而是介于RDNA 3.5與RDNA 4之間、主要面向APU的集成核顯方案。

據(jù)悉,此次并入的GFX1171源自早期代號(hào)。AMD于今年2月首次把GFX1170目標(biāo)放入LLVM編譯器,又于3月補(bǔ)齊GFX1171與GFX1172兩個(gè)目標(biāo),三者指令集能力基本一致。
架構(gòu)層面,RDNA 4m支持FP8與BF8數(shù)據(jù)格式,并新增用于加速AI工作負(fù)載的WMPA矩陣指令,為FSR畫質(zhì)增強(qiáng)及AI算力應(yīng)用預(yù)留基礎(chǔ)。
硬件方面,RDNA 4m核顯預(yù)計(jì)將搭載于Zen 6架構(gòu)的Medusa Point APU上。該APU是搭載RDNA 3.5核顯的Strix Point繼任者,對(duì)應(yīng)處理器有望在2027年進(jìn)入筆記本市場。
相比之下,現(xiàn)有RDNA 3.5核顯所屬的Strix Point與Strix Halo因硬件缺乏FP8等指令,無法使用這套新圖形能力,故新核顯的升級(jí)更具前瞻性。
Mesa 26.3將按季度發(fā)布節(jié)奏,預(yù)計(jì)2026年第四季度正式登場。目前AMD尚未對(duì)RDNA 4m作官方說明,具體規(guī)格與落地時(shí)間仍待揭曉。

核顯端剛剛露出冰山一角,AMD在AI賽道上的布局便再落重子。從消費(fèi)級(jí)APU到企業(yè)級(jí)AI推理,這家芯片巨頭顯然不想在任何戰(zhàn)場掉隊(duì)——收購Taalas,就是最直接的信號(hào)。
AMD正式宣布收購AI芯片初創(chuàng)公司Taalas,進(jìn)一步強(qiáng)化其在AI推理領(lǐng)域的戰(zhàn)略布局。
Taalas成立于2023年,總部位于加拿大多倫多,其核心技術(shù)路線與主流GPU、Groq LPU及Cerebras晶圓級(jí)加速器等數(shù)據(jù)流架構(gòu)存在本質(zhì)區(qū)別。
該公司并非依賴傳統(tǒng)的高帶寬內(nèi)存(HBM)存儲(chǔ)模型權(quán)重,而是將權(quán)重直接蝕刻進(jìn)硅片之中,形成模型專用集成電路。
芯片主要由兩個(gè)功能區(qū)域構(gòu)成:用于存儲(chǔ)模型權(quán)重的掩膜ROM召回結(jié)構(gòu),以及用于存放KV緩存和微調(diào)適配器的SRAM召回結(jié)構(gòu)。這一方案有望將推理性能提升一個(gè)數(shù)量級(jí)甚至更多。
今年2月,Taalas發(fā)布了首款測試芯片HC1,采用臺(tái)積電6納米工藝制造。初步基準(zhǔn)測試顯示,該芯片運(yùn)行Meta Llama 3.1 8B模型時(shí),速度達(dá)每秒16,960個(gè)token——這一成績?cè)诋?dāng)時(shí)約為英偉達(dá)GPU的48倍、Cerebras加速器的8.5倍。
盡管Llama 3.1以當(dāng)前標(biāo)準(zhǔn)已非最新模型,但該光罩尺寸芯片的主要目的在于驗(yàn)證技術(shù)概念的可性行。
Taalas計(jì)劃于今年夏季推出第二代HC2芯片,目標(biāo)將單芯片支持的參數(shù)量提升至200億。雖然這一數(shù)值本身并不算龐大,但通過類似GPU的流水線并行方式,權(quán)重可分布在多顆加速器上協(xié)同運(yùn)行。
以單芯片200億參數(shù)計(jì)算,僅需50顆加速器即可支撐萬億參數(shù)級(jí)別的大模型,而AMD擁有機(jī)架級(jí)計(jì)算平臺(tái)與內(nèi)部系統(tǒng)設(shè)計(jì)團(tuán)隊(duì),足以承接這一需求。
作為對(duì)比,英偉達(dá)近期發(fā)布的LPX系統(tǒng)在運(yùn)行同等規(guī)模模型時(shí),需數(shù)十顆GPU與至少2000顆Groq LPU配合,Taalas方案在空間占用與功耗效率方面具備顯著優(yōu)勢。
據(jù)知情人士透露,AMD計(jì)劃將Taalas技術(shù)芯片與Instinct系列的Helios機(jī)架配對(duì)使用,構(gòu)建分離式架構(gòu):計(jì)算密集型的提示詞處理由GPU負(fù)責(zé),token生成任務(wù)則卸載至Taalas加速器。
另一種部署模式為,客戶先在Instinct加速器上部署和驗(yàn)證模型,待效果確認(rèn)后再遷移至Taalas加速器,形成類似“tick-tock”的迭代節(jié)奏。
此前,AMD在AI領(lǐng)域持續(xù)加碼并購:2024年以6.65億美元收購AI模型開發(fā)商Silo AI,隨后以49億美元收購服務(wù)器廠商ZT Systems,為Helios機(jī)柜產(chǎn)品線奠定基礎(chǔ);此外,公司還收購了包括推理軟件開發(fā)商MK1在內(nèi)的多家AI初創(chuàng)企業(yè),加速完善其AI全棧生態(tài)。
