人工智能 (AI) 基礎設施正進入全新的關鍵階段。生成式 AI 基礎設施的首個發展階段以加速器規模為核心特征,聚焦 GPU、NPU 及定制 AI 加速器的部署、供電、散熱與互聯能力。該階段尚未落幕,但已無法滿足當前發展需求。
下一階段的核心是機架級系統組合:通過異構 AI 機架,讓不同計算資源分別針對智能體 AI 工作流的各階段完成專項優化。由 CPU、加速器、內存、網絡設備組成的專用機架,正被整合為吉瓦級 AI 超級集群,每一臺機架都作為高密度計算引擎,承載工作流中的特定任務。
AI 推理正從單次模型調用,演進為多步驟智能體流水線。基礎設施設計的重心,也從單一聚焦加速器規模,轉向更宏觀的系統組合問題:如何為智能體 AI 工作流的各個階段匹配適合的計算資源。加速器仍是預填充、解碼與模型執行的核心;而 CPU 則在外圍編排層發揮關鍵作用,支撐智能體跨工具、API、檢索系統、云原生服務開展任務分發與多輪模型調用。
這一轉變意義重大,因為推理的運行結構正在發生質變。傳統推理大多是線性流程:請求進入系統、模型生成響應,單次事務隨即結束。智能體 AI 的運行模式則完全不同:智能體可自主規劃任務、檢索數據、調用工具、運行代碼、請求 API、基于中間結果推理,并循環執行多次模型調用,最終輸出結果。

這正在重塑數據中心的整體形態。越來越多的工作負載不再局限于神經網絡前向傳播,系統更多算力消耗在加速器、內存、存儲、網絡與軟件服務的跨組件協同調度上。基礎設施的大量架構決策,正從服務器層級轉向機架層級。
Austin Lyons 近期在 Chipstrat 中指出:“CPU 并非通用標準化產品,其價值競爭也并非只有單一維度。”這一觀點至關重要。異構 AI 機架不需要普適型的通用 CPU,而是需要針對專項任務優化的 CPU:持續為加速器供給數據、承載內存密集型的解碼運算、處理模型調用間隙的智能體任務。
AI 基礎設施在推理流水線的各個階段日趨專用化,最典型的特征之一就是預填充與解碼流程逐步解耦。預填充階段負責處理輸入提示詞、構建 KV 緩存,屬于計算密集型環節,高度依賴加速器算力。解碼階段逐詞元生成響應內容;隨著上下文長度擴張,該環節會持續受到內存帶寬、內存容量、KV 緩存數據搬移的制約。
異構 AI 機架需要整合各類專用組件,使其協同形成統一的完整系統。它能夠將請求路由至對應計算層級,在預填充與解碼之間高效流轉數據,管理 KV 緩存傳輸、維護會話狀態、執行非模型類任務,并在整條推理流水線中嚴格保障服務等級目標 (SLO)。
正因如此,行業開始以系統級視角審視 AI 基礎設施。數據中心可承載的有效智能體任務規模,并非僅由加速器算力決定,同時取決于 CPU 算力、內存帶寬、網絡性能、軟件編排能力,以及真實工作負載壓力下的系統全局均衡能力。架構設計的核心問題,已從“可部署多少加速器”轉變為“如何為智能體 AI 工作流的各階段做專門的配置與協同調度”。
在該架構下,CPU 的應用場景不再單一,而是呈現多元化分工。
第一類為預填充主機 CPU,負責統籌推理流程中計算密集型階段;第二類為解碼主機 CPU,管理延遲敏感、內存密集型的推理階段;第三類為智能體/工作節點 CPU,作為計算層,承載模型調用間隙的智能體任務。三類角色彼此關聯,但不能采用同一套評估標準衡量。
這種認知重構至關重要。行業以往普遍將“主機 CPU”視為單純的輔助組件,但在機架級異構 AI 架構中,該認知過于片面。基礎設施團隊需要依據推理流水線各層級的差異化任務,針對性評估 CPU 算力。
依托這套新的系統級設計思路,基礎設施團隊可根據真實工作負載特征,對各計算層級進行合理的資源配比。例如,長提示詞、短輸出的工作負載,需要更強的預填充算力;長會話聊天機器人更依賴解碼算力與內存帶寬;企業級多智能體工作流,則需要大量工作節點 CPU 算力支撐工具調用、信息檢索、策略校驗與應用編排。
與此同時,異構基礎設施長期存在的核心壁壘正在被打破。傳統多架構部署存在顯著的軟件適配阻力,包括跨平臺應用移植、軟件棧驗證、性能調優、DevOps 流程適配等繁瑣工作。而智能體開發模式大幅簡化了上述流程,AI 輔助的移植、測試、驗證與運維能力,有效降低了大規模多架構環境的落地周期與風險。
這一變革意義重大,架構設計的核心邏輯已然改變。基礎設施團隊無需再為降低運維復雜度,將所有工作負載強行適配單一默認架構。如今可針對 AI 系統的不同層級匹配最優架構,并通過現代化軟件自動化能力,隱性管控系統復雜度。
這一轉變也重塑了 AI 基礎設施的經濟模型。行業關注點不再局限于“哪款加速器的模型吞吐量最高”,而是聚焦整機架如何將功耗、內存、I/O、軟件調度資源高效轉化為有效 AI 算力產出。
這是系統層面的問題,而非單一組件問題。
這也正是 Arm 架構優勢得以充分釋放的場景。當前 AI 基礎設施正向異構計算、高并發、功耗受限規模化擴容、軟件定義編排演進。此類場景高度依賴每瓦性能、廣泛的生態覆蓋與架構靈活性,而這正是 Arm 的核心優勢。
Arm AGI CPU 專為適配這場行業變革設計,將 Arm 云基礎設施技術路線延伸至新一代智能體 AI 系統,讓 CPU 在任務編排、內存協同、加速器管理與機架級能效優化中承擔核心職責。
異構 AI 機架的核心價值,并非依靠單一參數,而是多項能力的集成優勢:高核心密度、高內存帶寬、高速 I/O、原生支持 CXL、成熟的軟件生態,以及數據中心功耗約束下的高能效表現。這些特性精準匹配前文所述機架級 AI 的三類 CPU 角色:預填充主機、解碼主機、智能體工作節點。
Arm 豐富的生態系統,為基礎設施開發者提供了多元選擇。基于 Arm 架構的 CPU 已廣泛應用于云計算、網絡、邊緣側與 AI 系統。合作伙伴可根據定制化需求與上市周期,靈活選用 Arm IP、Arm 計算子系統或量產芯片方案。隨著 AI 基礎設施分化為多類專用且互聯互通的架構層級,該靈活性的價值愈發凸顯。
行業正跳出“加速器優先”的單一 AI 基礎設施建設思路。加速器依舊關鍵,但僅是系統的組成部分。未來的核心差異化能力,將體現在整機架的編排調度能力、資源利用效率,以及系統在真實智能體工作負載下的運行穩定性。
在智能體 AI 時代,機架即系統,異構架構成為行業常態,CPU 也成為 AI 數據中心架構選型中至關重要的一環。