

近日,谷歌研究院發布了 TurboQuant 壓縮算法,能夠在提升運行速度并保持準確性不變的前提下,降低大語言模型(LLM)的內存占用。如果 TurboQuant 成功落地,可將 AI 運行時的 “工作內存”,也就是鍵值緩存(KV cache)壓縮至少 6 倍,并在 H100 顯卡上實現最高 8 倍的速度提升,從而大幅降低 AI 運行成本。
Cloudflare 的 CEO Matthew Prince 等人甚至稱,這是谷歌的 “DeepSeek 時刻”。此前,中國 AI 模型 DeepSeek 實現這樣的效率飛躍:該模型在性能保持競爭力的情況下,訓練成本僅為對手的零頭,且使用的芯片性能較差。

而 TurboQuant 最關鍵的亮點是:精度零損失。無需微調,無需訓練數據。直接接入任意 Transformer 模型,即可讓鍵值緩存壓縮至原體積的一小部分,同時輸出結果完全一致。如果這一效果能在實際生產環境中成立,將一夜之間改變長上下文推理的成本格局。
此外,TurboQuant 發布短短數小時內,內存類股票應聲下跌:美光科技跌 3%,西部數據跌 4.7%,閃迪跌 5.7%。原因是投資者開始重新估算,AI 行業未來實際需要的物理內存可能會大幅減少。
在LLM(大語言模型)推理過程中,為了處理長文本,系統必須將過往對話信息存放在KV Cache中,這如同AI的“隨身筆記本”。隨著對話長度增加,這本筆記本需要存儲的信息會迅速擠爆AI GPU的高頻寬內存(HBM),成為AI運行的最大瓶頸。
谷歌的TurboQuant技術的核心優勢在于解決了傳統內存壓縮技術產生的“內存噪聲”(Overhead)。該技術由兩大關鍵部分組成:
PolarQuant(極坐標量化):傳統向量以XYZ坐標標注,運算繁瑣。谷歌改為采用“極坐標”邏輯,將復雜的方位簡化為“半徑”與“角度”。這好比將原本要標記“往東走3公里、再往北走4公里”的信息,簡化為“以37度角走5公里”。這種幾何結構的轉換,大幅減少了數據處理的負荷。

QJL(Quantized Johnson-Lindenstrauss):這是一套極其精簡的1bit數學校正機制。僅利用額外的1bit來精準修正壓縮過程中的殘余誤差,讓模型即使被壓縮到僅剩3bit,在LongBench等多項基準測試中仍能達成“零精度損失”。

△在Llama-3.1-8B-Instruct模型上,TurboQuant 在LongBench基準測試中展現出強大的 KV 緩存壓縮性能,優于各種壓縮方法 (括號中標明了位寬)。
谷歌選擇將這套足以成為核心競爭力的技術完全開源,不僅優化了Gemini等大型模型的檢索效率,更為其他大模型減少對于內存依賴,加速端側AI發展鋪平道路。
根據實測,在英偉達(NVIDIA)H100加速器上,TurboQuant相比未壓縮方案,性能最高提升了8倍,且無須重新訓練模型即可直接掛載,堪稱AI部署的降本增效的“神兵利器”。

△在NVIDIA H100加速器上,TurboQuant 在計算鍵值緩存中的注意力邏輯值方面表現出顯著的性能提升,在各種位寬級別上均優于高度優化的JAX基線。

△TurboQuant 展現出強大的檢索性能,在GloVe數據集 (d=200)上實現了相對于各種最先進的量化基線的最佳1@k 召回率。
Cloudflare首席執行官Matthew Prince等人將TurboQuant稱為谷歌的“DeepSeek時刻”,認為其有望像DeepSeek一樣,通過極高的效率收益大幅拉低AI的運行成本,同時在結果上保持競爭力。
內存需求會降低,
還是會帶來更大需求?
針對TurboQuant技術會引發了整個市場對于內存需求斷崖式下跌的擔憂,產業專家與研究機構也給出了截然不同的看法:
富國銀行(Wells Fargo)分析師Andrew Rocha指出:“當context window(上下文窗口)越來越大,KV Cache的爆炸性成長原本是推升內存需求的保證。但TurboQuant正在直接攻擊這條成本曲線,一旦被廣泛采用,數據中心對內存容量的規格要求將被打上大問號?!?/span>
不過,知名投行摩根士丹利(Morgan Stanley)和研究機構Lynx Equity Strategies則給出了截然不同的觀點,
摩根士丹利認為市場可能忽視了“效率提升帶動總量增長”的經濟規律。當AI計算所需的內存成本降低到原本的1/6,這將會使得原本因內存太貴而無法上線的AI應用(如長文本翻譯、復雜代碼生成)需求大規模爆發,反而會填補、甚至超越被壓縮掉的內存缺口。
這就是杰文斯悖論(Jevon's paradox),即當技術進步提高了使用資源的效率(減少任何一種使用所需的數量),但成本降低導致需求增加,令資源消耗的速度不減反增。
摩根士丹利分析師約瑟夫·摩爾(Joseph Moore)及其團隊在周四發布的投資者報告中指出: “有報道稱谷歌的TurboQuant會導致內存使用量減少了到原來的1/6,但這忽略了他們僅僅指的是KV Cache,而不是整體內存使用量。
“值得注意的是,谷歌的 Gemini 3 和 2.5 Pro 模型都擁有 100 萬個Token的上下文窗口,但谷歌曾透露,他們使用 Gemini 1.5 Pro 測試過高達 1000 萬個Token的上下文窗口,并取得了非常好的結果,但由于推理成本較高,他們最終沒有發布該模型,”摩爾說道?!耙虼?,我們預計,隨著此類創新以及其他技術的出現,成本將會降低,這項技術將被用于服務于更智能、計算密集型的產品?!?/span>
摩根士丹利進一步指出,TurboQuant主要優化的是“推理階段”的緩存,并非“訓練階段”的模型權重。因此,對于支撐AI核心訓練的HBM(高頻寬內存)采購邏輯影響相對有限。
相比之下,TurboQuant對手機、筆記本電腦等終端設備的人工智能部署更具意義。由于移動設備的內存有限,這類高效壓縮技術能讓更強大的AI模型在手機端運行,這反而會刺激各類終端裝置進行內存規格的全面換代。
Lynx Equity Strategies 的觀點認為,雖然人工智能提供商需要創新來解決推理中隨著Token上下文長度增加而出現的瓶頸問題,但由于供應限制,這在未來三到五年內并不會減少對內存和閃存的需求。
備注:文章來源于網絡,版權歸原作者所有,信息僅供參考,不代表此公眾號觀點,如有侵權請聯系刪除!


如需購買芯片可掃描下方二維碼進行咨詢。也可郵件至Amall@ameya360.com或撥打+86-21-34792258進行咨詢。



———— /END / ————
相見甚歡 | AMEYA360亮相2024德國慕尼黑電子展!
2024德國慕尼黑電子展進行時:第二天盛況回顧!
精彩繼續 | AMEYA360德國慕尼黑電子展第三天盛況回顧!
AMEYA360迪士尼團建回顧,為生活增添一抹童話色彩~

關于AMEYA360
AMEYA360商城(www.ameya360.com)上線于2011年,現有超過3500家優質供應商,收錄600萬種產品型號數據,100多萬種元器件庫存可供選購,產品覆蓋MCU+存儲器+電源芯片+IGBT+MOS管+運放+射頻藍牙+傳感器+電阻電容電感+連接器等多個領域,平臺主營業務涵蓋電子元器件現貨銷售、BOM配單及提供產品配套資料等,為廣大客戶提供一站式購銷服務。


