
·聚焦:人工智能、芯片等行業(yè)
歡迎各位客官關注、轉發(fā)

英偉達把鏟子賣給所有人,谷歌選擇自己挖礦,還順手改造了礦井的巖石結構。
軟件與硬件纏斗半個世紀,這一次輪到模型把芯片收編為自己的「器官」。訓練大模型的人,開始動手改晶體管的圖紙了。

凍結的藝術,從權重到架構的一次聰明退讓
近日The Information披露,谷歌正在研發(fā)代號Frozen v2的服務器芯片,把Gemini模型的部分架構永久寫入硅片,單位功耗的Token處理量預計達到最新一代TPU的6到10倍。
在機器學習里,凍結本是個日常動作,訓練完成后鎖住參數(shù),讓模型停止更新。
Frozen v2把這個動詞推進了物理世界,它鎖住的是Gemini神經網絡的結構藍圖,那些規(guī)定數(shù)據如何流動、注意力如何匯聚的連接方式,將直接變成硅片上的電路。
這個想法的起點據說是Google DeepMind首席科學家Jeff Dean,F(xiàn)rozen第一版方案要激進得多,把模型權重整體固化進硅片,相當于把某一個版本的Gemini鑄成銅像,芯片出廠之日就是它過時之始。
谷歌很快否決了這條路線,理由樸素得近乎殘酷,模型迭代以月計,銅像的壽命卻以年計。
Frozen v2退了一步,也因此聰明了一步。它凍結的是架構,放行的是權重,新訓練出的參數(shù)仍可加載進芯片,只要底層結構不變,這顆硅片就能服侍一代又一代Gemini。
工程師至今沒有敲定固化的深度,固得越多能效越高,活路越窄,這是一道用靈活性兌換效率的算術題。
把架構修進電路,等于把搬運路線拉成直線,計算步驟減少,數(shù)據遷移量下降,6到10倍的每瓦Token吞吐由此而來。
這個數(shù)字目前仍是紙面推演,部署要等到2028年,方向卻已足夠清楚。
過去十幾年,芯片行業(yè)的信條是通用性,一顆GPU訓練所有模型。
Frozen v2把這個信條翻過來曬了曬太陽,當單一模型的調用量大到以億次計,為它單獨造一顆芯片的賬,開始算得過來。

比起效率翻倍,谷歌真正要救的是現(xiàn)金流
谷歌面對的核心問題已不只是芯片性能,而是急速膨脹的推理需求正在吞噬電力、服務器和現(xiàn)金。
2026年第二季度,谷歌模型API處理量達到每分鐘約220億token,較上一季度的160億增長37.5%,更早之前還只有100億。
用戶數(shù)量沒有成倍增加,服務器內部的計算鏈條卻可能拉長數(shù)倍。
需求一路上沖,供給依舊緊繃。Alphabet當季資本開支達到449億美元,絕大部分流向AI基礎設施,并將2026年全年資本開支指引提高至1950億至2050億美元。
相比4月給出的1800億至1900億美元,這已經是年內再次加碼。
重投入直接壓低現(xiàn)金流,當季自由現(xiàn)金流降至負59億美元,德意志銀行對其2027年資本開支的預測甚至升至3250億美元。
云業(yè)務的訂單還在繼續(xù)堆積,Google Cloud收入同比增長82%,達到248億美元,待履約合同金額由此前的4620億美元增至5140億美元。
谷歌云一邊握著巨額訂單,一邊缺少足夠的算力完成交付。
The Information援引信源稱,內部資源短缺已經引發(fā)團隊摩擦,云部門被迫拒絕部分外部客戶,同時每月花費數(shù)億美元租用英偉達GPU救急。
管理層還計劃在第三季度增加第三方數(shù)據中心容量,用臨時租賃填補缺口,代價是云業(yè)務利潤率承受短期壓力。
一家自研芯片十一年的公司,回頭高價租用競爭對手的GPU,這個細節(jié)比單純的資本開支數(shù)字更能說明問題。
專用芯片節(jié)省的每一小步,經過數(shù)十億級產品入口反復調用后,都會在電表和現(xiàn)金流量表上被放大。
Frozen v2的價值正在這里,這顆芯片將Gemini部分架構直接固化進硬件,通過犧牲一部分通用性壓低單位推理成本。
Frozen v2沒有對外銷售計劃,谷歌正在把TPU租給Meta,也試圖將芯片部署進客戶數(shù)據中心,這顆新芯片卻更像一件純粹的內需工具。
它承擔的任務很明確,在算力供給難以迅速擴張的階段,從每一次Gemini調用中擠出更多token,讓谷歌在模型API價格競爭中獲得一條更低、更難復制的成本線。

TPU向外成為平臺,F(xiàn)rozen向內成為工廠
今年4月,谷歌把第8代TPU拆為訓練型TPU 8t和推理型TPU 8i。
TPU 8i已經為采樣、服務和推理做了大量定向設計,配有288 GB HBM、384 MB片上SRAM以及用于降低集體通信延遲的專用引擎。
谷歌給出的數(shù)據是,相較Ironwood,TPU 8i在特定低延遲大規(guī)模混合專家模型上可提高80%的性價比,第8代芯片最高可實現(xiàn)2倍每瓦性能提升。
即便如此,TPU 8i仍要支持不同模型與客戶,JAX、PyTorch、Keras和vLLM構成它的軟件入口,XLA負責把模型翻譯給硬件。
谷歌反復強調TPU 8t與8i能夠適應持續(xù)變化的模型架構,這種靈活性看似增加了運行開銷,卻是云平臺能夠做生意的基礎。
TPU的商業(yè)方向也在向外打開,Alphabet在2026年第2季度首次確認,已經向客戶自有數(shù)據中心交付TPU系統(tǒng)并確認收入,相關收入將在2027年加速兌現(xiàn)。
TPU由谷歌內部基礎設施走向云租賃,再走向客戶機房,產品邊界越來越接近一套開放的AI計算平臺。
Frozen承擔的是另一種任務,它只需把Gemini跑得足夠快、足夠便宜,不必為外部客戶的Claude、Llama或下一款陌生模型預留同等空間。
它更適合接住谷歌自有產品中穩(wěn)定、高頻、可預測的推理流量,谷歌對外出售的也將是Gemini服務結果,而非一塊人人都能編程的芯片。
兩條路線因此沒有互相替代的必要,TPU像一座允許客戶更換產線的工業(yè)園,F(xiàn)rozen像一條圍繞Gemini重新焊接工位的專線。
前者用兼容性擴大收入邊界,后者用專用性壓低內部成本,谷歌在TPU之外另開分支,也是在隔離彼此沖突的產品目標。

Taalas點火,英偉達轉向,專用化的合圍成型
把模型往硅里塞,谷歌算不上第一個動手的,卻是分量最重的那個。
今年2月,加拿大創(chuàng)業(yè)公司Taalas走出隱身模式,把Llama 3.1 8B的全部權重用掩膜ROM刻進了臺積電6nm工藝的上層金屬,815平方毫米的芯片上,每用戶每秒吐出17000個Token,整機功耗只有2.5千瓦,風冷即可。
從拿到新權重到交付新芯片只要兩個月,這家公司總共只花了3000萬美元研發(fā)費用,就拿到了2.19億美元融資。
巨頭們的動作更加誠實,英偉達豪擲約200億美元收購Groq,把LPU塞進Vera Rubin平臺,單顆LPU帶著500MB片上SRAM,一個LPX機架裝256顆,官方口徑下每兆瓦推理吞吐提升35倍。
Cerebras抱著整片晶圓不放,Etched只做Transformer,Taalas只做Llama,光譜從通用一路排到模型專用,盡頭處,芯片本身就是模型。
Taalas凍結的是權重,一顆芯片只認一個版本,靠LoRA適配器續(xù)命。
谷歌凍結的是架構,養(yǎng)活的是整個Gemini家族,Jeff Dean那次退讓恰恰是創(chuàng)新所在,行業(yè)把它稱作彈性固化。
別忘了谷歌手里握著別人沒有的兩張牌,模型是自己的,芯片也是自己的,當芯片定義的筆從架構師傳給訓練師,擁有完整筆墨紙硯的只剩這一家。

結尾:
架構創(chuàng)新的邊際收益正在衰減,模型競爭的決勝點已從發(fā)明新結構滑向工程效率與成本曲線。
GPU、TPU、工作負載專用芯片與模型專屬芯片將長期疊在同一座數(shù)據中心里,區(qū)別只在于每類任務愿意為多少自由度付費。
AI基礎設施的分界線,也將從GPU與TPU的品牌之爭,移向通用平臺與模型專屬工廠的成本之爭。
部分資料參考:36 氪:《谷歌將 Gemini 架構直接寫入芯片,脫離 TPU 打造全新算力分支》,智東西:《放棄通用算力內卷,谷歌 Gemini 專用芯片落地,AI 芯片進入模型定制時代》,半導體行業(yè)觀察:《Frozen v2 芯片詳解:谷歌軟硬協(xié)同重構 AI 推理算力格局》,TrendForce 集邦咨詢:《2026 年全球 AI 芯片市場細分增速報告》,高盛研究院:《2027 AI 算力硬件結構變遷預測報告》
本公眾號所刊發(fā)稿件及圖片來源于網絡,僅用于交流使用,如有侵權請聯(lián)系回復,我們收到信息后會在24小時內處理。
推薦閱讀:



商務合作請加微信勾搭:
18948782064
請務必注明:
「姓名 + 公司 + 合作需求」