在硅谷,幾乎每周都有新的AI芯片故事上演。但今天這家剛結束隱身期的公司,講的故事有點“反直覺”。
ElastixAI,一家總部位于西雅圖的初創公司,今天正式亮牌。他們的核心主張很直接:在大語言模型(LLM)推理這件事上,大家追捧的英偉達GPU可能從一開始就“用錯了力”。他們拿出的方案是基于FPGA的軟硬協同設計,宣稱能把推理的總擁有成本(TCO)壓低50倍,功耗砍掉80%。
這數字聽著像PPT造車?我們先別急著下結論,看看背后的邏輯。
ElastixAI的三位創始人——CEO Mohammad Rastegari、CTO Saman Naderiparizi和CSO Mahyar Najibi,履歷都很硬。Rastegari曾是Xnor.ai聯合創始人(后被蘋果收購),也在Meta主導過Llama 405B的推理優化;Najibi參與過Apple Intelligence項目,還做過Waymo的首席科學家。
這群人最清楚大模型落地時的痛點。Rastegari在專訪里說了一句很實在的話:“訓練是計算瓶頸(compute-bound),推理是內存瓶頸(memory-bound)。”
這話什么意思?簡單說,訓練大模型時,數據要在矩陣里反復算,GPU那成千上萬個核心能跑滿,效率很高。但到了推理階段,尤其是生成式AI,大部分時間花在把模型權重從內存搬到計算單元上,計算單元反而在“等數據”。
這時候,你讓為高強度并行計算設計的GPU去干這個活,就像開法拉利送外賣——引擎厲害,但路況(內存帶寬)限制了速度,大部分算力都在空轉。
更麻煩的是硬件的僵化。比如現在流行的4-bit量化,理論上能讓吞吐翻倍,但在H100這種缺乏原生支持的硬件上,靠軟件繞路實現,實際只能發揮出10%的潛力。
既然GPU不合適,那定制ASIC(專用芯片)行不行?這是過去幾年很多芯片創業公司的選擇,也是ElastixAI刻意回避的路。
“機器學習的演進速度,遠快于芯片開發周期。”Rastegari拿Mixture-of-Experts (MoE) 架構舉例:很多公司照著當時的主流架構流片,結果MoE突然火了,原本設計的硅片瞬間過時,只能回爐重造。
ASIC從設計到量產要三年,而AI領域的范式轉移可能只要幾個月。幾年前每秒20個token夠用,現在“推理型”模型要求每秒200個token。一旦流片,就沒了回頭路。
FPGA的優勢就在這兒:它能重新配置。Transformer架構本身已經相對穩定,適合在FPGA上固化;但底層的量化、稀疏化等優化技術還在快速迭代,FPGA能跟著變。
ElastixAI的策略很務實:不自己造芯片,而是買現成的FPGA服務器,通過自研的軟件棧做深度優化。他們不拼最貴的HBM,而是算“單位帶寬成本”和“單位容量成本”,用性價比更高的DDR和HBM組合,把硬件潛力榨干。

對于數據中心運營者來說,ElastixAI的方案還有一個誘人的點:不用搞液冷。
現在的英偉達GB200 NVL72系統,一個機架功率高達120-200kW,必須上液冷,這對現有數據中心簡直是災難。而ElastixAI的Elastix Rack兼容標準的17-19kW風冷機架。

CTO Naderiparizi給出的數據是:在同等吞吐下,每生成一個token的能耗降低約5倍。這意味著,現有的機房不用大改,不用擴容電力,不用鋪水管,直接把GPU服務器換掉一部分,就能跑起來。
這對于那些已經被高昂電費和改造成本壓得喘不過氣的云廠商和企業來說,吸引力不小。
當然,挑戰英偉達,技術只是第一步,生態才是護城河。ElastixAI很清楚這一點。
他們沒有另搞一套開發環境,而是做了個vLLM插件,直接替換CUDA后端,前端API保持和OpenAI兼容。對應用開發者來說,代碼不用改;對運維來說,堆棧不用動。
未來,他們還打算把模型轉換工具鏈開放給研究人員。這招很像早期英偉達推CUDA的路子:先讓學術界和開發者用起來,形成習慣,最后反哺生態。
ElastixAI在2025年5月完成了1800萬美元的種子輪,由Fuse VC領投。首批硬件預計2026年年中出貨。
這個時間點很有意思。2026年,AI行業大概率已經從“不計成本搶算力”進入“精打細算拼落地”的階段。當大模型的能力差距逐漸縮小,誰能以更低的成本、更少的能耗穩定輸出Token,誰就能活下去。
ElastixAI賭的就是這個趨勢:GPU繼續壟斷訓練市場,而推理市場,或許該換個玩法了。
不管最終能不能真做到50倍的成本降低,至少它給行業提了個醒:在生成式AI的賽道上,盲目堆砌算力已經不是唯一解,架構的匹配度和能效比,才是接下來幾年的關鍵考題。
對于那些看著GPU賬單發愁的企業來說,多一個選項,總比沒有好。

