3 月 1 日,AI 領域新勢力 DeepSeek 在知乎官方賬號發布《DeepSeek-V3/R1 推理系統概覽》一文,毫無保留地公開了其推理系統的關鍵技術細節,首次披露理論成本與利潤率,猶如一顆重磅炸彈,在 AI 行業激起千層浪,吸引了眾多從業者、投資者與技術愛好者的目光。

推理系統優化策略
DeepSeek-V3/R1 推理系統將優化目標鎖定為實現更大的吞吐和更低的延遲。為達成這一目標,其采用了大規模跨節點專家并行((Expert Parallelism/EP)技術。通過將每層256個專家中的8個動態激活,系統利用EP策略將專家分散至多GPU節點,進行計算,大幅增加了 batch size(批尺寸),進而顯著提升 GPU 矩陣乘法效率,讓 GPU 算力得以充分發揮,有效提高了系統的吞吐量。同時,專家分散使得每個 GPU 的訪存需求減少,降低了延遲。
在具體實現中,系統采用“預填充-解碼”兩階段差異化并行策略:
- 預填充階段:部署單元橫跨4個節點,每個GPU處理9個路由專家和1個共享專家,實現高吞吐量;

- 解碼階段:擴展至18個節點,每個GPU管理2個路由專家和1個共享專家,優化實時交互性能。

但大規模跨節點專家并行技術也為系統帶來了跨節點通信、多節點數據并行、負載均衡等諸多挑戰。為此,DeepSeek 通過規模化跨節點專家并行、雙批次重疊策略、動態負載均衡算法(覆蓋預填充、解碼及專家計算)等一系列技術手段,巧妙地隱藏傳輸耗時,實現了高效的負載均衡,確保系統在復雜環境下仍能穩定高效運行,最大化資源利用率。在解碼階段,將 Attention 層細分并采用五階段流水線,實現更流暢的通信 - 計算重疊,進一步提升性能。
成本與利潤揭秘
文章披露的理論成本和利潤率數據成為最大亮點。
DeepSeek V3 和 R1 的所有服務均基于英偉達 H800 GPU 運行,利用白天和晚上服務負荷的差異,DeepSeek 建立了靈活的資源調配機制:白天負荷高時,所有節點全力投入推理服務;晚上負荷低時,則減少推理節點,將閑置資源用于研究和訓練。
假設 GPU 租賃成本為 2 美元 / 小時,經計算,DeepSeek 每日總成本約為 87072 美元。若按照 DeepSeek R1 的定價計算所有 tokens 的收入(緩存命中輸入0.14美元/百萬、未命中0.55美元/百萬,輸出2.19美元/百萬),理論上一天的總收入可達 562027 美元,成本利潤率高達 545%。

不過,DeepSeek 也明確表示,實際收入會低于理論值,原因在于 V3 定價低于 R1,且部分服務免費,夜間還有折扣優惠。例如,2 月 26 日,DeepSeek 在 API 開放平臺推出錯峰優惠活動,夜間 API 調用價格大幅下調,V3 降至原價 50%,R1 降至 25% 。在2025年2月27日至28日的24小時內,系統處理了6080億輸入token和1680億輸出token,但僅部分服務實現貨幣化。

盡管如此,這一數據仍顯示出 DeepSeek 在成本控制和利潤最大化方面的強大能力。
開源周助力技術突圍,引發行業變革預期
此次技術揭秘正值 DeepSeek 的 “開源周” 活動期間。在過去一周,DeepSeek 每天開源一個代碼庫,涵蓋 FlashMLA、DeepEP、DeepGEMM、Optimized Parallelism Strategies、Fire - Flyer 文件系統(3FS)以及基于 3FS 的數據處理框架 Smallpond 等。這些開源成果看似獨立,實則相互協作,覆蓋從并行計算到存儲優化的全鏈路技術,構建起一套高效的系統,為行業發展提供了新的思路與技術支撐,吸引了全球開發者的關注。
知乎社區對此反響強烈,大模型領域知名答主“劉聰NPL”評價:“這些工程實踐幾乎不可能在國外AI公司完成”,而“思維鏈開源”模式(即研發思路公開)正在成為AI社區的新范式。
這一系列開源舉措不僅展現了 DeepSeek 的技術自信,也為 AI 領域的開源生態注入了新活力。開源社區的力量有望加速相關技術的迭代與創新,推動整個行業朝著更高效、更開放的方向發展。有國外網友贊嘆 DeepSeek 的技術實力,甚至猜測其實際技術水平可能更高,認為這些開源成果或許只是 “冰山一角”。
樹立標桿,引發市場連鎖反應
DeepSeek 的這一披露在行業內引發了廣泛討論,眾多分析師紛紛發表觀點。
中金公司研報指出,DeepSeek 推理降本將刺激推理需求增長,直接拉動推理硬件市場,為下游應用生態創造更大想象空間。
中信證券認為,Deepseek在模型訓練成本降低方面的最佳實踐,料將刺激科技巨頭采用更為經濟的方式加速前沿模型的探索和研究,同時將使得大量AI應用得以解鎖和落地。算法訓練帶來的規模報酬遞增效應以及單位算力成本降低對應的杰文斯悖論等,均意味著中短期維度科技巨頭繼續在AI算力領域進行持續、規模投入仍將是高確定性事件。
平安證券則認為,DeepSeek 通過算法創新提升算力利用率,沖擊了海外 “堆算力” 的模型訓練模式。雖然短期內可能使市場對訓練算力需求預期放緩,但長期來看,在 AGI 愿景驅動和 AI 應用普及的大趨勢下,推理側算力需求空間將進一步拓寬。
此外,DeepSeek 的低成本策略也在市場競爭中展現出強大優勢。其模型訓練成本僅為同類產品的 1% - 5%,DeepSeek - R1 的 API 定價遠低于 OpenAI 同類產品,加速了市場滲透。就在 DeepSeek 發布文章同日,OpenAI 發布的 GPT - 4.5 研究預覽版,其輸入token價格高達75美元/百萬,是DeepSeek R1定價的535倍,輸出價格差距更達30倍。

相比之下,DeepSeek 的價格優勢明顯,不少網友在對比后吐槽 OpenAI 收費昂貴。這一懸殊差異引發開發者熱議,有投資人測算,若按理論利潤率,DeepSeek年化收入(ARR)可達2億美元,估值或超百億美元。
圍繞成本的爭議:技術探討還是商業博弈?
然而,DeepSeek 披露的數據也引發了行業內的爭議。北京潞晨科技有限公司董事長尤洋與硅基流動創始人袁進輝圍繞 DeepSeek 的成本問題展開了激烈爭論。
尤洋認為,DeepSeek 文章中的數據是在極端理想化情況下得出的,實際的 MaaS(模型即服務)業務面臨諸多挑戰,如測試速度與實際場景差異、機器利用率不穩定等,按照他的測算,DeepSeek 的 MaaS 業務難以盈利。潞晨科技甚至宣布暫停 DeepSeek API 服務,盡管尤洋后來強調對 DeepSeek 模型本身并無貶低之意。

袁進輝則指出,DeepSeek 的 V3/R1 架構與主流模型差異大,現有供應商難以達到其效率水平,但隨著 DeepSeek 開源關鍵模塊,社區復現的難度將降低。這場爭論背后,不僅涉及對 DeepSeek 成本和盈利模式的探討,還牽扯出兩家公司之間關于抄襲等問題的指責,使得事件變得更加復雜。

技術紅利如何兌現?
DeepSeek 發布《DeepSeek-V3/R1 推理系統概覽》,無論是技術創新、成本控制,還是引發的行業討論,都為 AI 行業發展提供了重要參考。但盡管技術優勢顯著,DeepSeek仍面臨多重挑戰:
- 架構獨特性:其高度定制化的EP架構與主流模型差異較大,第三方平臺需深度適配才能復現效率5;
- 商業化平衡:免費服務與折扣策略雖擴大用戶基數,但可能延緩盈利進程;
- 地緣風險:歐美對其“低成本訓練”的質疑尚未完全消散,需持續以技術透明化應對
DeepSeek在文章中明確,未來將聚焦車規芯片、AI芯片等高價值場景,推動工具鏈的智能化升級。其第三代FPGA驗證系統HuaPro P3已支持芯擎科技等車企的芯片開發,預示技術落地的新方向。
隨著 DeepSeek 加速研發 DeepSeek - R2 推理模型,且有望提前發布,支持更多語言推理和更好的代碼生成,未來其在 AI 領域的表現值得期待,也將持續推動行業競爭與創新。