假設 GPU 租賃成本為 2 美元 / 小時,經計算,DeepSeek 每日總成本約為 87072 美元。若按照 DeepSeek R1 的定價計算所有 tokens 的收入,理論上一天的總收入可達……

3 月 1 日,AI 領域新勢力 DeepSeek 在知乎官方賬號發布《DeepSeek-V3/R1 推理系統概覽》一文,毫無保留地公開了其推理系統的關鍵技術細節,首次披露理論成本與利潤率,猶如一顆重磅炸彈,在 AI 行業激起千層浪,吸引了眾多從業者、投資者與技術愛好者的目光。

推理系統優化策略

DeepSeek-V3/R1 推理系統將優化目標鎖定為實現更大的吞吐和更低的延遲。為達成這一目標,其采用了大規模跨節點專家并行((Expert Parallelism/EP)技術。通過將每層256個專家中的8個動態激活,系統利用EP策略將專家分散至多GPU節點,進行計算,大幅增加了 batch size(批尺寸),進而顯著提升 GPU 矩陣乘法效率,讓 GPU 算力得以充分發揮,有效提高了系統的吞吐量。同時,專家分散使得每個 GPU 的訪存需求減少,降低了延遲。

在具體實現中,系統采用“預填充-解碼”兩階段差異化并行策略:

  • 預填充階段:部署單元橫跨4個節點,每個GPU處理9個路由專家和1個共享專家,實現高吞吐量;

  • 解碼階段:擴展至18個節點,每個GPU管理2個路由專家和1個共享專家,優化實時交互性能。

但大規模跨節點專家并行技術也為系統帶來了跨節點通信、多節點數據并行、負載均衡等諸多挑戰。為此,DeepSeek 通過規模化跨節點專家并行、雙批次重疊策略、動態負載均衡算法(覆蓋預填充、解碼及專家計算)等一系列技術手段,巧妙地隱藏傳輸耗時,實現了高效的負載均衡,確保系統在復雜環境下仍能穩定高效運行,最大化資源利用率。在解碼階段,將 Attention 層細分并采用五階段流水線,實現更流暢的通信 - 計算重疊,進一步提升性能。

成本與利潤揭秘 

文章披露的理論成本和利潤率數據成為最大亮點。

DeepSeek V3 和 R1 的所有服務均基于英偉達 H800 GPU 運行,利用白天和晚上服務負荷的差異,DeepSeek 建立了靈活的資源調配機制:白天負荷高時,所有節點全力投入推理服務;晚上負荷低時,則減少推理節點,將閑置資源用于研究和訓練。

假設 GPU 租賃成本為 2 美元 / 小時,經計算,DeepSeek 每日總成本約為 87072 美元。若按照 DeepSeek R1 的定價計算所有 tokens 的收入(緩存命中輸入0.14美元/百萬、未命中0.55美元/百萬,輸出2.19美元/百萬),理論上一天的總收入可達 562027 美元,成本利潤率高達 545%。

不過,DeepSeek 也明確表示,實際收入會低于理論值,原因在于 V3 定價低于 R1,且部分服務免費,夜間還有折扣優惠。例如,2 月 26 日,DeepSeek 在 API 開放平臺推出錯峰優惠活動,夜間 API 調用價格大幅下調,V3 降至原價 50%,R1 降至 25% 。在2025年2月27日至28日的24小時內,系統處理了6080億輸入token和1680億輸出token,但僅部分服務實現貨幣化。

盡管如此,這一數據仍顯示出 DeepSeek 在成本控制和利潤最大化方面的強大能力。

開源周助力技術突圍,引發行業變革預期

此次技術揭秘正值 DeepSeek 的 “開源周” 活動期間。在過去一周,DeepSeek 每天開源一個代碼庫,涵蓋 FlashMLA、DeepEP、DeepGEMM、Optimized Parallelism Strategies、Fire - Flyer 文件系統(3FS)以及基于 3FS 的數據處理框架 Smallpond 等。這些開源成果看似獨立,實則相互協作,覆蓋從并行計算到存儲優化的全鏈路技術,構建起一套高效的系統,為行業發展提供了新的思路與技術支撐,吸引了全球開發者的關注。

知乎社區對此反響強烈,大模型領域知名答主“劉聰NPL”評價:“這些工程實踐幾乎不可能在國外AI公司完成”,而“思維鏈開源”模式(即研發思路公開)正在成為AI社區的新范式。

這一系列開源舉措不僅展現了 DeepSeek 的技術自信,也為 AI 領域的開源生態注入了新活力。開源社區的力量有望加速相關技術的迭代與創新,推動整個行業朝著更高效、更開放的方向發展。有國外網友贊嘆 DeepSeek 的技術實力,甚至猜測其實際技術水平可能更高,認為這些開源成果或許只是 “冰山一角”。

樹立標桿,引發市場連鎖反應

DeepSeek 的這一披露在行業內引發了廣泛討論,眾多分析師紛紛發表觀點。

中金公司研報指出,DeepSeek 推理降本將刺激推理需求增長,直接拉動推理硬件市場,為下游應用生態創造更大想象空間。

中信證券認為,Deepseek在模型訓練成本降低方面的最佳實踐,料將刺激科技巨頭采用更為經濟的方式加速前沿模型的探索和研究,同時將使得大量AI應用得以解鎖和落地。算法訓練帶來的規模報酬遞增效應以及單位算力成本降低對應的杰文斯悖論等,均意味著中短期維度科技巨頭繼續在AI算力領域進行持續、規模投入仍將是高確定性事件。

平安證券則認為,DeepSeek 通過算法創新提升算力利用率,沖擊了海外 “堆算力” 的模型訓練模式。雖然短期內可能使市場對訓練算力需求預期放緩,但長期來看,在 AGI 愿景驅動和 AI 應用普及的大趨勢下,推理側算力需求空間將進一步拓寬。

此外,DeepSeek 的低成本策略也在市場競爭中展現出強大優勢。其模型訓練成本僅為同類產品的 1% - 5%,DeepSeek - R1 的 API 定價遠低于 OpenAI 同類產品,加速了市場滲透。就在 DeepSeek 發布文章同日,OpenAI 發布的 GPT - 4.5 研究預覽版,其輸入token價格高達75美元/百萬,是DeepSeek R1定價的535倍,輸出價格差距更達30倍。

相比之下,DeepSeek 的價格優勢明顯,不少網友在對比后吐槽 OpenAI 收費昂貴。這一懸殊差異引發開發者熱議,有投資人測算,若按理論利潤率,DeepSeek年化收入(ARR)可達2億美元,估值或超百億美元。

圍繞成本的爭議:技術探討還是商業博弈?

然而,DeepSeek 披露的數據也引發了行業內的爭議。北京潞晨科技有限公司董事長尤洋與硅基流動創始人袁進輝圍繞 DeepSeek 的成本問題展開了激烈爭論。

尤洋認為,DeepSeek 文章中的數據是在極端理想化情況下得出的,實際的 MaaS(模型即服務)業務面臨諸多挑戰,如測試速度與實際場景差異、機器利用率不穩定等,按照他的測算,DeepSeek 的 MaaS 業務難以盈利。潞晨科技甚至宣布暫停 DeepSeek API 服務,盡管尤洋后來強調對 DeepSeek 模型本身并無貶低之意。

袁進輝則指出,DeepSeek 的 V3/R1 架構與主流模型差異大,現有供應商難以達到其效率水平,但隨著 DeepSeek 開源關鍵模塊,社區復現的難度將降低。這場爭論背后,不僅涉及對 DeepSeek 成本和盈利模式的探討,還牽扯出兩家公司之間關于抄襲等問題的指責,使得事件變得更加復雜。

技術紅利如何兌現?

DeepSeek 發布《DeepSeek-V3/R1 推理系統概覽》,無論是技術創新、成本控制,還是引發的行業討論,都為 AI 行業發展提供了重要參考。但盡管技術優勢顯著,DeepSeek仍面臨多重挑戰:

  • 架構獨特性:其高度定制化的EP架構與主流模型差異較大,第三方平臺需深度適配才能復現效率5;
  • 商業化平衡:免費服務與折扣策略雖擴大用戶基數,但可能延緩盈利進程;
  • 地緣風險:歐美對其“低成本訓練”的質疑尚未完全消散,需持續以技術透明化應對

DeepSeek在文章中明確,未來將聚焦芯片、AI芯片等高價值場景,推動工具鏈的智能化升級。其第三代FPGA驗證系統HuaPro P3已支持芯擎科技等車企的芯片開發,預示技術落地的新方向。

隨著 DeepSeek 加速研發 DeepSeek - R2 推理模型,且有望提前發布,支持更多語言推理和更好的代碼生成,未來其在 AI 領域的表現值得期待,也將持續推動行業競爭與創新。

責編:Luffy
閱讀全文,請先
您可能感興趣
分析機構Needham在6月曾預測,英偉達可能正在規劃一項規模龐大的通信網絡項目,未來三年的投資規模或高達50億至100億美元。
這意味著,AI驅動的存儲超級周期對三星手機業務的沖擊力,已經超過了其史上最嚴重的產品安全危機。
黃文德在采訪中強調,臺積電正面臨客戶端持續涌現的“長達數年的超級需求浪潮”。
2026年,在工業自動化、新能源汽車及智能裝備的強勁需求下,電機驅動與控制技術正迎來系統性重構。
作為美國唯一具備高帶寬內存(HBM)生產能力的企業,美光正通過深化生態合作來鞏固陣地。
前不久思特威展示了microLED高速光互連原型樣機——這可能是未來AI數據中心的另一種高速互連解決方案雛形。這究竟是種什么樣的技術?我們采訪了思特威...
“通用處理器”這一術語一直被廣泛用于描述可運行各類軟件工作負載的CPU。在現代基于Arm架構的系統級芯片(SoC)領域,這一稱謂仍被廣泛使用,但隨著系統復雜度不斷提升,我們有必要追問:這類器件在實際應用中,究竟有多“通用”?
隨著AI基礎設施分化為多層專用架構,CPU正成為智能體工作負載的編排層。
本屆WAIC期間,《2026全球AI商業落地價值洞察報告》重磅發布,并在大會的兩大高規格論壇上進行了重點展示。作為大會最受關注的產業研究成果之一,這份報告以“從技術爆發到價值兌現”為主線,系統梳理了全球AI產業的競爭格局與商業落地路徑。 镕銘微電子憑借在VPU賽道上的開創性地位與規模化商業落地能力,成功入選該報告的兩大核心榜單,與全球及國內頂尖科技企業同臺亮相。
NVIDIA?已驗證?ST?的?12?kW?電源傳輸概念驗證板,實際上已進入生產測試階段。
LG Display 首席執行官鄭哲東在談及公司第二季度業績時表示:“若扣除與自愿退休計劃相關的一次性費用,我們實際上實現了盈利。”他對業務扭虧為盈充滿信心,并預測隨著行業進入旺季,下半年業績將顯著改
本文約8,157字,建議收藏閱讀作者 | 魯大師出品 | 汽車電子與軟件前言當前汽車智能化競爭已進入白熱化階段,高階輔助駕駛、智能座艙兩大核心領域,已然成為車企
出品|派財經原創(ID:paicj314)文|李唐600億體量的能量飲料賽道,正掀起一波久違的入局熱浪。近日,元氣森林攜“冰能量”電解質能量飲料登場,將減糖配方、電解質補給與牛磺酸提神功效融于一罐,一
作者簡介 PROFILE陳杰擼起袖子加油“GaN”氮化鎵晶體管內部構造簡介GaN 氮化鎵晶體管(HEMT)的基本結構如下圖1所示,以 GaN/AlGaN 異質結為主體,在AlGaN/ GaN
一個令人震驚的數據:在移動互聯網幾乎無處不在的當下,國內網吧卻開始逆勢增長。根據中國互聯網上網服務行業協會數據,過去一年,中國網吧經營主體達12.26萬家,同比增長12.68%;營收規模突破1016.
7月22日,在2026中國汽車論壇上,零跑汽車董事長、CEO朱江明表示,以增程為代表的插電混動技術不會終結,未來5到10年內,大電量的插電混動汽車在海外市場將是很強勁的產品類型。朱江明指出,這種技術方
全球產業鏈加速重構,印刷行業步入存量競爭時代,同質化代工、柔性交付壓力持續放大,打通全域數據、落地深度數智化轉型,已成為龍頭企業搶占產業未來賽道的必由之路。 亞洲單體印刷龍頭——利奧集團旗
開關電源波形測量不能只標一個 TP 編號。測量結果由信號節點、參考節點、探頭帶寬與連接環路共同決定;高壓一次側還涉及儀器接地與額定能力。先定義參考和安全邊界,再解釋尖峰、反射與電流波形。調試電源時,最
韓國無晶圓廠系統半導體公司Global Technology Co., Ltd.(簡稱GT)7月21日宣布,已于20日獲得韓國交易所(KRX)KOSDAQ市場上市預備審查批準,主承銷商為韓國投資證券。
近日,四川經濟網披露成都京東方顯示科技有限公司《G8.6產線升級改造項目》環境影響報告書,公司擬針對B19工廠進行升級改造,進一步增大面板尺寸以及提升屏幕刷新率和透過率等規格。據悉,成都京東方顯示科技