7月17日凌晨,月之暗面(Moonshot AI)正式發布新一代大模型Kimi K3。該模型參數規模達2.8萬億,超越參數規模1.6萬億的DeepSeek-V4-Pro,成為迄今為止參數量最大的開源權重模型。

(Kimi網頁版使用界面)
核心參數與架構
Kimi K3基于KDA混合線性注意力機制(Kimi Delta Attention)和注意力殘差(Attention Residuals)技術構建,原生支持視覺理解,并擁有100萬token上下文窗口。
在模型架構層面,K3采用Mixture of Experts(MoE,混合專家)架構,結合Stable LatentMoE框架,可在896個專家中高效激活16個。
這意味著雖然模型總參數量達到2.8萬億,但單次推理僅調用其中一小部分參數,從而在控制計算成本的同時擴大模型容量。
在API定價方面,Kimi K3采用按量計費模式:緩存命中輸入為$0.30/百萬token,緩存未命中輸入為$3.00/百萬token,輸出為$15.00/百萬token。模型默認最大生成長度為131072token,最高可設置為1048576token。
月之暗面表示,完整模型權重將于2026年7月27日前發布,模型架構、訓練和評測細節將隨技術報告一同公布。

(各廠商旗艦模型參數規模演變,圖源:Kimi)
與前代模型比較
首先是擴展效率的顯著提升。通過模型結構、訓練方法和數據配方的協同優化,K3相比K2的整體擴展效率提升約2.5倍,能更有效地將算力轉化為模型能力。
其次是上下文窗口的大幅擴展。相較K2.7 Code等前代模型的256K上下文,K3提升至100萬token,可一次性處理相當于《三體》三部曲體量的文本,適用于大型代碼庫分析、長篇法律卷宗檢索、金融研報深度解析等長程任務。
第三是多模態能力的原生集成。K3并非簡單拼接文本與視覺模塊,而是原生支持圖像和視頻理解,可將截圖、界面錄屏、示意圖與代碼、工具調用置于同一會話中處理,適用于前端工程、游戲開發、CAD設計等需要視覺反饋的編程場景。
此外,K3始終開啟思考模式,在推理過程中展示完整思維鏈,用戶可通過流式輸出分別獲取推理增量和最終答案。
主流大模型橫向對比
根據月之暗面公布的評測數據,K3在多個主流編程和智能體基準中與目前全球最強的兩款大模型Claude Fable 5和GPT-5.6 Sol達到可比區間,并超越了此前被認為代表國產模型編程能力的GLM-5.2。
在編程能力方面,K3在FrontierSWE基準中得分81.2,僅次于Fable 5的86.6,高于GPT-5.6 Sol的71.3;在Program Bench中得分77.8,超過GPT-5.6 Sol的77.6和Fable 5的76.8;在SWE Marathon長程編程任務中得分42.0,領先Opus-4.8的40.0、GPT-5.6 Sol的39.0和Fable 5的35.0。

(編程能力得分)
在智能體(Agentic)任務方面,K3表現尤為突出。根據BenchLM的對比數據,K3在Agentic類別平均得分91.2,大幅領先DeepSeek V4 Pro(Max)的74.5。在BrowseComp網頁瀏覽任務中,K3得分91.2%,高于DeepSeek V4 Pro(Max)的83.4%。
在知識推理方面,K3在GPQA基準中得分93.5%,高于DeepSeek V4 Pro(Max)的90.1%;在HLE(Humanity's Last Exam)高難度測試中,K3得分56%,顯著高于DeepSeek V4 Pro(Max)的37.7%。
不過,K3在部分基準中仍與頂尖閉源模型存在差距。例如在DeepSWE編程基準中,K3得分67.5,低于GPT-5.6 Sol的73.0和Fable 5的70.0;在GDPval-AA v2 Elo評分中,K3為1668.0,低于Fable 5的1760.0和GPT-5.6 Sol的1748.0。
2.8萬億參數的意義
參數即能力上限。2.8萬億參數讓K3成為全球首個觸及3萬億級別的開源模型,也意味著中國大模型在預訓練規模上已與國際頂尖水平并跑。月之暗面官方數據顯示,在過去12個月(2025年7月至2026年7月)中的9個月里,Kimi模型都保持著開源模型的規模上限。
與閉源模型不同,K3選擇以開源權重形式發布。這意味著研究機構、開發者和企業可以下載模型權重,進行學術研究、二次開發或私有化部署。對于金融、醫療、法律等對數據隱私要求極高的行業,這一開放路徑具有不可替代的價值。
但開源不等于免費午餐。2.8萬億參數的MoE模型對推理硬件要求極高,本地化部署需要大量高端GPU集群,中小團隊難以獨立承擔。更關鍵的是,具體的開源協議、商用授權條款、是否允許微調等細節,仍需等待7月27日權重正式發布時才能明確。在協議落地之前,"開源"的商業價值仍是一個待解的問號。
定位與使用建議
月之暗面將K3定位為"通用旗艦智能"模型,而非K2.7 Code的替代者。K2.7 Code仍專注于編程專精場景,K2.6繼續服務于通用長程Agent任務,而K3面向的是"難、跨領域且被256K上下文卡住"的復雜任務。
K3特別適合以下場景:大型代碼庫理解與修改、多步驟金融研究與產業分析、結合視覺反饋的交互式開發、需要100萬上下文窗口的長文檔推理等。對于日常IDE編程、低延遲自動補全等任務,K2.7 Code仍是更經濟高效的選擇。