在多項權威基準測試中,Kimi?K3展現出逼近全球頂尖閉源模型的實力。

7月17日凌晨,月之暗面(Moonshot AI)正式發布新一代大模型Kimi K3。該模型參數規模達2.8萬億,超越參數規模1.6萬億的DeepSeek-V4-Pro,成為迄今為止參數量最大的開源權重模型。

(Kimi網頁版使用界面)

核心參數與架構

Kimi K3基于KDA混合線性注意力機制(Kimi Delta Attention)和注意力殘差(Attention Residuals)技術構建,原生支持視覺理解,并擁有100萬token上下文窗口。

在模型架構層面,K3采用Mixture of Experts(MoE,混合專家)架構,結合Stable LatentMoE框架,可在896個專家中高效激活16個。

這意味著雖然模型總參數量達到2.8萬億,但單次推理僅調用其中一小部分參數,從而在控制計算成本的同時擴大模型容量。

在API定價方面,Kimi K3采用按量計費模式:緩存命中輸入為$0.30/百萬token,緩存未命中輸入為$3.00/百萬token,輸出為$15.00/百萬token。模型默認最大生成長度為131072token,最高可設置為1048576token。

月之暗面表示,完整模型權重將于2026年7月27日前發布,模型架構、訓練和評測細節將隨技術報告一同公布。

(各廠商旗艦模型參數規模演變,圖源:Kimi)

與前代模型比較

首先是擴展效率的顯著提升。通過模型結構、訓練方法和數據配方的協同優化,K3相比K2的整體擴展效率提升約2.5倍,能更有效地將算力轉化為模型能力。

其次是上下文窗口的大幅擴展。相較K2.7 Code等前代模型的256K上下文,K3提升至100萬token,可一次性處理相當于《三體》三部曲體量的文本,適用于大型代碼庫分析、長篇法律卷宗檢索、金融研報深度解析等長程任務。

第三是多模態能力的原生集成。K3并非簡單拼接文本與視覺模塊,而是原生支持圖像和視頻理解,可將截圖、界面錄屏、示意圖與代碼、工具調用置于同一會話中處理,適用于前端工程、游戲開發、CAD設計等需要視覺反饋的編程場景。

此外,K3始終開啟思考模式,在推理過程中展示完整思維鏈,用戶可通過流式輸出分別獲取推理增量和最終答案。

主流大模型橫向對比

根據月之暗面公布的評測數據,K3在多個主流編程和智能體基準中與目前全球最強的兩款大模型Claude Fable 5和GPT-5.6 Sol達到可比區間,并超越了此前被認為代表國產模型編程能力的GLM-5.2。

在編程能力方面,K3在FrontierSWE基準中得分81.2,僅次于Fable 5的86.6,高于GPT-5.6 Sol的71.3;在Program Bench中得分77.8,超過GPT-5.6 Sol的77.6和Fable 5的76.8;在SWE Marathon長程編程任務中得分42.0,領先Opus-4.8的40.0、GPT-5.6 Sol的39.0和Fable 5的35.0。

(編程能力得分)

在智能體(Agentic)任務方面,K3表現尤為突出。根據BenchLM的對比數據,K3在Agentic類別平均得分91.2,大幅領先DeepSeek V4 Pro(Max)的74.5。在BrowseComp網頁瀏覽任務中,K3得分91.2%,高于DeepSeek V4 Pro(Max)的83.4%。

在知識推理方面,K3在GPQA基準中得分93.5%,高于DeepSeek V4 Pro(Max)的90.1%;在HLE(Humanity's Last Exam)高難度測試中,K3得分56%,顯著高于DeepSeek V4 Pro(Max)的37.7%。

不過,K3在部分基準中仍與頂尖閉源模型存在差距。例如在DeepSWE編程基準中,K3得分67.5,低于GPT-5.6 Sol的73.0和Fable 5的70.0;在GDPval-AA v2 Elo評分中,K3為1668.0,低于Fable 5的1760.0和GPT-5.6 Sol的1748.0。

2.8萬億參數的意義

參數即能力上限。2.8萬億參數讓K3成為全球首個觸及3萬億級別的開源模型,也意味著中國大模型在預訓練規模上已與國際頂尖水平并跑。月之暗面官方數據顯示,在過去12個月(2025年7月至2026年7月)中的9個月里,Kimi模型都保持著開源模型的規模上限。

與閉源模型不同,K3選擇以開源權重形式發布。這意味著研究機構、開發者和企業可以下載模型權重,進行學術研究、二次開發或私有化部署。對于金融、醫療、法律等對數據隱私要求極高的行業,這一開放路徑具有不可替代的價值。

但開源不等于免費午餐。2.8萬億參數的MoE模型對推理硬件要求極高,本地化部署需要大量高端GPU集群,中小團隊難以獨立承擔。更關鍵的是,具體的開源協議、商用授權條款、是否允許微調等細節,仍需等待7月27日權重正式發布時才能明確。在協議落地之前,"開源"的商業價值仍是一個待解的問號。

定位與使用建議

月之暗面將K3定位為"通用旗艦智能"模型,而非K2.7 Code的替代者。K2.7 Code仍專注于編程專精場景,K2.6繼續服務于通用長程Agent任務,而K3面向的是"難、跨領域且被256K上下文卡住"的復雜任務。

K3特別適合以下場景:大型代碼庫理解與修改、多步驟金融研究與產業分析、結合視覺反饋的交互式開發、需要100萬上下文窗口的長文檔推理等。對于日常IDE編程、低延遲自動補全等任務,K2.7 Code仍是更經濟高效的選擇。

責編:Leon
閱讀全文,請先
您可能感興趣
從增長曲線看,數據中心目前占美國總用電量的5.9%,預計到2030年升至約12%,2035年進一步攀升至20%——不到十年時間,占比擴大逾三倍。
分析機構Needham在6月曾預測,英偉達可能正在規劃一項規模龐大的通信網絡項目,未來三年的投資規模或高達50億至100億美元。
這是鴻海首次切入馬斯克體系內的AI基礎設施供應鏈,也意味著戴爾(Dell)、超微(Super Micro)兩家長期主導SpaceX AI服務器供應的廠商,被正面撬動。
這意味著,AI驅動的存儲超級周期對三星手機業務的沖擊力,已經超過了其史上最嚴重的產品安全危機。
黃文德在采訪中強調,臺積電正面臨客戶端持續涌現的“長達數年的超級需求浪潮”。
2026年,在工業自動化、新能源汽車及智能裝備的強勁需求下,電機驅動與控制技術正迎來系統性重構。
“通用處理器”這一術語一直被廣泛用于描述可運行各類軟件工作負載的CPU。在現代基于Arm架構的系統級芯片(SoC)領域,這一稱謂仍被廣泛使用,但隨著系統復雜度不斷提升,我們有必要追問:這類器件在實際應用中,究竟有多“通用”?
隨著AI基礎設施分化為多層專用架構,CPU正成為智能體工作負載的編排層。
本屆WAIC期間,《2026全球AI商業落地價值洞察報告》重磅發布,并在大會的兩大高規格論壇上進行了重點展示。作為大會最受關注的產業研究成果之一,這份報告以“從技術爆發到價值兌現”為主線,系統梳理了全球AI產業的競爭格局與商業落地路徑。 镕銘微電子憑借在VPU賽道上的開創性地位與規模化商業落地能力,成功入選該報告的兩大核心榜單,與全球及國內頂尖科技企業同臺亮相。
NVIDIA?已驗證?ST?的?12?kW?電源傳輸概念驗證板,實際上已進入生產測試階段。
TDK-EPC QRF3001F WiFi模組簡介WiFi/BT 2合1模塊:此模塊為 2.4G,支持802.11b/g/n;支持藍牙 2.1。具有以下優勢:1.速度快:支持IEEE802.11b/g
點擊上方藍字談思實驗室獲取更多汽車網絡安全資訊7月23-24日,由AI基礎設施圈和談思科技主辦、東莞市集成電路行業協會作為支持單位的「CPO Asia 2026 亞洲光電共封裝技術創新大會」將在上海盛
專家 訪談PCIe? 6.0時代,重定時器成剛需數據中心解決方案業務部產品市場技術工程師Tam Do(杜澤心)在AI時代,當業界還在為GPU算力的指數級增長歡呼時,一個隱秘的瓶頸正在悄然浮現
一、完整型號分段邏輯(標準型號:TCC0603X5R226M100CT) 完整拆分:TCC + 0603 + X5R + 226 + M + 100 + C + T +特殊標
點擊藍字 關注我們SUBSCRIBE to USImage Credits:Google谷歌母公司Alphabet正在自研一款全新服務器芯片,用以提升自研大模型Gemini的運行能效。科技媒
7月22日,在2026中國汽車論壇上,零跑汽車董事長、CEO朱江明表示,以增程為代表的插電混動技術不會終結,未來5到10年內,大電量的插電混動汽車在海外市場將是很強勁的產品類型。朱江明指出,這種技術方
“今天,我想坦誠告訴大家:realme將按下中國市場的暫停鍵!”隨著7月16日晚上,realme副總裁徐起在社交媒體上發布致用戶公開信,這個在中國市場運營七年的年輕品牌,也正式按下了暫停鍵。當初,re
全球產業鏈加速重構,印刷行業步入存量競爭時代,同質化代工、柔性交付壓力持續放大,打通全域數據、落地深度數智化轉型,已成為龍頭企業搶占產業未來賽道的必由之路。 亞洲單體印刷龍頭——利奧集團旗
全面收縮戰線”作者|王磊編輯|秦章勇真是給大眾逼的沒招兒了。過去一段時間,大眾裁員這件事,已經造成不小的震動,一個最醒目的數字就是,大眾未來幾年全球裁員將多達10萬人,并考慮關閉德國多座工廠等,只不過
算筆賬一批十萬的呆料壓在庫存每月倉儲費?資金成本至少5k放半年就虧3萬有料單不知道怎么推廣?芯片超人已經累計服務2.2萬用戶,打折清庫存,最快半天完成交易!找不到,賣不掉,價格還想再好點,都可以來找我