點擊上方藍字關(guān)注我,加個??標不迷路。
今天,MiniMax 正式發(fā)布了 M3。官方給它的定位是:Coding / Agent、1M 上下文、原生多模態(tài)。

正式發(fā)布前幾天,我看有人發(fā)消息說可以進 M3 內(nèi)測群,然后我就進去了,我以為是內(nèi)測一段時間再發(fā)布,但沒想到今天就發(fā)布了,那這個內(nèi)測群,除了提供 7 天免費試用之外,別的好像也沒啥用處了。

我身邊有個小伙伴一直在做模型測評,這次他史無前例的夸贊了一下 M3 ,這個榜單就一個讓我注意的點,那就是 M3 竟然比 opus4.6 分數(shù)還高。。。。。。
MiniMax M3 Free 排第 4,88 分,A+。前面是 GPT 5.5 xhigh、Claude 4.7 Opus Max 和 Gemini 3.1 Pro。單看分數(shù),它確實已經(jīng)貼近 Opus 4.7 那一檔了。
但是同一行還有一個很扎眼的備注:慢,7m51s。

圖源:身邊小伙伴的測評圖。
所以這篇不想寫成“國產(chǎn)模型吊打 Opus”的爽文。那種寫法就是跑分沒輸過,體驗沒贏過。
所以我更關(guān)心的問題是:M3 到底在哪些體驗上接近 Opus 4.7,又在哪些體驗上還不能腦補成 Opus 4.7?
這和過去很多國產(chǎn)模型發(fā)布不太一樣。
以前大家喜歡比單點能力:數(shù)學多少分、代碼多少分、長文本多少 token。但 M3 這次講的是組合能力。它不是只想回答一道題,而是想進到一個長程工作流里,連續(xù)讀代碼、看日志、調(diào)工具、改方案、再繼續(xù)跑。

圖源:我自己繪制,數(shù)據(jù)來自 MiniMax 官方博客和模型頁。
官方博客里有幾個關(guān)鍵數(shù)字:
SWE-Bench Pro 59.0%,Terminal-Bench 2.1 為 66.0%,SWE-fficiency 34.8%,KernelBench Hard 28.8%,MCP Atlas 74.2%。
這些數(shù)字單獨看,不一定有體感。真正有體感的是官方那句話:在 SWE-Bench Pro 上,M3 超過 GPT-5.5 和 Gemini 3.1 Pro,接近 Opus 4.7;在 SVG-Bench 上,M3 超過 Opus 4.7。
注意,是 接近,不是全面等同。
我傾向于把這個“接近”限定在一個范圍里:Coding / Agent 的長程任務(wù)體驗。
因為從官方材料看,M3 這次最想證明的不是“我會寫一個函數(shù)”,而是“我能在一個復(fù)雜任務(wù)里持續(xù)推進”。這正是 Opus 這類模型過去最拉開差距的地方。

圖源:我自己自制;體驗榜來自用戶截圖,官方指標來自 MiniMax 發(fā)布頁。
模型頁還給了一個很有意思的點:BrowseComp 上 M3 得分 83.5,Opus 4.7 是 79.3。也就是說,至少在官方口徑下,M3 在自主瀏覽、信息檢索這類 Agent 能力上已經(jīng)能和 Opus 4.7 正面比較。
但是體驗榜里的慢,也不能忽略。
如果你的場景是日常聊天、快速問答、隨手補一段代碼,7 分多鐘就是硬傷。你不能因為一個模型能跑 24 小時,就假裝它每次響應(yīng)都很絲滑。
所以我的第一判斷是:M3 更像一個可以掛后臺跑任務(wù)的工程型模型,而不是一個每句話都要秒回的聊天模型。
官方這次反復(fù)講 MSA,也就是 MiniMax Sparse Attention。
簡單說,它想解決的是長上下文成本爆炸的問題。官方稱,M3 API 最高支持 1M tokens,上下文保底 512K。在 100 萬上下文長度下,M3 每 token 計算量只有上一代模型的 1/20,prefill 加速超過 9 倍,decoding 加速超過 15 倍。

圖源:MiniMax 官方博客。
這聽起來很技術(shù),但到了 Coding Agent 場景里卻很現(xiàn)實。
一個真實開發(fā)任務(wù)里,上下文不是一篇 PDF。它是倉庫結(jié)構(gòu)、歷史改動、用戶中途改需求、測試日志、失敗原因、工具調(diào)用記錄、代碼審查意見,還有 Agent 自己前面做過的判斷。
模型一旦漂移之后,就會開始重復(fù)勞動。
你讓它修 bug,它前面已經(jīng)排除過 A 方案,過了幾十輪又把 A 方案拿出來試一遍。你讓它改 UI,它前面已經(jīng)知道不要用某個組件,后面又手癢加回去。這種體驗比單純寫錯代碼更讓人頭皮抓馬。
所以 M3 的 1M context 真正要解決的是 Agent 在長任務(wù)里能不能記得自己為什么走到這里。
官方博客里有三個任務(wù),我覺得比大多數(shù) benchmark 更值得看。
第一個是論文復(fù)現(xiàn)。MiniMax 把一篇 ICLR 2025 Outstanding Paper Award 論文《Learning Dynamics of LLM Finetuning》丟給 M3,讓它獨立復(fù)現(xiàn)。官方說 M3 連續(xù)跑了接近 12 小時,產(chǎn)出 18 次 commit 和 23 張實驗圖,跑通了核心實驗。

圖源:MiniMax 官方博客。
第二個是 CUDA 算子優(yōu)化。
這個任務(wù)更硬一點。起點是一份任務(wù)描述、一個 benchmark 腳本、一個不能直接運行的 Triton 骨架,沒有高性能參考實現(xiàn)。M3 在約 24 小時里完成 147 次 benchmark 提交、1,959 次工具調(diào)用,把 Hopper FP8 GEMM 的硬件峰值利用率從 7.6% 推到 71.3%,相當于 9.4 倍加速。

圖源:MiniMax 官方博客。
第三個是 PostTrainBench。它要讓 M3 在 12 小時里給 4 個只預(yù)訓練過的 Base 模型做數(shù)據(jù)合成、訓練、評測、迭代。官方給出的結(jié)果是 M3 得分 0.37,略低于 Opus 4.7 的 0.42 和 GPT-5.5 的 0.39,但明顯領(lǐng)先其他模型。

圖源:我自己繪制,數(shù)據(jù)來自 MiniMax 官方博客。
這里我會加一個保守備注:這些都是官方自測,不是獨立第三方復(fù)現(xiàn)。
但是它們的方向是對的。因為真正的 Agent 測評,不能只問“最后答案對不對”,還要看它能不能在反饋稀疏、路徑不清晰、上下文越來越臟的時候繼續(xù)工作。
這個能力,過去是 Opus 這類模型最貴的地方。
M3 還有一個不能繞開的賣點:價格和可用量。
官方同步調(diào)整了 MiniMax Token Plan:Plus 49 元每月 6 億 token,Max 119 元每月 18 億 token,Ultra 469 元每月 55 億 token。官方說按相同價格算,約是 Claude 訂閱的 15 倍用量。

圖源:MiniMax 官方博客。
這就是為什么它哪怕慢,也依然有吸引力。
Opus 級別模型的問題不是只貴一點,而是你不敢讓它隨便跑。一個長程 Agent 任務(wù)動不動就是幾十萬、幾百萬 token,價格會直接決定你敢不敢把任務(wù)交給它。
M3 如果能把“接近 Opus 的長程能力”壓到一個更日常的成本里,那它的意義就不是模型排行榜上多一個 A+,而是讓開發(fā)者真的開始把 Agent 當做首選。
不過這里也要留一手。官方博客說接下來 10 天內(nèi)會更新技術(shù)報告,并開源對應(yīng)模型權(quán)重;模型頁也寫了會在 HuggingFace 和 GitHub 上開放,支持私有集群部署和微調(diào)。
也就是說,現(xiàn)在可以先體驗,但開源權(quán)重、技術(shù)報告、第三方復(fù)測,還要等官方繼續(xù)補齊。
如果“體驗接近 Opus 4.7”指的是:它在 Coding / Agent 長程任務(wù)里能理解大目標、保留上下文、持續(xù)調(diào)用工具、在多輪失敗后繼續(xù)推進,那這個說法有依據(jù)。
如果“體驗接近 Opus 4.7”指的是:它每個場景都和 Opus 一樣穩(wěn)、一樣快、一樣會兜底,那就吹過了。
M3 這次真正有價值的地方,是把 Frontier 模型過去最昂貴的一部分能力,往開發(fā)者日常里推了一步。它不一定替代 Opus,但它可能會改變很多人的用法。
以前你會把 Opus 留給關(guān)鍵任務(wù)來做。
現(xiàn)在你可能會把 M3 掛到一個真實倉庫里,讓它跑一下午,看看它第 145、220、500 次嘗試的時候還會不會繼續(xù)想辦法。
這才是 M3 這次最值得測的地方。
如果你已經(jīng)拿 M3 跑過真實倉庫,尤其是跑過 1 小時以上的任務(wù),歡迎把“慢在哪里、穩(wěn)在哪里、崩在哪里”的樣本丟給我。這個模型最該看的不是首輪回答,是長線程后半段。