點擊上方藍字關注我,加個??標不迷路。
今天,MiniMax 正式發布了 M3。官方給它的定位是:Coding / Agent、1M 上下文、原生多模態。

正式發布前幾天,我看有人發消息說可以進 M3 內測群,然后我就進去了,我以為是內測一段時間再發布,但沒想到今天就發布了,那這個內測群,除了提供 7 天免費試用之外,別的好像也沒啥用處了。

我身邊有個小伙伴一直在做模型測評,這次他史無前例的夸贊了一下 M3 ,這個榜單就一個讓我注意的點,那就是 M3 竟然比 opus4.6 分數還高。。。。。。
MiniMax M3 Free 排第 4,88 分,A+。前面是 GPT 5.5 xhigh、Claude 4.7 Opus Max 和 Gemini 3.1 Pro。單看分數,它確實已經貼近 Opus 4.7 那一檔了。
但是同一行還有一個很扎眼的備注:慢,7m51s。

圖源:身邊小伙伴的測評圖。
所以這篇不想寫成“國產模型吊打 Opus”的爽文。那種寫法就是跑分沒輸過,體驗沒贏過。
所以我更關心的問題是:M3 到底在哪些體驗上接近 Opus 4.7,又在哪些體驗上還不能腦補成 Opus 4.7?
這和過去很多國產模型發布不太一樣。
以前大家喜歡比單點能力:數學多少分、代碼多少分、長文本多少 token。但 M3 這次講的是組合能力。它不是只想回答一道題,而是想進到一個長程工作流里,連續讀代碼、看日志、調工具、改方案、再繼續跑。

圖源:我自己繪制,數據來自 MiniMax 官方博客和模型頁。
官方博客里有幾個關鍵數字:
SWE-Bench Pro 59.0%,Terminal-Bench 2.1 為 66.0%,SWE-fficiency 34.8%,KernelBench Hard 28.8%,MCP Atlas 74.2%。
這些數字單獨看,不一定有體感。真正有體感的是官方那句話:在 SWE-Bench Pro 上,M3 超過 GPT-5.5 和 Gemini 3.1 Pro,接近 Opus 4.7;在 SVG-Bench 上,M3 超過 Opus 4.7。
注意,是 接近,不是全面等同。
我傾向于把這個“接近”限定在一個范圍里:Coding / Agent 的長程任務體驗。
因為從官方材料看,M3 這次最想證明的不是“我會寫一個函數”,而是“我能在一個復雜任務里持續推進”。這正是 Opus 這類模型過去最拉開差距的地方。

圖源:我自己自制;體驗榜來自用戶截圖,官方指標來自 MiniMax 發布頁。
模型頁還給了一個很有意思的點:BrowseComp 上 M3 得分 83.5,Opus 4.7 是 79.3。也就是說,至少在官方口徑下,M3 在自主瀏覽、信息檢索這類 Agent 能力上已經能和 Opus 4.7 正面比較。
但是體驗榜里的慢,也不能忽略。
如果你的場景是日常聊天、快速問答、隨手補一段代碼,7 分多鐘就是硬傷。你不能因為一個模型能跑 24 小時,就假裝它每次響應都很絲滑。
所以我的第一判斷是:M3 更像一個可以掛后臺跑任務的工程型模型,而不是一個每句話都要秒回的聊天模型。
官方這次反復講 MSA,也就是 MiniMax Sparse Attention。
簡單說,它想解決的是長上下文成本爆炸的問題。官方稱,M3 API 最高支持 1M tokens,上下文保底 512K。在 100 萬上下文長度下,M3 每 token 計算量只有上一代模型的 1/20,prefill 加速超過 9 倍,decoding 加速超過 15 倍。

圖源:MiniMax 官方博客。
這聽起來很技術,但到了 Coding Agent 場景里卻很現實。
一個真實開發任務里,上下文不是一篇 PDF。它是倉庫結構、歷史改動、用戶中途改需求、測試日志、失敗原因、工具調用記錄、代碼審查意見,還有 Agent 自己前面做過的判斷。
模型一旦漂移之后,就會開始重復勞動。
你讓它修 bug,它前面已經排除過 A 方案,過了幾十輪又把 A 方案拿出來試一遍。你讓它改 UI,它前面已經知道不要用某個組件,后面又手癢加回去。這種體驗比單純寫錯代碼更讓人頭皮抓馬。
所以 M3 的 1M context 真正要解決的是 Agent 在長任務里能不能記得自己為什么走到這里。
官方博客里有三個任務,我覺得比大多數 benchmark 更值得看。
第一個是論文復現。MiniMax 把一篇 ICLR 2025 Outstanding Paper Award 論文《Learning Dynamics of LLM Finetuning》丟給 M3,讓它獨立復現。官方說 M3 連續跑了接近 12 小時,產出 18 次 commit 和 23 張實驗圖,跑通了核心實驗。

圖源:MiniMax 官方博客。
第二個是 CUDA 算子優化。
這個任務更硬一點。起點是一份任務描述、一個 benchmark 腳本、一個不能直接運行的 Triton 骨架,沒有高性能參考實現。M3 在約 24 小時里完成 147 次 benchmark 提交、1,959 次工具調用,把 Hopper FP8 GEMM 的硬件峰值利用率從 7.6% 推到 71.3%,相當于 9.4 倍加速。

圖源:MiniMax 官方博客。
第三個是 PostTrainBench。它要讓 M3 在 12 小時里給 4 個只預訓練過的 Base 模型做數據合成、訓練、評測、迭代。官方給出的結果是 M3 得分 0.37,略低于 Opus 4.7 的 0.42 和 GPT-5.5 的 0.39,但明顯領先其他模型。

圖源:我自己繪制,數據來自 MiniMax 官方博客。
這里我會加一個保守備注:這些都是官方自測,不是獨立第三方復現。
但是它們的方向是對的。因為真正的 Agent 測評,不能只問“最后答案對不對”,還要看它能不能在反饋稀疏、路徑不清晰、上下文越來越臟的時候繼續工作。
這個能力,過去是 Opus 這類模型最貴的地方。
M3 還有一個不能繞開的賣點:價格和可用量。
官方同步調整了 MiniMax Token Plan:Plus 49 元每月 6 億 token,Max 119 元每月 18 億 token,Ultra 469 元每月 55 億 token。官方說按相同價格算,約是 Claude 訂閱的 15 倍用量。

圖源:MiniMax 官方博客。
這就是為什么它哪怕慢,也依然有吸引力。
Opus 級別模型的問題不是只貴一點,而是你不敢讓它隨便跑。一個長程 Agent 任務動不動就是幾十萬、幾百萬 token,價格會直接決定你敢不敢把任務交給它。
M3 如果能把“接近 Opus 的長程能力”壓到一個更日常的成本里,那它的意義就不是模型排行榜上多一個 A+,而是讓開發者真的開始把 Agent 當做首選。
不過這里也要留一手。官方博客說接下來 10 天內會更新技術報告,并開源對應模型權重;模型頁也寫了會在 HuggingFace 和 GitHub 上開放,支持私有集群部署和微調。
也就是說,現在可以先體驗,但開源權重、技術報告、第三方復測,還要等官方繼續補齊。
如果“體驗接近 Opus 4.7”指的是:它在 Coding / Agent 長程任務里能理解大目標、保留上下文、持續調用工具、在多輪失敗后繼續推進,那這個說法有依據。
如果“體驗接近 Opus 4.7”指的是:它每個場景都和 Opus 一樣穩、一樣快、一樣會兜底,那就吹過了。
M3 這次真正有價值的地方,是把 Frontier 模型過去最昂貴的一部分能力,往開發者日常里推了一步。它不一定替代 Opus,但它可能會改變很多人的用法。
以前你會把 Opus 留給關鍵任務來做。
現在你可能會把 M3 掛到一個真實倉庫里,讓它跑一下午,看看它第 145、220、500 次嘗試的時候還會不會繼續想辦法。
這才是 M3 這次最值得測的地方。
如果你已經拿 M3 跑過真實倉庫,尤其是跑過 1 小時以上的任務,歡迎把“慢在哪里、穩在哪里、崩在哪里”的樣本丟給我。這個模型最該看的不是首輪回答,是長線程后半段。