最近這段時間,國內(nèi)外模型更新得很快。
如果只看發(fā)布會和榜單,大家都會覺得每個模型都很強(qiáng)。參數(shù)更大、上下文更長、推理更強(qiáng)、價格更低,聽起來都挺猛。
但真正用到工作流里,會發(fā)現(xiàn)另一件事:模型強(qiáng)不強(qiáng),不只看它會不會回答問題,還要看它能不能把一個任務(wù)完整跑完。
尤其是 Agent 場景。
一個復(fù)合任務(wù)需要大模型去調(diào)用多個工具,比如讓模型做一份 PPT,它并不是簡單寫幾頁文字。中間要先理解需求,再去搜索資料,閱讀網(wǎng)頁,提取關(guān)鍵信息,整理成匯報結(jié)構(gòu),必要時還要生成代碼或調(diào)用插件,最后產(chǎn)出一個可以正常使用的PPT文件。
下面測試兩個Agent任務(wù),使用同樣的提示詞,相同的Agent工具-Trae Work。
提示詞:
調(diào)研當(dāng)前主流短視頻平臺的差異化優(yōu)勢和發(fā)展路徑,并整理成一份匯報的演示稿件。 調(diào)研范圍包括平臺基本情況、用戶規(guī)模、內(nèi)容生態(tài)、推薦機(jī)制、商業(yè)化模式以及代表性案例。重點對比不同平臺在用戶群體、內(nèi)容類型和增長策略方面的差異,并總結(jié)其成功經(jīng)驗與未來趨勢,為產(chǎn)品或市場策略提供參考。
Step 3.7 Flash 收到指令后會根據(jù)提示詞的需求,進(jìn)行分析,然后檢索對應(yīng)網(wǎng)站信息,歸納信息最后調(diào)用PPT插件工具制作幻燈片文件。



風(fēng)格偏向簡約風(fēng)格。耗時在5分鐘左右,消耗差不多1塊。


這個也可以明顯的查看到,此次任務(wù)使用了什么技能和搜索了什么網(wǎng)站。
整體看下來,Step 3.7 Flash 更像是偏生產(chǎn)級的選擇。
它的優(yōu)勢不一定是單頁 PPT 最漂亮,而是在速度、工具調(diào)用和任務(wù)完成率之間比較平衡。高頻、多輪、需要穩(wěn)定交付的 Agent 任務(wù),會比較適合它。
DeepSeek v4-Pro也是同樣的路徑,識別任務(wù)然后找到需要調(diào)用的工具,PPT生成工具。
只不過配色方面要鮮艷一點。最后一步也成功調(diào)用了PPT工具。



耗時差不多5分鐘,token消耗在0.5左右。

簡單說,DeepSeek V4 的優(yōu)勢是內(nèi)容組織和展示效果比較好,適合對成品表達(dá)有要求的場景。但如果是持續(xù)高頻跑 Agent 流水線,還要繼續(xù)看端到端速度和單次成本。
調(diào)用Minimax執(zhí)行這個Agent任務(wù)有些不同,同樣的提示詞,Minimax最后一步調(diào)用的HTML工具制作的演示文稿。正常來說應(yīng)該要去調(diào)用PPT工具。既然調(diào)用了HTML生成工具,看看生成效果怎么樣。

HTML整體畫面風(fēng)格還是可以的,因為是HTML所有代碼要好生成一些,如果是制作PPT,可能就沒有這么好把控。


風(fēng)格偏向清新風(fēng)格,數(shù)據(jù)這方面比較齊全的。耗時差不多在7分鐘左右,金額消耗0.7。

所以 MiniMax M3 在這次測試?yán)锉憩F(xiàn)出不錯的信息整理能力和視覺表達(dá)能力,但工具選擇的可控性還需要關(guān)注。
它適合內(nèi)容頁、網(wǎng)頁報告、輕量演示類任務(wù);如果是嚴(yán)格辦公格式,比如 PPT、Word、Excel,最好在 Prompt 里把輸出格式寫得更死一點。
Gemini系列的模型,審美一直在線,但是有一個實際問題就是-不穩(wěn)定。
而且運(yùn)行效率比較慢,國內(nèi)模型的話這個PPT任務(wù)在3分鐘內(nèi)可以搞定,但是使用Gemini3.5現(xiàn)在粗略估計已經(jīng)運(yùn)行了10分鐘了,還異常打斷了一次。
如果在官方的工具中進(jìn)行調(diào)用的話,那么會穩(wěn)定一些。關(guān)鍵是谷歌的官方工具Google Antigravity也用不了呀。

下面是生成的PPT結(jié)果。


如果任務(wù)異常打斷的話,會影響到任務(wù)鏈路會變得不連貫,最后導(dǎo)致成品一致性會變差。
這個是最后制作出來的,耗時差不多12分鐘。因為中間有斷聯(lián)情況。

所以 Gemini 3.5 的優(yōu)勢更偏視覺審美和內(nèi)容表達(dá),適合對頁面質(zhì)感要求高的任務(wù)。短板是端到端效率和鏈路穩(wěn)定性。
對于高頻、低延遲、生產(chǎn)級 Agent 場景,這個問題會被放大。
GPT的模型在國外主流模型中,可能沒有很突出的方面,但是比較全能。畢竟GPT是模型界的老大哥。
這里我使用的工具是MonkeyCode,因為這個平臺可以免費使用GPT5.4.
同樣的提示詞這個是制作效果:




這個和MiniMax一樣直接做成了一個HTML。很明顯不是我們想要的PPT文件。
可能是工具沒有選對。 切回統(tǒng)一的Agent工具Trae Work。



效果一般,不是很突出。

使用費用在1.4美元左右,那差不多就是9.5塊人民幣。耗時差不多10分鐘。這樣一比較起來,感覺除了寫代碼,日常的一些AI使用和Agent調(diào)用完全可以考慮國內(nèi)模型。
為什么要測試信息抓取呢?因為這個任務(wù)是需要大模型去調(diào)用瀏覽器工具,測試大模型調(diào)用單工具,單復(fù)雜任務(wù)的能力。瀏覽器信息抓取,需要模型去識別對應(yīng)的界面標(biāo)簽,比如點贊在什么地方,評論在什么地方,找到對應(yīng)的標(biāo)簽后,再進(jìn)行往下面執(zhí)行。
提示詞
到小紅書搜索關(guān)于即夢的最熱門的筆記,選五個整理一下筆記的內(nèi)容、點贊數(shù)和前三條評論整理為一個HTML,放在桌面就行,名字叫“筆記整理”。



這個瀏覽器測試任務(wù)消耗就比較高了,因為每一步模型都要進(jìn)行思考下一步應(yīng)該要干什么,點擊什么元素才可以獲取到對應(yīng)的數(shù)據(jù)。

消耗了快200萬的token,金額在0.9元左右。 最后制作的效果。



正確獲取到了小紅書上面的數(shù)據(jù)。
同樣的提示詞采用MiniMax-M3進(jìn)行一次測試。很明顯數(shù)據(jù)和前面的有些不同。不同的原因是因為篩選不一樣,MiniMax-M3選用最多點贊進(jìn)行篩選。Stpe-3.7-flash采用最多評論進(jìn)行篩選。


消耗金額在一塊錢左右。

MiniMax-M3有一個小問題是沒有打開瀏覽器進(jìn)行操作,在Agent內(nèi)部使用網(wǎng)絡(luò)搜索得出的結(jié)論。但生成的結(jié)果已經(jīng)可以了。
deepseek-V4-Pro正常調(diào)用瀏覽器去獲取數(shù)據(jù)。

制作的HTML效果。


deepseek-V4-Pro使用了360萬左右的token,價格在0.5左右。

測試到這里就結(jié)束了。
前面的測試,主要跑的是一個Agent任務(wù)的鏈路問題——從搜索→閱讀→總結(jié)→代碼生成→再到工具調(diào)用,最終輸出PPT結(jié)果和數(shù)據(jù)展示。我們重點看的是這套流程是否跑得流暢,以及端到端耗時和單任務(wù)成本的高低。
如果只看單次成品,差距可能沒那么夸張。但放到生產(chǎn)環(huán)境里,差異會被迅速放大。因為Agent任務(wù)看的是端到端結(jié)果:能不能穩(wěn)定跑完,跑完要多久,每次調(diào)用要多少錢,最后文件能不能直接用。
至少在“高頻、明確、可驗證”這類Agent任務(wù)里,F(xiàn)lash檔模型的價值開始凸顯。它不追求所有榜單第一,但要在速度、成本和穩(wěn)定性之間找到一個更實用的平衡點——而這恰恰是生產(chǎn)級場景最在意的三個維度。