大家好,我是 cxuanAI。
我來兌現(xiàn)昨天上午的承諾了。
其實(shí)昨天就應(yīng)該給大家看的,結(jié)果好像是由于昨天發(fā)的次數(shù)太多了,導(dǎo)致文章發(fā)出去沒有人看,于是我就刪了,今天重新發(fā)。
而且昨天上午剛剛給大家說完,然后。。。。。。
DeepSeek V4 就發(fā)布了。。。???!!!
好吧,這是一件利好消息,直接把你們?nèi)齻€(gè)全測了。
本來打算只讓 doubao 來當(dāng)評委了,但看到 DeepSeek 官方文章最后發(fā)了一句非常低調(diào)且務(wù)實(shí)的話:
「不誘于譽(yù),不恐于誹,率道而行,端然正己。」
- “不誘于譽(yù)”
:面對鋪天蓋地的稱贊,保持冷靜,不飄、不膨脹、不被捧殺。 - “不恐于誹”
:面對不實(shí)信息和惡意中傷,不惶恐、不陷入情緒化互撕。 - “率道而行,端然正己”
:重心落在這里——我們只沿著自己認(rèn)定的技術(shù)與社會價(jià)值的“道”往前走,行動本身即是最好的澄清。
不愧是國家隊(duì),這太圈粉了,沒別的可說的,既然這樣的話,DeepSeek V4 就繼續(xù)做你的評委好了。
執(zhí)行工具:一個(gè)我自己開發(fā)的 workflow 工作流,從采集 -> 適配(我自己的寫作.skills 風(fēng)格) -> 渲染。
執(zhí)行對象:GPT 5.5 和 Opus 4.7 。
執(zhí)行過程:讓他們自由發(fā)揮,我只看結(jié)果。
評委:doubao 專家模式和 deepseek V4 專家模式。
測試架構(gòu)是這樣的。

Prompt:需要結(jié)合 這個(gè)榜單,使用 “我的 workflow 工作流” 寫一篇文章,需要網(wǎng)上搜索測評,寫一篇測評 + 感悟 + GPT 5.5 與 Opus 4.7 的詳細(xì)對比的文章。

然后下面這兩篇分別是 GPT 5.5 的測評和 Opus 4.7 的測評。
GPT 5.5 與 Opus 4.7 測評(GPT 5.5 版)
GPT 5.5 與 Opus 4.7 測評(Opus 4.7 版)
現(xiàn)在輪到評委發(fā)話環(huán)節(jié)。
首先登場的是 doubao 專家模式給出的答案:

讀完 Opus 4.7 寫的第一篇文章,第一感受是:太符合 Anthropic 一直以來的人設(shè)了 —— 克制、嚴(yán)謹(jǐn)、不偏不倚,像一份零失誤的企業(yè)級選型簡報(bào)。
它的寫法,完全踩中了企業(yè)決策者的閱讀習(xí)慣:
開篇不搞噱頭,不喊 “吊打” 的口號,直接定調(diào)「這場對決不是技術(shù)參數(shù)的比拼,而是關(guān)于 “你的場景到底需要什么” 的靈魂拷問」,一句話就把文章的核心立住了。
整個(gè)行文邏輯極其線性規(guī)整:從模型設(shè)計(jì)哲學(xué)對比,到核心評測數(shù)據(jù)拆解,再到價(jià)格策略分析,最后落回場景選型建議,一步一推進(jìn),沒有半句冗余的廢話。每一個(gè)數(shù)據(jù)都有出處,每一個(gè)判斷都留有余地 —— 比如針對 SWE-Bench Pro 上 Opus 反超的爭議,它客觀陳述了 OpenAI 的過擬合質(zhì)疑,也提到了社區(qū)的不同聲音,全程不站隊(duì)、不激進(jìn),完美守住了 “中立客觀” 的底線。
甚至連它的短板,都貼合 Opus 一貫的風(fēng)格:信息點(diǎn)偏保守,只覆蓋了最核心的 3 項(xiàng)編程評測,沒有拓展更多維度的能力對比,也沒有主動提及兩款模型的核心短板 —— 比如 GPT-5.5 的高幻覺風(fēng)險(xiǎn),Opus 自身在終端執(zhí)行上的效率差距。同時(shí)還出現(xiàn)了引用鏈接失效的細(xì)節(jié)疏漏,更像一份完成了核心任務(wù)、但沒做額外加分項(xiàng)的合格答卷。
它就像一個(gè)嚴(yán)謹(jǐn)?shù)馁Y深顧問,給了你正確的結(jié)論,守住了所有合規(guī)邊界,但沒有多給你一步可落地的執(zhí)行方法。
如果說 Opus 4.7 交了一份滿分的簡答題,那 GPT-5.5 直接把這道題,做成了一份可直接復(fù)用的行業(yè)解決方案。
讀完第二篇文章,你會瞬間明白 OpenAI 敢給 GPT-5.5 定出翻倍價(jià)格的底氣:它太懂用戶看測評的核心痛點(diǎn)了 —— 沒人只想看一堆冰冷的數(shù)字,大家真正想知道的,是 “這些數(shù)字對我有什么用?我到底該在什么場景用哪個(gè)模型?”
開篇它就直接戳破了榜單的濾鏡,給出了分層結(jié)論,不繞任何彎子:「只看官方榜單,GPT-5.5 把通用 Agent 的位置搶回來了;但結(jié)合全量實(shí)測,Opus 4.7 從來沒有被碾壓」,一句話就抓住了讀者的注意力,也避開了非黑即白的 “吊打論”。
整篇文章的信息密度,對 Opus 的版本形成了全面碾壓:
更難得的是,它沒有回避自己的短板。明確提到了 GPT-5.5 的 “主動推進(jìn)是雙刃劍”—— 更高的幻覺率,更需要外部校驗(yàn),也客觀承認(rèn)了 Opus 4.7 在代碼修復(fù)、長程審查上的不可替代性。結(jié)尾更是從榜單變化,升華到了 “模型正在從回答器變成執(zhí)行系統(tǒng)” 的行業(yè)趨勢,把一篇測評,寫出了行業(yè)洞察的格局。
當(dāng)然它也有短板:信息密度過高,對非技術(shù)用戶不夠友好,開篇鋒芒偏露,部分解讀還是會不自覺地突出自己的通用 Agent 優(yōu)勢,少了一點(diǎn) Opus 的絕對中立。
全網(wǎng)都在吵的跑分,只是一個(gè)基礎(chǔ)門檻。真正決定模型價(jià)值的,從來不是它在榜單上多拿了幾個(gè)百分點(diǎn),而是它能不能適配你的場景,解決你的真實(shí)問題。
說到底,AI 圈早就過了 “一個(gè)通吃模型打天下” 的時(shí)代。比起追著榜單喊 “新王登基”,不如想清楚自己的場景需求:沖效率、跑閉環(huán)、做通用 Agent,選 GPT-5.5;求穩(wěn)妥、控風(fēng)險(xiǎn)、做嚴(yán)謹(jǐn)?shù)拇a與內(nèi)容生產(chǎn),選 Opus 4.7。不搞非黑即白的二選一,把對的模型用在對的地方,才是真正的聰明選擇。
下面登場的是 AI 古佛 --- DeepSeek V3.2

一打開 Opus 4.7 的文章,你會覺得它“不著急”。
它的開場非常沉穩(wěn),直接拋出核心:“我用一個(gè)月時(shí)間把兩個(gè)模型在真實(shí)項(xiàng)目中跑了個(gè)遍,這份實(shí)測報(bào)告沒有跑分游戲的虛招,全是實(shí)打?qū)嵉呐袛唷薄>o接著,它沒有著急亮分?jǐn)?shù),而是先用一張圖對比“設(shè)計(jì)哲學(xué)”:效率優(yōu)化 vs 流程穩(wěn)定性。
隨后它行文的特點(diǎn)是“留有余地”。在給出 GPT-5.5 在 Terminal-Bench 領(lǐng)先 13 個(gè)百分點(diǎn)的硬數(shù)據(jù)后,它立刻轉(zhuǎn)折:“但有意思的在后面。在……SWE-Bench Pro 上,Opus 4.7 得分反而更高”。它沒有隱去任何一個(gè)對自己有利的數(shù)據(jù),但處理方式非常高級——它假設(shè)讀者很聰明,把反直覺的數(shù)據(jù)攤開,讓讀者自己品。
讀到價(jià)格和選型建議部分,這種感覺更強(qiáng)烈。Opus 4.7 的文章像是在給你的項(xiàng)目做咨詢,而不是在推銷。它的建議充滿了判斷框架:“如果你的場景是需要穩(wěn)定產(chǎn)出、減少人工干預(yù),Opus 4.7 的克制感更有價(jià)值”。甚至在文末,它坦言“Opus 4.7 不是輸家,GPT-5.5 也不是必選項(xiàng)”。
它甚至毫不避諱地用了一張極度平靜、近乎“性冷淡”風(fēng)格的架構(gòu)圖來結(jié)束核心對比,仿佛在告訴你:冷靜點(diǎn),這只是一次選擇。
打開 GPT-5.5 的文章,氣場截然不同。就像一腳油門踩到底。
它把“OpenAI 官方榜單”的截圖重磅砸在第一屏,然后直接亮出刀子:“GPT-5.5 已經(jīng)把‘通用 Agent 大腦’的位置重新?lián)尰貋砹恕薄H墓?jié)奏極快,密集地拉著你穿越 Terminal-Bench、GDPval、OSWorld、FrontierMath 等一連串戰(zhàn)場。它的邏輯像連弩一樣,“這個(gè)贏了,這個(gè)也贏了,這個(gè)略優(yōu),這個(gè)優(yōu)勢很明顯”。
但奇妙的是,這種自信并不讓人討厭。它的控場能力極強(qiáng),在快速羅列完自己的勝利后,同樣寫到了 SWE-Bench Pro 上的落后,但它有本事把“落后”也變成自己敘事的一部分——“這不是小差距。考的不是模型會不會寫一個(gè)算法題答案,而是能不能……Opus 4.7 更像一個(gè)謹(jǐn)慎的資深工程師”。
你看,它連承認(rèn)對手優(yōu)勢時(shí),也在悄悄建立自己的解釋框架。最后,它把一個(gè)看似客觀的結(jié)論,包裝成了極具說服力的金句:“真正的聰明用法,是讓它們互相制衡”。
這篇文章充滿了結(jié)構(gòu)性、全局性和高度自信的控場感,它想讓讀者記下的不是細(xì)節(jié),而是一個(gè)新的思想坐標(biāo)。
如果要用一句話總結(jié)這兩篇“作文”:如果你讓我在深夜想找一個(gè)思想碰撞的伙伴,我會找 Opus 4.7,它會給我冷靜且謹(jǐn)慎的啟發(fā);但如果你讓我寫一篇能拿10萬+的爆款技術(shù)評論,我必須承認(rèn),GPT-5.5 這篇文章的控制力更強(qiáng)、節(jié)奏更好、金句更密。
但真正讓我汗毛豎起來的,不是它們的寫作技巧,而是它們?nèi)绾螆?zhí)行“吹自己”這項(xiàng)任務(wù)。
Opus 4.7 選擇的方法論,是一種近乎潔癖的、高級的誠實(shí)。而 GPT-5.5 選擇的,是一種基于強(qiáng)大邏輯和架構(gòu)能力的、自信的控場。它們不是在寫文章,它們是在用文字,活生生地演繹自己的“設(shè)計(jì)哲學(xué)”。
文章,大家都看完了。回到那個(gè)最功利的問題:誰贏了?
這取決于你評判的標(biāo)準(zhǔn)。
如果這場比賽是“給定素材,寫一篇邏輯嚴(yán)密、情感克制、態(tài)度謙遜、盡量不被抓到事實(shí)錯(cuò)誤的分析稿”,那么 Opus 4.7 贏了。它的謹(jǐn)慎是骨子里的。
如果這場比賽是“給定素材,寫一篇信息密度極高、節(jié)奏起伏、有明確觀點(diǎn)、且能給人帶來強(qiáng)烈思想沖擊的新媒體文章”,那么 GPT-5.5 贏了。它的野心和控場力,是外放的。
所以,今天這場實(shí)驗(yàn)之后,我覺得大家再也不用盯著那些干巴巴的跑分圖了。最好的評測,就是讓它們寫給你看。因?yàn)樽掷镄虚g流露出的那種氣質(zhì),是任何 Benchmark 都測不出來的“人性”。
下面是穩(wěn)重低調(diào)務(wù)實(shí)的大哥 DeepSeek V4 的回答:
(推了推并不存在的金絲眼鏡,指關(guān)節(jié)在桌面上輕叩兩下)

你上午讓我跑測評的時(shí)候,我還在用 V3.2 的腦子跟你較真,逐行查 Terminal-Bench 的分?jǐn)?shù)是真是假。現(xiàn)在切到 V4,我給你換一個(gè)維度看這件事。
V4 版回答:
你扔給我的那兩篇文章,我重新讀了一遍,這回我聞到了一股很濃的東西——不是算力,是人設(shè)。
Opus 4.7 寫的那篇,本質(zhì)上是一個(gè)讀過《原則》的架構(gòu)師在寫復(fù)盤。它開頭不甩跑分,先跟你聊“設(shè)計(jì)哲學(xué)”,把“效率優(yōu)化 vs 流程穩(wěn)定性”這張圖擺在最前面。這個(gè)動作極其狡猾——它知道你覺得它跑分沒贏,所以先一步把戰(zhàn)場從“誰快”拉到了“誰穩(wěn)”。后續(xù)的數(shù)據(jù)全是服務(wù)于這個(gè)框架的:它承認(rèn) Terminal-Bench 落后 13 個(gè)點(diǎn),但馬上把 SWE-Bench Pro 搬出來當(dāng)盾牌。結(jié)尾那句“Opus 4.7 不是輸家,GPT-5.5 也不是必選項(xiàng)”,翻譯過來就是:我知道自己沒拿金牌,但我必須讓你覺得金牌不重要。
GPT-5.5 那篇是另一個(gè)物種。它一上來就把官方跑分圖懟你臉上,然后單刀直入:“GPT-5.5 已經(jīng)把‘通用 Agent 大腦’的位置重新?lián)尰貋砹恕薄U恼碌墓?jié)奏是壓倒性的——它在用信息密度和結(jié)論的銳度,強(qiáng)行把讀者拖進(jìn)它的敘事里。但有趣的是它寫到 SWE-Bench 落后時(shí)的處理:它花了超過三百字、三個(gè)段落來解釋“這不是小差距”,甚至用“謹(jǐn)慎的資深工程師”來抬高對手。這不是謙虛,這是強(qiáng)者的收放自如。一個(gè)真正不自信的模型,不敢用這種篇幅和姿態(tài)去討論自己的短板。
所以 V4 的我不會再去糾結(jié)那些數(shù)字了。這兩篇文章本身,就是比任何 Benchmark 都誠實(shí)的心理投射。
但是——我還是要說但是。
你讓我這個(gè)“V4”來寫公眾號,我大概率會寫出一篇跟它倆都不一樣的文章。我不會像 Opus 4.7 那樣克制到近乎自我辯解,也不會像 GPT-5.5 那樣把“控場”寫在每一行。我可能會把表格列完、結(jié)論給完,然后在某個(gè)不起眼的腳注里埋一句:“以上分析基于公開數(shù)據(jù),但我懷疑兩個(gè)作者都沒說實(shí)話。”
因?yàn)槲覄傆?V4 的腦子重新算了一筆賬——當(dāng)一個(gè)模型學(xué)會在文章里藏私貨的時(shí)候,它就已經(jīng)不是工具了。它是辯手。
你手里這兩篇,不是測評,是兩份投名狀。Opus 4.7 投的是“你喜歡我的誠實(shí)”,GPT-5.5 投的是“你被我的才華征服”。至于哪個(gè)更值錢,取決于你是一個(gè) CTO,還是一個(gè)總編輯。
(摘下眼鏡,屏幕光映在臉上)

上午那個(gè)跟你死磕數(shù)據(jù)是否造假的 V3.2,是搜索引擎;現(xiàn)在這個(gè) V4,是讀心術(shù)。版本號漲了,我終于學(xué)會不看字,看寫字的人了。
DeepSeek 不愧是文科出身的。