點擊上方藍字關注我,加個??標不迷路。
剛剛,Claude 官方發布了自己的最新模型,Opus 4.8。距離上一代 4.7 只隔了 41 天,是它歷代小版本里最快的一次。


從 4.8 和 4.7 的對比上來看,沒有太多明顯的突出的優勢。甚至有一項數字 Terminal coding ,不如 GPT 5.5 。這個說的是考慮命令行里的復雜編排。
諷刺的是,4.8 在這個榜上從 66.1% 干到 74.6%,+8.5 個點,是它所有項目里單項漲幅最大的一個。結果還是輸了,GPT-5.5 在這里 78.2%,還是壓著它。
而官方的聲明則表是,Opus 4.8 要具備更敏銳的判斷力,對自身進展的誠實度更高,而且能夠比之前的模型更長時間的獨立工作。
token 標準價格沒動,還是 $5 / $25 每百萬 token。
變的是 fast mode。Opus 4.8 的是 $10 / $50,速度 2.5 倍;而 4.7 的要 $30 / $150。同樣的高速檔,便宜了 3 倍。
官方還說,Opus 4.8 可以像經驗豐富的工程師一樣進行調用,而無需持續檢查。
它在長時間運行的會話中保持專注,并在你的代碼庫中跟蹤工作進展,因此你可以將一項功能或 bug 排查任務交給它,同時專注于下一步。(我想大家對 Opus 的期待不僅只是一項功能或者改一個 bug 吧)

而且 4.8 來了,就要把 4.6 和 4.7 下了,4.7 下了我能理解,但是 4.6 是為何?
到具體的選擇上來說,做 agentic coding(讓 agent 自己讀代碼、改、跑測試)的,你可以用上 4.8;如果活兒是 terminal 重度(一大堆命令行編排)的,GPT-5.5 還更穩。
這次還增加了一個新的功能,dynamic workflows(研究預覽版)。
這玩意說的是,對于最棘手的研究類型等任務,Claude 會制定計劃,運行數百個并行子代理,并在報告結果前驗證其工作。
數百個子代理。。。活能干的好不好不說,token 反正是秒沒。
我去官網看了一下這個 dynamic workflows 的介紹,它全文是這么說的:
它能夠幫助 Claude 端到端地處理最具挑戰性的任務。你通常需要數個季度才能完成的工作,現在只需幾天即可完成。Claude 會動態編寫編排腳本,在單個會話中運行數十到數百個并行 subagent ,并在您收到任何結果之前檢查其工作。
因為有些問題比較復雜,單個 agent 無法一次性解決,尤其是在復雜的舊代碼庫中:比如在整個服務中搜尋錯誤,涉及數百個文件的遷移,或者在提交之前需要從各個角度進行嚴格測試的計劃。動態工作流可以端到端地處理所有這些問題。
然后放了一張圖

官方也發了??聲明:dynamic workflows 消耗的令牌數量可能比典型的 Claude Code 會話多得多,因此我們建議從范圍較窄的任務開始,以便了解其在工作中的使用情況。 |
注意這一句多得多,我覺得至少是 2x 的消耗。
如果要用這項功能,官方建議你開 auto 模式,啟動后,你有兩種方式啟動 dynamic workflows :
ultracode ,可以通過 effort 設置為 xhigh 拉滿啟動。(目前在 Enterprise / Team / Max 上。),像我 Pro 的是沒權限看的 :)
我看到 Theo 老哥用 100 美元的檔位實測了一次,他說 ultracode 他用一個簡單的 prompt 就達到 5h 限額了。

官方還放了一張容易被劃過去的圖:Misaligned behavior(失準行為)評分,越低越好。

評分越低,說明模型會比較誠實,代表著失準行為的下降。
這么一看,Opus 4.7 真是一坨了,活干的不好,還欺上瞞下,又臭又長。
這次模型發布的最后,Claude 介紹了自己未來要發布 mythos 的計劃。
目前只有少數組織目前正在使用 Claude Mythos Preview 進行網絡安全工作。這種能力水平的模型在普遍發布之前需要更強的網絡安全保護措施。我們正在開發這些保護措施并取得迅速進展,預計在未來幾周內將 Mythos 級模型提供給所有客戶。
這也就是說 mythos 馬上就要發布了。
而且 Claude 還介紹了自己未來要發布一些經濟實惠并且能力相當的好模型。
參考資料:https://www.anthropic.com/news/claude-opus-4-8
https://claude.com/blog/introducing-dynamic-workflows-in-claude-code