?Noam Brown是OpenAI的研究科學家?,2023年加入OpenAI,以前在Meta工作,是?撲克AI?和?大模型推理技術?領域的知名專家。他最出名的成績是做出了能打贏人類頂尖高手的撲克程序,現在正負責OpenAI里讓模型更會“思考”的核心項目。
這是一場關于AI 推理模型、大規模測試時計算(Test-Time Compute)及模型評估現狀的深度訪談(Noam Brown 做客 No Priors 播客)。
以下是訪談內容的干貨:
一、現有基準測試(Benchmark)的缺陷
? 當前模型能力高度依賴投入的測試時計算預算(token、時間、金錢),但傳統 Benchmark 只給單一分數,未控制或展示測試時計算量,導致新一代推理模型(如 5.5 vs 5.4)的真實提升被低估。
? Noam 主張應將性能繪制為測試時計算量的函數,或在固定預算下比較模型,而非只看靜態網格分數。
二、測試時計算擴展的意義與安全評估挑戰
? 現代模型在合理腳手架(scaffold)下可經數周推理才趨近性能天花板,現有 Responsible Scaling Policies 未充分考慮不同預算下的危險能力差異。
? 安全評估同樣面臨"用多少預算評估模型危險能力"這一未被充分討論的問題。
三、實用場景與模型使用建議
? 思考時長應靈活——簡單問題快速響應,復雜問題允許長思考,目前用戶和業界基本在 striking the right balance。
? Noam 日常用模型處理稅務咨詢、買房文書等真實問題,認為當前模型輸出可信度已可媲美人類專家。
四、用撲克Bot 構建評估模型推理能力
? Noam 用"讓模型寫撲克 Bot"作為私有 eval:早期模型做 River Solver 都需引導;5.5 可零樣本完成 River Solver,經輕微引導可做完整求解器。
? 模型曾出現"gaslighting"現象(如堅稱棄牌損失 92 而非 100),5.5 已明顯改善。
五、未充分探索的潛藏能力與Erd?s 單位距離猜想
? 當前已發布模型在足夠大推理預算+腳手架下可能已能解決部分未解數學問題(如 Erd?s 單位距離猜想已被 OpenAI 內部模型推翻),但外界未充分探索大預算下的能力上限。
? 模型迭代快,同等任務推理成本每代降 10~100 倍,存在"等下一代更便宜"與"現在探索極限"的權衡。
六、遞歸自我改進與"智能爆炸"觀點
? 并非所有任務都隨測試時計算增加而改善(如純事實回憶),且模型尚缺"研究品味",無法完全替代研究員提出原創算法或方向。
? 因強大能力依賴大量運行時間,時間是瓶頸,不太可能出現瞬間 overnight 智能爆炸,更可能是漸進式加速(Gradual Takeoff)。
七、多智能體、競爭與行業展望
? 未來方向包括多智能體協調與跨會話知識積累(人類靠文明積累知識,模型目前 context 消失后歸零)。
? 前沿實驗室競爭雖激烈,但各方均意識到風險與責任,力求正向結果而非單純競速。
八、對研究社區的最后呼吁
? 業界陷入"大家都發 Benchmark 網格 → 大家期待網格"的壞均衡,Noam 撰文呼吁改以測試時計算量為橫軸繪圖呈現性能曲線,打破錯誤均衡。(No Priors)