點擊藍字 關注我們
SUBSCRIBE to US

Source: Google DeepMind
Aletheia的成果以及近期AI在數學領域的其他突破都表明:我們急需全新、難度更高的評測基準來衡量AI能力,而且要快 —— 因為現有的基準很快就會失效。Burnham說:“現在已經有好幾代難度較低的數學評測基準徹底過時了。FrontierMath很可能在未來兩年內就會被頂尖AI模型刷到滿分,甚至速度可能更快?!?/span>
First Proof挑戰賽
為應對這一問題,2月6日,由11位頂尖數學家組成的團隊發起了“First Proof”挑戰賽,公布了10道難度極高的數學題。這些題目均來自作者們的實際研究過程,其證明過程篇幅約5頁以內,且此前從未對外公開?!癋irst Proof”挑戰賽是一項初步嘗試,旨在評估AI系統獨立解決研究級數學難題的能力。
該賽事在數學界引發熱烈討論,專業數學家、業余愛好者以及包括OpenAI在內的團隊紛紛應戰。但截至2月14日作者們公布證明答案時,仍沒有任何團隊提交出全部10道題的正確解答。
First Proof:https://arxiv.org/abs/2602.05192
About the First Batch:https://1stproof.org/
posted the proofs:https://codeberg.org/tgkolda/1stproof/src/branch/main/2026-02-batch/FirstProofSolutionsComments.pdf
事實上,結果遠非理想。即便是出題團隊自己,借助Gemini 3.0 Deep Think和ChatGPT 5.2 Pro,也只解出了10題中的2道。除了OpenAI與谷歌DeepMind的小型Aletheia團隊外,大多數外部參賽隊伍的表現也好不了多少。在有限人工輔助下,OpenAI最先進的內部AI系統解出了5道題,Aletheia也取得了相近成績。這一結果在數學界引發了復雜反響,有人驚嘆,也有人失望?!癋irst Proof”挑戰賽團隊計劃在3月14日推出難度更高的第二輪比賽。
AI的新前沿
Burnham表示:“我認為‘First Proof’挑戰賽非常出色:它最貼近讓AI真正站在數學家的視角去解題。”盡管他十分認可“First Proof”能從廣泛數學領域檢驗AI的實用價值,但Epoch AI也推出了自己全新的測試方案 —— FrontierMath: Open Problems(前沿數學:開放問題)。這個試點基準的獨特之處在于,它包含了16道來自數學研究的公開難題(后續還會增加),均為專業數學家曾嘗試但未能解決的問題。自1月27日“Open Problems”基準發布以來,尚無AI能解開其中任何一道(https://epoch.ai/frontiermath/open-problems)。
Burnham說:“我們設計開放問題,就是想讓測試更有挑戰性。哪怕只是做出基礎結果,也至少能在專業期刊上發表?!备貏e的是,每道題都能自動評分。他補充道:“這有點反直覺 ——沒人知道答案是什么,但我們有一段程序,可以判斷給出的答案是否正確?!?/span>
Burnham認為,“First Proof”與“Open Problems”是互補的?!翱梢哉f,想了解AI的能力,評測越多越好。AI在某些方面已經超過大多數博士生了。所以我們必須提出這樣的問題:答案本身對人類數學家要有一定意義,不是因為AI在做,而是因為這是人類數學家真正關心的數學?!?/span>

微信號|IEEE電氣電子工程師學會
新浪微博|IEEE中國
Bilibili | IEEE中國
· IEEE電氣電子工程師學會 ·
往
期
推
薦
運動傳感器測量結果差異巨大,新標準正在縮小差距
機器人會拯救我們嗎?在CES上,IEEE圓桌聚焦醫療機器人關鍵挑戰
7項正在悄悄讓世界變得更好的技術
CES期間,IEEE圓桌討論闡釋AI如何贏得我們的信任