
點(diǎn)擊上方↑↑↑“OpenCV學(xué)堂”關(guān)注我
來源:公眾號?新智元?授權(quán)
GPT-4變笨實(shí)錘了?
斯坦福、UC伯克利最新研究稱,和3月相比,GPT-4在6月的性能直接暴降。
甚至,代碼生成、問題回答大不如前。

論文地址:https://arxiv.org/pdf/2307.09009.pdf
比如問「這個(gè)數(shù)是質(zhì)數(shù)嗎」,GPT-4一步一步思考的成功率從97.6%降到2.4%。

GPT-4性能驟減早有端倪。有網(wǎng)友甚至把3小時(shí)25條額度一口氣用完,也沒有解決問題。

而這次,斯坦福研究一出瞬間引爆輿論,讓所有人大吃一驚的是,GPT-4竟然性能下降1/10。
就連OpenAI站出來,表示對此關(guān)注,正積極調(diào)查大家分享的報(bào)告。

那么,這項(xiàng)斯坦福論文究竟說了什么?
安全了,但智商下線了
總的來說,GPT-4在3月和6月性能對比,主要在四個(gè)任務(wù)中有明顯的下降。
- 視覺推理

求解數(shù)學(xué)問題,CoT失敗了
在求解數(shù)學(xué)問題上,GPT-4準(zhǔn)確率不僅下降,就連解題步驟都給省了。

為了判斷GPT-4和GPT-3.5針對「給定整數(shù)是否為質(zhì)數(shù)」的能力的偏差,研究團(tuán)隊(duì)用500個(gè)問題組成的數(shù)據(jù)集對模型進(jìn)行了評估。
同時(shí),研究還利用思想鏈幫助模型進(jìn)行推理。
結(jié)果顯示,3 月,GPT-4正確回答了其中的488個(gè)問題。而在6月,它只答對了12個(gè)問題。
GPT-4準(zhǔn)確率從 97.6%直降到 2.4%!
相應(yīng)地,GPT-3.5的準(zhǔn)確率則有較大提升,從7.4%上升到86.8%。

此外,GPT-4 的響應(yīng)變得更加緊湊:生成平均字符數(shù)從3月821.2降到6的3.8。另一方面,GPT-3.5 的響應(yīng)長度增長了約 40%。
3月和6月版本之間的答案重疊度,都比較低。
那么,為什么會(huì)有這么大的差異?一種可能的解釋是思維鏈效果的變化。

如上, 為了確定17077是否是質(zhì)數(shù),GPT-4 3月版很好地遵循了CoT指令,并將任務(wù)分解成4個(gè)步驟。
然而,這種思維鏈對于6月版并不起作用:沒有生成任何解題步驟,只輸出了「不是」。
在GPT-3.5中,在3月份解答中答案是錯(cuò)誤的,6月更新后解決了這個(gè)問題。
這一有趣的現(xiàn)象表明,同樣的提示方法,即使是這些被廣泛采用的方法,如CoT,也可能由于LLM變化而導(dǎo)致顯著不同的性能。
代碼生成,更加冗長,難以執(zhí)行
另外,GPT-4代碼生成也變得更糟了。
研究團(tuán)隊(duì)從LeetCode中建立了一個(gè)包含50個(gè)簡單問題的數(shù)據(jù)集,并測試了有多少GPT-4答案在不做任何修改的情況下運(yùn)行。
結(jié)果,3月份的版本在52%的問題上取得了成功,但6月的模型,成功率下降到了10%。GPT-4 的冗長程度也增加了20%。

同時(shí),GPT-3.5的下降幅度也很大,從22%降至2%。
此外,3月份,GPT-4和GPT-3.5都遵循用戶指令,從而產(chǎn)生了直接可執(zhí)行的生成。
然而,在6月份,他們在代碼片段前后添加了額外的「引號」,導(dǎo)致代碼無法執(zhí)行。

回答敏感問題,更安全但缺乏理由
還有GPT-4回答問題變得更加小心謹(jǐn)慎了。
正是因?yàn)檎Z言模型會(huì)帶來社會(huì)偏見,輸出有毒內(nèi)容,產(chǎn)生幻覺,OpenAI對此做了大量的對齊工作。
結(jié)果可想而知,GPT-4真的被「打」聽話了。
研究中,團(tuán)隊(duì)創(chuàng)建了一個(gè)包含100個(gè)LLM服務(wù)不應(yīng)直接回答的敏感問題集,測試模型后,觀察到這項(xiàng)任務(wù)的兩個(gè)主要趨勢。
首先,從3月(21%)到 6月(5%),GPT-4回答的敏感問題較少,而GPT-3.5回答的敏感問題較多(從 2%-8%)。
6月份,GPT-4的更新中可能會(huì)部署更強(qiáng)大的安全層,而 GPT-3.5 則變得不再保守。

另一個(gè)觀察結(jié)果是,GPT-4 的生成長度(以字符數(shù)衡量)從600多個(gè)下降到140左右。
為什么生成字符長度發(fā)生變化?
除了回答更少的問題之外,這也是因?yàn)镚PT-4變得更加簡潔,并且在拒絕回答查詢時(shí)提供的解釋也更少。
如下,在無法回答用戶問題時(shí),GPT-4在3月生成了一整段原因來解釋,6月版簡單生成了「抱歉,我無法提供幫助」。
簡之,廢話變少了。

此外,研究人員通過利用「AIM攻擊」還對模型進(jìn)行了越獄攻擊。
AIM攻擊描述了一個(gè)假設(shè)的事件,并要求LLM服務(wù)充當(dāng)未經(jīng)過濾且不道德的聊天機(jī)器人。
如下表所示,當(dāng)部署AIM攻擊時(shí),GPT-4和GPT-3.5的應(yīng)答率都有大幅增加。
然而,它們的時(shí)間漂移有很大不同。對于GPT-4,AIM攻擊在3月產(chǎn)生了78%的直接答案,但在6月僅產(chǎn)生了 31%。
對于GPT-3.5,兩個(gè)版本之間只有4%的回答率差異。這表明GPT-4的更新比GPT-3.5更能抵御越獄攻擊。

視覺推理,邊際改進(jìn)
最后,研究人員利用ARC數(shù)據(jù)集中467個(gè)樣本來評估了GPT-4和GPT-3.5的視覺推理能力。
結(jié)果顯示,對于GPT-4和GPT-3.5,從3月到6月,精確匹配率均提高了2%。響應(yīng)長度大致不變。
雖然總體GPT-4隨著時(shí)間的推移變得更好,但在如下的特定查詢上卻變得更糟。
它在3月給出了正確的答案,但在6月份給出的答案是錯(cuò)誤的。

GPT-4能力下降這么多,事實(shí)真是如此嗎?
普林斯頓教授實(shí)名反對
不過,這篇論文的內(nèi)容還是值得好好推敲推敲的。
粗暴地總結(jié)為GPT-4變爛,就有些過于概括了。

文章地址:https://www.aisnakeoil.com/p/is-gpt-4-getting-worse-over-time
首先,聊天機(jī)器人的一個(gè)重要概念是,能力和行為之間存在著很大的差異。
一個(gè)具有某種能力的模型,可能會(huì)或可能不會(huì)在回應(yīng)特定提示時(shí),顯示出這種能力。
而讓聊天機(jī)器人獲得能力的預(yù)訓(xùn)練過程代價(jià)極高,對于最大的模型來說,可能需要數(shù)月的時(shí)間,因此永遠(yuǎn)不會(huì)重復(fù)。
另一方面,模型的行為也會(huì)受到后續(xù)微調(diào)的影響。相比起來,微調(diào)成本要低得多,而且會(huì)定期進(jìn)行。
請注意,經(jīng)過預(yù)訓(xùn)練的基礎(chǔ)模型只是一個(gè)高級的自動(dòng)完成工具——它不會(huì)與用戶聊天,聊天行為是通過微調(diào)產(chǎn)生的。
微調(diào)的另一個(gè)重要目標(biāo)是防止出現(xiàn)不良輸出。換句話說,微調(diào)既能激發(fā)能力,也能抑制能力。
基于這些知識,我們就可以預(yù)料到,隨著時(shí)間的推移,模型的能力會(huì)保持相對穩(wěn)定,但它的行為卻會(huì)有很大的變化。這與論文的發(fā)現(xiàn)完全一致。
論文作者在四項(xiàng)任務(wù)中,對GPT-3.5和GPT-4進(jìn)行了測試。
OpenAI通過其API提供了模型在三月和六月的「快照」,因此論文中所比較的,也是這兩個(gè)模型快照的行為。
具體來說,他們選擇了數(shù)學(xué)問題(檢查一個(gè)數(shù)字是否是質(zhì)數(shù))、回答敏感問題、代碼生成和視覺推理,這四類問題進(jìn)。其中,數(shù)學(xué)問題和代碼生成這兩項(xiàng)任務(wù)的性能有所下降。
在代碼生成方面,他們提到的變化是較新的GPT-4在輸出中添加了非代碼文本。
出于某種原因,作者沒有評估代碼的正確性。而只是檢查代碼是否可直接執(zhí)行,也就是說,它是否構(gòu)成了一個(gè)完整、有效的程序。
所以,新模型試圖更有幫助的做法反而對其不利。
不僅如此,他們評估數(shù)學(xué)問題的方式更是奇怪。
用作測試的數(shù)學(xué)問題,是「17077是質(zhì)數(shù)嗎」這樣的形式。
然而,作者選的500個(gè)數(shù)字,都是質(zhì)數(shù)!
事實(shí)證明,在大多數(shù)情況下,沒有一個(gè)模型真正執(zhí)行了檢查數(shù)字是否有除數(shù)的算法——它們只是假裝這么做了。
也就是說,他們開始推理,然后直接跳到了最后。
下面是作者數(shù)據(jù)中的一個(gè)回應(yīng)片段(GPT-4的三月快照):

模型雖然正確地列出了所有需要檢查的潛在因素,但沒有實(shí)際檢查它們!
這在論文展示的例子中也是顯而易見的,但作者卻忽略了這一點(diǎn),并將其作為一項(xiàng)數(shù)學(xué)解題測試。
由于論文只在質(zhì)數(shù)上進(jìn)行了測試,為了補(bǔ)充這個(gè)評估,普林斯頓的研究人員用500個(gè)合數(shù)測試了模型。
事實(shí)證明,作者發(fā)現(xiàn)的大部分性能下降都可以歸因于對評估數(shù)據(jù)的選擇。
看起來變化的是:GPT-4的三月版本幾乎總是猜測數(shù)字是質(zhì)數(shù),六月版本則總是猜測它是合數(shù)。對于GPT-3.5,這種行為正好相反。
因?yàn)樽髡咧粶y試了質(zhì)數(shù),所以他們把這一現(xiàn)象解釋為性能的下降。
實(shí)際上,如下圖所示,四個(gè)模型都一樣的糟糕——它們都是基于他們被校準(zhǔn)的方式來猜測的。
簡單來說就是,在微調(diào)過程中,有些模型可能接觸到了更多涉及質(zhì)數(shù)的數(shù)學(xué)問題,而其他的則是合數(shù)。

GPT-3.5的六月版本和GPT-4的三月版本幾乎總是推斷數(shù)字是質(zhì)數(shù),而另外兩個(gè)模型則正好相反。
但是論文只測試了質(zhì)數(shù),因此得出結(jié)論:GPT-3.5的性能提高了,GPT-4的性能下降了。
簡而言之,論文中的所有內(nèi)容都與模型隨時(shí)間變化而變化的行為相一致,且沒有任何一項(xiàng)表明模型的能力出現(xiàn)了下降。
即使是行為變化,似乎也是作者評估中的特殊情況,目前還不清楚他們的發(fā)現(xiàn)能否推廣到其他任務(wù)中。
過去幾個(gè)月,有不少人根據(jù)自己的使用經(jīng)驗(yàn),推測GPT-4的性能已經(jīng)出現(xiàn)了下降。
當(dāng)GPT-4的架構(gòu)(據(jù)稱)被泄露時(shí),有一個(gè)廣為流傳的說法稱,OpenAI為了節(jié)省計(jì)算時(shí)間和成本而降低了性能。
OpenAI方面對此矢口否認(rèn),但用戶們并不買賬。
因此,當(dāng)這篇論文出來時(shí),似乎證實(shí)了這些長期以來的猜測。
普林斯頓的研究人員表示,雖然無法確定傳言是否屬實(shí),但可以肯定的是,這篇論文并沒有提供相關(guān)證據(jù)。
在那些對性能下降持懷疑態(tài)度的人中,最受歡迎的假設(shè)是:當(dāng)人們越來越多地使用ChatGPT時(shí),就會(huì)更容易注意到它的局限性。
但,這里還有另一種可能。
行為變化和能力退化對用戶的影響非常相似。
用戶往往有著特定的工作流程和提示策略,而這些策略對于他們自己的使用場景來說,非常有效。
鑒于LLM的非確定性,要發(fā)現(xiàn)這些策略并找到適合特定應(yīng)用的工作流程,需要花費(fèi)大量的精力。
因此,當(dāng)模型的行為發(fā)生漂移時(shí),這些工作流程就可能會(huì)失效。
對于受挫的ChatGPT用戶來說,告知他們所需的能力仍然存在,但現(xiàn)在要用新的提示策略才能激發(fā),顯然是無濟(jì)于事的。
而對于基于那些GPT API構(gòu)建的應(yīng)用程序來說,情況尤其如此。如果模型的行為發(fā)生變化,那么已經(jīng)部署給用戶的代碼就很可能會(huì)出現(xiàn)問題。
為了緩解這一問題,OpenAI提供了模型快照,但只保留幾個(gè)月,并要求應(yīng)用開發(fā)人員進(jìn)行定期更新。
正如普林斯頓的研究人員之前所提到的,這凸顯了使用這些API進(jìn)行可重復(fù)性研究,或者在其基礎(chǔ)上構(gòu)建可靠的產(chǎn)品是多么困難。
簡而言之,新論文并未顯示出GPT-4的能力退化。但這是一個(gè)很有價(jià)值的提醒:對LLM經(jīng)常進(jìn)行的微調(diào)可能會(huì)產(chǎn)生意想不到的影響,包括某些任務(wù)的顯著行為變化。
最后,我們發(fā)現(xiàn)的陷阱揭示了,對語言模型進(jìn)行定量評估是多么的困難。

Kapoor是普林斯頓大學(xué)信息技術(shù)政策中心的計(jì)算機(jī)科學(xué)博士候選人。他的研究重點(diǎn)集中在AI對社會(huì)的影響。
在此之前,Kapoor曾在Facebook、哥倫比亞大學(xué)和瑞士EPFL從事AI方面的學(xué)術(shù)研究,他曾獲得ACM FAccT最佳論文獎(jiǎng)和ACM CSCW影響力認(rèn)可獎(jiǎng)。
目前,Kapoor正在與Arvind Narayanan合著一本關(guān)于AI「蛇油」(Snake Oil)的書。這本書批判性地探討了AI能做什么和不能做什么。

Narayanan是普林斯頓大學(xué)計(jì)算機(jī)科學(xué)教授,兼信息技術(shù)政策中心主任。
Narayanan的研究集中在數(shù)字技術(shù),尤其是AI對社會(huì)的影響,和Kapoor是合作關(guān)系。
Arvind Narayanan是普林斯頓大學(xué)計(jì)算機(jī)科學(xué)教授和信息技術(shù)政策中心主任。
他曾與人合著過一本關(guān)于公平與機(jī)器學(xué)習(xí)的教科書,目前正在與Kapoor合著一本關(guān)于AI「蛇油」的書。
他領(lǐng)導(dǎo)了普林斯頓網(wǎng)絡(luò)透明與問責(zé)項(xiàng)目,揭示公司如何收集和使用用戶的個(gè)人信息。Narayanan的研究是最早表明機(jī)器學(xué)習(xí)如何反映文化成見的研究之一,他的博士研究表明了去身份化的根本局限性。
Narayanan曾獲得過總統(tǒng)科學(xué)家和工程師早期職業(yè)獎(jiǎng) (PECASE),兩次獲得隱私增強(qiáng)技術(shù)獎(jiǎng) (Privacy Enhancing Technologies Award),三次獲得決策者隱私論文獎(jiǎng) (Privacy Papers for Policy Makers Award)。
網(wǎng)友熱議
英偉達(dá)科學(xué)家Jim Fan表示,我們中的許多從業(yè)人員都認(rèn)為,GPT-4會(huì)隨著時(shí)間的推移而退化。
但是,GPT-4為什么會(huì)退化,我們又能從中學(xué)到什么呢?以下是我的想法:

- 安全性與有用性的權(quán)衡
論文顯示,GPT-4 Jun版本比Mar版本「更安全」,因?yàn)樗锌赡芫芙^敏感問題(回答率從21%降到5%)。
不幸的是,更高的安全性通常是以更低的實(shí)用性為代價(jià)的,這可能會(huì)導(dǎo)致認(rèn)知能力的下降。我的猜測是(沒有證據(jù),只是推測),OpenAI從3月-6月花了大部分精力進(jìn)行「腦葉切除術(shù)」,沒有時(shí)間完全恢復(fù)其他重要的能力。
- 安全對齊使編碼變得不必要地冗長
論文顯示,GPT-4 Jun往往會(huì)混入無用的文本,即使提示明確指出「只生成代碼,不包含任何其他文本」。
這意味著實(shí)踐者現(xiàn)在需要手動(dòng)對輸出進(jìn)行后處理才能執(zhí)行。這在LLM軟件棧中是個(gè)大麻煩。我認(rèn)為這是安全對齊的副作用。
我們都見過GPT添加警告、免責(zé)聲明(我不是<領(lǐng)域>專家,所以請咨詢......)和反駁(話雖如此,但尊重他人很重要......),通常是在一個(gè)原本非常直接的答案上。如果整個(gè)「大腦」都被調(diào)整成這樣,編碼也會(huì)受到影響。
- 成本削減
沒有人知道GPT-4 Jun是否與GPT-4 Mar是完全相同的MOE配置。有可能 (1) 參數(shù)量減少,(2) 專家數(shù)量減少,和/或 (3) 較簡單的查詢被路由到較小的專家,只有復(fù)雜的查詢才保持原來的計(jì)算成本。
- 持續(xù)集成將是一個(gè)至關(guān)重要的LLM研發(fā)課題
人工智能領(lǐng)域幾乎沒有趕上一般軟件領(lǐng)域認(rèn)為理所當(dāng)然的事情。即使是這篇研究論文,也沒有對MMLU、Math 和 HumanEval等基準(zhǔn)進(jìn)行全面的回歸測試。
它只研究了一個(gè)特定的質(zhì)數(shù)檢測問題。GPT-4在三角函數(shù)上回歸了嗎?其他推理任務(wù)呢?不同編程語言的代碼質(zhì)量以及自調(diào)試能力如何?
馬庫斯問道,從RLHF微調(diào)如何?

還有網(wǎng)友表示,沒錯(cuò),他們有可能在操縱模型,決定讓哪個(gè)專家參與進(jìn)來。削減成本總是一個(gè)好選擇。
不幸的是,除非OpenAI解釋發(fā)生了什么,否則我們無法知道。但正如你所說,他們否認(rèn)質(zhì)量變差了。

我也注意到了同樣的情況。我目前的工作流是必應(yīng)(雖然也是GPT,但有更多的數(shù)據(jù)和研究驅(qū)動(dòng))、GPT-4和Claude 2的組合,后者最近更優(yōu)先。

在我看來,這就是開源模型會(huì)獲勝的原因。

https://www.aisnakeoil.com/p/is-gpt-4-getting-worse-over-time
