電子工程專輯在昨日剛剛介紹了《谷歌發布多模態大模型Gemini》,這是谷歌自稱強于OpenAI技術的目前最強大的AI,然而據彭博社報道稱,Google在關于"雙子座"的性能視頻演示中作假了。
視頻來源:Google Gemini AI演示
這段六分鐘的視頻展示了 Gemini 的多模態功能(例如,口語對話提示與圖像識別相結合)。雙子座似乎能快速識別圖像(甚至是連線圖片),在幾秒鐘內做出反應,并實時跟蹤杯球游戲中的紙團。當然,人類可以做到所有這些,但這是一個能夠識別并預測接下來會發生什么的人工智能。
彭博社專欄作家帕米-奧爾森(Parmy Olson)說,Google的"What the AI quack"視頻中,Gemini 看起來能力非凡,也許能力太強了。
不過,視頻描述中,Google有一個重要的免責聲明:"為了演示的目的,延遲已經減少,雙子座的輸出已經縮短,以求簡潔"。
這正是奧爾森不滿意的地方。根據她在彭博社發表的文章,Google在被要求發表評論時承認,視頻演示并不是通過語音提示實時進行的,而是使用了原始鏡頭中的靜止圖像幀,然后寫出文字提示,讓雙子座做出回應。奧爾森寫道:"這與Google似乎在暗示的內容大相徑庭:人可以與雙子座進行流暢的語音對話,同時雙子座會實時觀察并回應周圍的世界。公平地說,Google公司經常編輯演示視頻,尤其是許多公司希望避免現場演示帶來的任何技術故障。稍作調整是常有的事。但是,Google在視頻演示方面一直存在問題。人們曾懷疑Google的 Duplex 演示(還記得 Duplex 嗎?Duplex 是一款人工智能語音助手,可以打電話給發廊和餐館預訂房間。而預先錄制的人工智能模型視頻往往會讓人更加懷疑。"
在這種情況下,奧爾森認為Google是在"作秀",目的是誤導人們,讓他們不知道 Gemini 仍然落后于 OpenAI 的 GPT。
不過Google對此并不認同。當被問及演示的真實性時,Google指出了Google DeepMind 研究副總裁兼深度學習負責人 Oriol Vinyals(也是 Gemini 的聯合負責人)的一篇文章,其中解釋了團隊是如何制作視頻的。
Vinyals 說:"視頻中的所有用戶提示和輸出都是真實的,為了簡潔起見進行了縮短。視頻展示了使用 Gemini 構建的多模式用戶體驗。我們制作它是為了激勵開發人員。"
他補充說,團隊給雙子座提供了圖片和文本,并要求它預測接下來會發生什么。
其他質疑
1、MMLU測試中,Gemini結果下面灰色小字標稱CoT@32,展開來代表使用了思維鏈提示技巧、嘗試了32次選最好結果。而作為對比的GPT-4,卻是無提示詞技巧、只嘗試5次,這個標準下Gemini Ultra其實并不如GPT-4。
2、對于那段精彩視頻,也有人從開篇的文字免責聲明中發現了問題。機器學習講師Santiago Valdarrama認為聲明可能暗示了展示的是精心挑選的好結果,而且不是實時錄制而是剪輯的。后來谷歌在一篇博客文章中解釋了多模態交互過程,幾乎承認了使用靜態圖片和多段提示詞拼湊,才能達成這樣的效果。
Gemini vs ChatGPT,誰是真正的強者?
雖然ChatGPT所用的大語言模型來自谷歌實驗室,相當于對于AI來說,谷歌是最早投入,在模型方面,他是鼻祖。然而,AI的成熟度除了模型之外,還需要算力和時間。算力方面,相信谷歌不會輸給OpenAI,但是時間方面,OpenAI已經從最初的ChatGPT3.0進化到了4.0,這其中成長了一年的時間,對于快速進化的AI來說,一年是非常非常重要的,而Gemini AI還是剛剛發布。
同時,目前Gemini Pro版本,還只能對標GPT-3.5,對標GPT-4的大杯Gemini Ultra,要明年才出。
此外,Gemini僅支持英文,中文和其他語言也需要明年了。
然而,更多人關心的是,Gemini AI是否一直免費?能否拋棄ChatGPT Plus每月20美元的賬單?
這就引發另一個問題,谷歌能否創立一種新的AI商業模式,但是,目前來說,由于AI需要大量的算力投入,成本非常巨大,除非在性能上有了數個數量級的突破,否則人工智能技術依然沒法像互聯網一樣采用免費模式。