
教機器人走路難,教 AI 懂人話更難。
為了深入了解 AI 訓練與傳統(tǒng)數(shù)據(jù)中心計算有何不同,ArsTechnica 特地發(fā)表了一篇來自 AI 研究與模型開發(fā)專業(yè)人員的分析文章。
據(jù)悉,傳統(tǒng)的數(shù)據(jù)中心任務,主要涉及視頻流、電子郵件、以及社交媒體的處理。與之相比的是,AI 訓練需要耗費更多的計算量。
在投入實際應用之前,AI 模型需要汲取大量的數(shù)據(jù)、知道其學會如何理解用戶的輸入。遺憾的是,與人類的學習方式相比,這種訓練的效率實在太過低下。
現(xiàn)代 AI 需要借助人工神經(jīng)網(wǎng)絡來模擬人腦神經(jīng)元的數(shù)學運算,神經(jīng)元之間的連接強度,亦是該網(wǎng)絡的一個重要參數(shù)(權(quán)重)。
為了學習如何理解語言,網(wǎng)絡需要從隨機權(quán)重開始并進行調(diào)整,知道輸出讓人感到滿意的“正確答案”。

BERT 研究配圖(來自:PDF)
訓練語言網(wǎng)絡的一種常見方法,是從維基百科和新聞媒體等網(wǎng)站提取大量文本,遮蓋其中的部分單次,然后讓 AI 模型嘗試猜出正確的答案。
雖然一開始很容易亂成一鍋粥,但隨著投喂數(shù)據(jù)量的不斷增加、以及學習的深入,神經(jīng)網(wǎng)絡的連接權(quán)重和數(shù)據(jù)提取模式也會不斷作出調(diào)整,最終帶來準確率的逐漸提升。
以最近的某個雙向編碼器交涉(BERT)模型為例,其學習了英語書籍和維基百科的 33 億字內(nèi)容,然后通過 40 次的反復錘煉,才勉強達到了可用的水平。
作為對比,一名才五歲的人類小孩,盡管其聽取的詞量不到 BERT 的 1/3000,都不至于像 AI 模型這般需要費心費力地去教。

訓練前模型結(jié)構(gòu)的差異
顯然,與其盲目地讓機器和 AI 算法通過不斷重復學習、來學會如何像人類一樣思考,不如為語言模型選擇一個更合適的訓練架構(gòu),從而大幅削減其構(gòu)建成本。
有鑒于此,一些研究人員想到了一種更加合適的方案 —— 考慮學習期間需要動用多少個神經(jīng)元、神經(jīng)元之間有多少個連接、參數(shù)應以多快的速度發(fā)生改變等。
隨著嘗試的組合越來越多,語言網(wǎng)絡的精度提升機會也變得越來越大。相比之下,人腦并不需要費力地去尋得最佳結(jié)構(gòu),因為祖先早在進化過程中就替我們承受了這些苦難。
近年來,企業(yè)和學術界在不斷攪動 AI 領域的競爭,畢竟即使 1% 的準度提升,也會帶來相當顯著的優(yōu)勢 —— 尤其是機器翻譯等難度相對較高的任務處理上。
然而為了搶占宣傳上的制高點,研究人員可能需要對模型展開數(shù)千次的訓練、每次動用不同的結(jié)構(gòu)方案,才能找到提升哪怕 1% 的最佳實現(xiàn),即便這么做也會造成能源的大量浪費。

不同任務上的微調(diào)
通過測量訓練期間使用的通用硬件功耗,馬薩諸塞州大學阿默斯特分校的研究人員們,已經(jīng)估算出了各種 AI 語言模型的能源開銷。
結(jié)果發(fā)現(xiàn),訓練 BERT 所產(chǎn)生的碳足跡,已相當于搭乘飛機往返紐約和舊金山。如果動用不同的結(jié)構(gòu)進行檢索,總成本更是可以高達 315 名乘客 / 甚至一架波音 747 的碳足跡。
從業(yè)界發(fā)展的趨勢來看,與 BERT 類似的 GPT-2 語言模型的開銷更是有過之而無不及。其網(wǎng)絡中的權(quán)重已達 15 億,更別提精度更高的 GPT-3 了(權(quán)重 1750 億)。
Google's DeepMind AI Just Taught Itself To Walk(via)
研究人員指出,許多人已經(jīng)意識到,即便最終只有一小部分網(wǎng)絡能夠發(fā)揮最大的作用,但構(gòu)建出一套更大規(guī)模的網(wǎng)絡,還是有助于提升整體結(jié)果的準確性。
遺憾的是,與生物大腦的神經(jīng)元效率相比,計算機實在是差了太多個數(shù)量級。為了減少碳足跡,科技企業(yè)或許會轉(zhuǎn)向更綠色的能源、以及借助更加專用的 AI 模型訓練硬件。