近年來,隨著多模態大模型和強化學習技術的發展,具身智能技術也是日新月異,成為產學研共同關注的熱點問題。本文對具身智能的技術要點和前沿進展進行介紹。

在具身智能任務中,人工智能通過視覺傳感器、聽覺傳感器、觸覺傳感器、力覺傳感器等物理傳感器來感知環境,并根據感知到的環境來操作機器人、機器狗、機械臂等機械構件,以實現更好的環境感知,并且進行合適的操作以完成各種各樣的任務。
具身智能最大的特點是需要依賴機械實體來感知和影響環境,并且機械決策會進一步影響感知的過程。
比如,一個做家務的機器人,它需要自己在家里移動來查閱家里的物品,并且根據觀察到的內容決定下一步應該去哪里、應該干什么。這個機器人應該是一個實物,它可以是人形機器人,也可以不是人形機器人。它可以通過攝像頭對周圍環境進行拍照和觀察,也可以通過雷達測距儀來測量各物體的距離,還可以內置麥克風來接收人類指令。它可以用輪子或是機械腿來實現移動,可以用各種機械臂來完成物品吸附、抓取和放置等功能,還有各種機械機構來調整各傳感器等位置和朝向。這就是一個具身智能的典型例子。
并不是所有的人工智能都是具身智能。如果一個人工智能不依賴于物理實體,或是它的觀測并不會隨著物理實體的變化而變化,那么它就不是具身智能。比如,下圍棋的AlphaGo和聊天應用ChatGPT都是以軟件應用的形式存在,它并不需要操縱什么硬件,所以它們都不是具身智能。
具身智能需要在真實的物理世界中做決策。智能可以分為“大腦智能”和“小腦智能”兩個部分。

“大腦智能”進行任務理解和規劃決策。以家務機器人為例,家務機器人可以決定待做家務的先后次序,比如先洗碗然后擦桌子。在洗碗這個子任務中,它要決定洗碗的次序,比如要用幾次洗碗機,每次用洗碗機時洗哪幾塊碗。每次用洗碗機也有步驟:它需要先打開洗碗機的門,然后把碗放進去,然后關上門,然后啟動洗碗機,等洗碗機洗完后還要打開洗碗機的門,把碗拿出來,然后把洗碗機的門關上。這些規劃決策都屬于大腦智能。
“小腦智能”控制機械設備的物理參數。比如為了打開洗碗機的門,需要調節某個可移動設備的移動功率或某個旋轉設備的旋轉力矩,使得機械設備能將某個機械結構其附著到門把手上然后把門打開到足夠大。小腦智能的輸出往往是移動設備的移動加速度、旋轉設備的旋轉力矩、施力設備的力的方向和大小、發聲設備的聲音波形這些具體的物理量。
由于具身智能涉及到物理設備,而物理設備可能較為昂貴。所以,人們希望物理設備盡可能通用,以降低硬件的均攤成本。比如,很多文學作品中塑造了人形機器人的形象,其中的人形機器人可能有類似人類一樣的智慧,能做很多不同事情。這樣的具身智能要求大腦智能具有多任務、多模態的處理能力。
具身智能有別于一般人工知智能的最重要特點是它需要操縱物理構件,所以,和物理構件直接打交道道小腦智能是具身智能的重要技術要點。
近年多模態大模型的突破性進展極大地賦能了具身智能。GPT-4o等多模態大模型可以理解音視頻輸入,并有能力針對各種各樣的任務給出解決方案。這樣的大模型給了具身智能強大的“大腦”。在這樣的背景下,各種各樣的具身智能應用如雨后春筍般涌現出來,極大的豐富了具身智能的應用場景。
比如,人類給某個家務機器人發送語音指令:“請先洗碗,然后擦桌子”。機器人可以把采集到的音頻信息直接給大模型,然后大模型從語音中識別出任務是“洗碗”和“擦桌子”,然后大模型進一步決策:要先觀察環境得到周圍圖像信息,然后大模型根據得到的圖像信息判斷哪些是要洗的碗,等等。在這個例子中,多模態大模型聽了人類的語音、觀察了環境,理解了任務,并為任務做出了合適決策。
多模態大模型還能評估任務的完成情況。比如對于洗碗的任務,機器人可以把洗好的碗的視頻發送給大模型,讓大模型評估碗是否洗干凈,洗好的碗是否擺放妥當了。大模型甚至還能判斷做洗碗過程中用了多少水電、總成本是多少。最后,大模型還可以對任務的完成情況做個總結,給出改進建議。
目前具身智能技術主要受限于“小腦智能”,也就是對物理系統的具體操作上。為了完成現實生活中的常見任務,往往需要機械結構具有多個自由度,并且需要對這些自由度進行精細控制。
以人形機器人的機械結構為例,人形機器人往往有數十個關節,每個關節還會有多個自由度,整個機器人會有數百個自由度。當前學界并沒有能夠完全掌握這樣復雜任務的訓練。
小腦智能所解決的任務比大腦智能更少,但是目前表現卻比大腦智能要差,原因之一是因為小腦智能的任務是面向現實物理環境的,它的數據少,數據獲取成本高。每個機械結構及其所處環境還會略有不同(比如受到部件尺寸誤差、機械磨損、環境溫濕度等影響),對不同環境下的數據集還略有不同。一般情況下,數據集不足以支持高自由度的訓練,常常出現一些沒有訓練好的情況,造成任務失敗。
在小腦智能中的研究中,靈巧手和雙足是最受關注的兩個機械部件。靈巧手指的是類似于人類手的機械手,它有五個手指,每個手指有2~3個關節,一共有幾十個自由度。目前我們可以用靈巧手做一些拾取剛體這樣的任務,但是對于高精度的、觸覺力覺綜合反饋的任務(比如剃頭發、疊衣服、做外科手術等)還是有困難。至于雙足,目前已經可以進行站立、走、跑等功能,但是要兼容屈膝撿東西、單腿踢球等任務還有難度。由于目前靈巧手和雙足能完成的任務和人類的手腳相比有較大的差距,它們可以說是目前具身智能研究的要點和難點。
攻克小腦智能最主要的方法是模仿學習和強化學習。
模仿學習利用已有的成功交互記錄來進行學習。比如,人工智能可以觀察人類的示例,從這些示例中進行學習。不過,僅僅作為一個旁觀者來進行學習往往不能達到學習目的。就像一個人學游泳,如果他永遠只看別人游泳,而自己不去嘗試、去經歷成功和失敗,那么他很難學好游泳。
強化學習則是利用獎勵信號來進行學習。在強化學習的訓練過程中,人工智能試圖給出完成任務的解決方案,然后系統會給出一個獎勵信號來評價任務的完成質量。人工智能可以不斷嘗試,通過每次嘗試的獎勵信號來不斷改進,最終較好的完成任務。
不過,如果在現實世界中沒有很好的完成任務,成本往往較大。為此,具身智能往往先要在仿真器里虛擬學習,在虛擬世界里學的差不多后,才試圖把技能遷移到現實世界中。
多模態大模型可以為強化學習的學習過程賦能。強化學習需要獎勵信號來判斷任務的完成情況,而多模態大模型可以提供獎勵信號。具體而言,當人工智能明確任務后,它可以觀察周圍環境,建立仿真模型來進行強化學習訓練。在訓練過程中,它可以把仿真環境中每次完成的情況發送給多模態大模型,由大模型來判斷本次完成情況,給出獎勵信號。這樣,具身智能中實際操作物理機械設備前,已經在大模型的幫助下訓練多時了。
除了直接給出獎勵信號外,多模態大模型還能給出更多類型的反饋,比如對完成結果進行點評,給出修改意見等等。利用各種各樣的反饋信息進行學習,是強化學習的一種拓展形式。
延伸閱讀

《強化學習:原理與Python實戰》
肖智清 著
介紹強化學習、模仿學習、多模態大模型的技術要點
理論完備,涵蓋強化學習主干理論和常見算法,帶你參透PPO、RLHF等大模型訓練技術要點;
實戰性強,每章都有編程案例,深度強化學習算法提供TensorFlow和PyTorch對照實現;
配套豐富,逐章提供閱讀導引和知識點總結,章后習題形式豐富多樣。還有Gym源碼解讀、開發環境搭建指南、習題答案等在線資源助力自學。

本文來源:原創,圖片來源:原創、pexels
責任編輯:王瑩,部門領導:寧姍
發布人:白鈺