
作者 | 趙昊
谷歌DeepMind發布了一款全新的、面向機器人的人工智能模型,聲稱可使人形機器人能夠協調全身動作。
這是谷歌將Gemini人工智能技術進一步拓展至機器人領域的最新舉措,旨在讓機器人具備推理能力、規劃多步驟任務,并適應人類生活環境。
新系統名為Gemini Robotics 2,能夠讓機器人在執行任務時完成行走、下蹲、操控物體等動作,并結合推理能力自主完成任務。
谷歌表示,與此前主要控制機器人上半身動作的模型不同,Gemini Robotics 2可以實現對整個人形機器人的全身控制。
在一段預錄演示中,DeepMind的新模型操控Apptronik公司的人形機器人Apollo完成了一系列動作,包括穿過房間、拿起灑水壺并將其放到架子上,同時還能避開途中障礙物。

與此同時,DeepMind還發布了另外兩款機器人AI模型,它們既可以協同工作,也可以獨立運行。
其中,Gemini Robotics 2負責將攝像頭畫面和自然語言指令轉換為機器人電機控制指令;而Gemini Robotics ER 2則充當機器人的“推理系統”,負責規劃多步驟任務,并協調多個機器人共同完成同一目標。
谷歌還展示了機器人靈巧性的提升。研究人員表示,在測試中,系統完成“擰下燈泡”這一任務的成功率達到92%。不過,在扎垃圾袋、封好Ziplock密封袋等更加復雜的操作中,成功率仍然相對較低。

此外,谷歌還推出了一套新的機器人安全評測基準,用于測試機器人是否能夠識別不確定情況,并拒絕執行存在安全風險的指令。
谷歌表示,相較此前的模型,Gemini Robotics ER 2是公司迄今最安全的機器人模型,尤其在遵循指令以及避讓人類方面表現更佳。
谷歌表示,Gemini Robotics ER 2將通過公司的開發者平臺AI Studio開放,并在企業級AI平臺上提供私人預覽;更加專業化的Gemini Robotics 2和On-Device 2模型則將率先向早期合作伙伴及100多家受信任測試機構開放。
公司還宣布,將向機器人開發者開放模型候補名單,并正與包括Apptronik、Agile Robots SE以及Boston Dynamics在內的一系列核心合作伙伴展開合作。

DeepMind機器人業務副總裁Carolina Parada在介紹時表示:“我們的目標是將AI帶入物理世界,并構建一層能夠被所有機器人使用的智能系統。”
但DeepMind機器人業務總監Kanishka Rao也坦言,真正實現機器人媲美人類的靈巧性仍然任重道遠。目前機器人動作依然緩慢且謹慎,因為機器在執行過程中仍需停下來思考那些人類能夠憑直覺完成的決策。
Rao強調,機器人目前的學習效率仍遠低于人類。人類往往只需經歷一兩次錯誤便能調整行為,而機器人距離這一水平仍有較大差距。
此次發布建立在谷歌于2025年推出Gemini Robotics的基礎上,后者是Gemini旗艦AI模型的機器人版本,能夠將語言和視覺信息轉化為機器人的實際動作。
這一產品也標志著谷歌重新點燃了延續十余年的機器人戰略。Alphabet曾收購多家機器人初創公司,但隨后逐步縮減相關業務,并于2023年關閉了Everyday Robots部門。
谷歌的競爭對手OpenAI和英偉達也在積極布局機器人AI。OpenAI一直探索融合視覺、語言和動作能力的通用機器人基礎模型,而英偉達則提供幫助開發者訓練AI機器人的軟件平臺。

