
作者 | 趙昊
谷歌DeepMind發(fā)布了一款全新的、面向機器人的人工智能模型,聲稱可使人形機器人能夠協(xié)調(diào)全身動作。
這是谷歌將Gemini人工智能技術(shù)進一步拓展至機器人領(lǐng)域的最新舉措,旨在讓機器人具備推理能力、規(guī)劃多步驟任務(wù),并適應(yīng)人類生活環(huán)境。
新系統(tǒng)名為Gemini Robotics 2,能夠讓機器人在執(zhí)行任務(wù)時完成行走、下蹲、操控物體等動作,并結(jié)合推理能力自主完成任務(wù)。
谷歌表示,與此前主要控制機器人上半身動作的模型不同,Gemini Robotics 2可以實現(xiàn)對整個人形機器人的全身控制。
在一段預(yù)錄演示中,DeepMind的新模型操控Apptronik公司的人形機器人Apollo完成了一系列動作,包括穿過房間、拿起灑水壺并將其放到架子上,同時還能避開途中障礙物。

與此同時,DeepMind還發(fā)布了另外兩款機器人AI模型,它們既可以協(xié)同工作,也可以獨立運行。
其中,Gemini Robotics 2負責(zé)將攝像頭畫面和自然語言指令轉(zhuǎn)換為機器人電機控制指令;而Gemini Robotics ER 2則充當(dāng)機器人的“推理系統(tǒng)”,負責(zé)規(guī)劃多步驟任務(wù),并協(xié)調(diào)多個機器人共同完成同一目標。
谷歌還展示了機器人靈巧性的提升。研究人員表示,在測試中,系統(tǒng)完成“擰下燈泡”這一任務(wù)的成功率達到92%。不過,在扎垃圾袋、封好Ziplock密封袋等更加復(fù)雜的操作中,成功率仍然相對較低。

此外,谷歌還推出了一套新的機器人安全評測基準,用于測試機器人是否能夠識別不確定情況,并拒絕執(zhí)行存在安全風(fēng)險的指令。
谷歌表示,相較此前的模型,Gemini Robotics ER 2是公司迄今最安全的機器人模型,尤其在遵循指令以及避讓人類方面表現(xiàn)更佳。
谷歌表示,Gemini Robotics ER 2將通過公司的開發(fā)者平臺AI Studio開放,并在企業(yè)級AI平臺上提供私人預(yù)覽;更加專業(yè)化的Gemini Robotics 2和On-Device 2模型則將率先向早期合作伙伴及100多家受信任測試機構(gòu)開放。
公司還宣布,將向機器人開發(fā)者開放模型候補名單,并正與包括Apptronik、Agile Robots SE以及Boston Dynamics在內(nèi)的一系列核心合作伙伴展開合作。

DeepMind機器人業(yè)務(wù)副總裁Carolina Parada在介紹時表示:“我們的目標是將AI帶入物理世界,并構(gòu)建一層能夠被所有機器人使用的智能系統(tǒng)。”
但DeepMind機器人業(yè)務(wù)總監(jiān)Kanishka Rao也坦言,真正實現(xiàn)機器人媲美人類的靈巧性仍然任重道遠。目前機器人動作依然緩慢且謹慎,因為機器在執(zhí)行過程中仍需停下來思考那些人類能夠憑直覺完成的決策。
Rao強調(diào),機器人目前的學(xué)習(xí)效率仍遠低于人類。人類往往只需經(jīng)歷一兩次錯誤便能調(diào)整行為,而機器人距離這一水平仍有較大差距。
此次發(fā)布建立在谷歌于2025年推出Gemini Robotics的基礎(chǔ)上,后者是Gemini旗艦AI模型的機器人版本,能夠?qū)⒄Z言和視覺信息轉(zhuǎn)化為機器人的實際動作。
這一產(chǎn)品也標志著谷歌重新點燃了延續(xù)十余年的機器人戰(zhàn)略。Alphabet曾收購多家機器人初創(chuàng)公司,但隨后逐步縮減相關(guān)業(yè)務(wù),并于2023年關(guān)閉了Everyday Robots部門。
谷歌的競爭對手OpenAI和英偉達也在積極布局機器人AI。OpenAI一直探索融合視覺、語言和動作能力的通用機器人基礎(chǔ)模型,而英偉達則提供幫助開發(fā)者訓(xùn)練AI機器人的軟件平臺。

