在NVIDIA踩中AI尤其是生成式AI的風口之后,很多人說老黃這個有危機意識的人已經(jīng)在想著能否踩中下一個風口了。那么下一個風口是什么呢?過去一年多在不同活動的主題演講中,黃仁勛已經(jīng)明顯開始增加有關機器人技術的篇幅。
今年CES展的主題演講,所有人預期主角應該是GeForce RTX 50系顯卡——這的確是個主角,但沒有我們想象得那么主角。一個半小時的主題演講,大約有近一半時間是給到了機器人的。GeForce RTX 50系顯卡的發(fā)布只用了10分鐘...
黃仁勛總結自2012年AlexNet刮起當代AI旋風以后,AI相繼經(jīng)歷了“Perception AI”(感知AI)、“Generative AI”(生成式AI)、“Agentic AI”(智能體 AI),及即將全面到來的“Physical AI”時期——包括自動駕駛汽車和各類機器人。在NVIDIA看來,Physical AI是將在1000萬工廠、20萬倉庫、15億汽車和卡車及海量人形機器人之上應用的下一波萬億規(guī)模市場驅動力。

這是個還挺高度抽象時代發(fā)展的概括,尤其是將生成式AI之前的CV/ASR/NLP應用稱作Perception AI,并且提煉到現(xiàn)如今出現(xiàn)了越來越多的基于生成式AI的助手型AI智能體,爾后將AI延伸到物理世界的Physical AI——聽起來是個非常符合直覺的發(fā)展路線。
如果說當代LLM結合RAG之類的技術方法,我們給大模型一些PDF參考文件作為其回答的依據(jù),則這些PDF需要轉為token;Transformer的自注意力機制決定了每個token需要找到與其他token的相關性...基于各種對參數(shù)、輸入序列、在網(wǎng)絡每一層的處理等等,產(chǎn)出1個token;隨后該token也作為輸入序列,參與生成下一個token...
如果把此處作為上下文的PDF換成現(xiàn)實世界的周遭環(huán)境,將我們對LLM發(fā)出的提問換成具體的操縱請求,而生成的token不再是文本而是動作,那么我們就得到了一個AI機器人——即physical AI。
上面這段話是黃仁勛在CES主題演講中,談機器人話題開篇時所說。這也很好地向我們展示了,如果將住在計算機里面的生成式AI,轉為需要參與現(xiàn)實世界生產(chǎn)的機器人,究竟是怎樣的一個過程。基于此,NVIDIA這次在機器人領域也發(fā)布了好幾項還挺重磅的產(chǎn)品。這些產(chǎn)品能夠真正體現(xiàn)NVIDIA對于機器人未來發(fā)展的信心與野心。
關注NVIDIA機器人技術的讀者,對于過去1-2年內,NVIDIA反復在提機器人所需的3臺計算機應該不會陌生。其中一臺計算機用于AI模型訓練;一臺則用于構建虛擬環(huán)境,相當于在虛擬世界里面測試模型和機器人,并生成訓練所需的合成數(shù)據(jù);還有一臺就是在機器人身體里跑模型的計算機了。
對于這三臺計算機的另外一種描述方式是:一臺計算機用于訓練AI模型;一臺計算機用于部署AI,也就是機器人體內那臺;還有一臺則負責數(shù)字孿生的虛擬世界模擬,是將前兩臺計算機真正實現(xiàn)聯(lián)結的計算機——訓練得到的AI在這里進行模擬測試,且基于合成數(shù)據(jù)生成及強化學習AI反饋,讓模型和算法真正走向可用和好用。

之所以提出這套解決方案,一方面當然在于NVIDIA本身出售這三臺計算機產(chǎn)品;另一方面則在于:和智能體AI不同,機器人作為現(xiàn)實世界的實體,其試錯和測試成本相當之高,而且還存在安全問題。用NVIDIA的話來說,人類自身進化了超過600萬年才有了現(xiàn)在的能力;我們不可能指望機器人也在現(xiàn)實世界里進化這么久才實現(xiàn)充分的智能。
在NVIDIA看來,physical AI實現(xiàn)的最大挑戰(zhàn)就在數(shù)據(jù)策略上。雖然機器人基礎模型已經(jīng)基于多模態(tài)數(shù)據(jù)做了大量預訓練,但僅擁有這類通用知識“就像剛畢業(yè)的大學生”,還是需要更實用的技能才能完成對應的工作。“后訓練(post training)”就變得很重要。
基于現(xiàn)實世界的“后訓練”所需成本就非常高。在機器人這個大類中,有個相對特殊的類型就是汽車——汽車可以視作是某種特殊的機器人。車廠通常需要行駛大量路程以后,收集PB級別的數(shù)據(jù),還要進行處理、過濾、標記。到通用型機器人,如果完全由人類給予機器人操作演示數(shù)據(jù),還進行物理測試,則成本和風險都會變得不可承受;而且即便真的這么做了,不少長尾場景還覆蓋不到。
這是NVIDIA面向機器人的“3臺計算機”解決方案存在的邏輯基礎。

Rev Lebaredian(NVIDIA Omniverse與模擬技術副總裁)在媒體會上特別提到,于這3臺計算機而言,NVIDIA的主要盈利機會點其實是在AI模型訓練和虛擬世界模擬這兩臺計算機上——也就是圖中的上面兩臺計算機,而非很多人直覺上所見的機器人本身。
NVIDIA雖然沒有去談面向機器人時,這3臺計算機分別產(chǎn)生的營收構成;但在談到汽車時,提及汽車業(yè)務于NVIDIA的營收量級目前在10億美元上下——如果將3臺計算機解決方案套用到汽車身上,則預期2026財年(通常為2025自然年)云和汽車業(yè)務可共同產(chǎn)生的營收大約在50億美元左右。可見NVIDIA在這類解決方案中的營收大頭并不在機器人/汽車本體。
順著這個思路,NVIDIA要在頭兩臺計算機上創(chuàng)造更高的價值,就需要為開發(fā)者提供更便于模型訓練及機器人模擬的工具。如文首比喻智能體AI時代的PDF文檔,包括機器人在內的physical AI所需感知的周遭環(huán)境數(shù)據(jù),自然比PDF文檔復雜許多。所以機器人需要世界模型(world model)。
“世界模型需要理解世界的語言,理解物理動態(tài)——引力、摩擦力、慣性等等,理解幾何與空間關系,理解因果關系,理解物體存繼性(object permanence)。”黃仁勛在發(fā)布會上說,“所有這些符合直覺的理解,是現(xiàn)在絕大部分模型很難搞定的。”
“所以我們需要世界基礎模型。”于是就有了本屆CES上發(fā)布的Cosmos世界基礎模型——而且NVIDIA說這是全球首個世界基礎模型。實際上,應該說NVIDIA Cosmos是個世界基礎模型開發(fā)平臺,目標市場就是physical AI,同時包含了機器人和汽車。

Cosmos生成的影像
前不久的ROSCon機器人大會上,NVIDIA就向我們介紹過Cosmos tokenizer——這也是本次發(fā)布Cosmos平臺的一部分。總的來說,Cosmos平臺主要包含幾個組成部分:
Diffusion擴散模型和自回歸模型(autoregressive model),輸入文本、圖像或視頻數(shù)據(jù),生成包括虛擬世界狀態(tài)在內的視頻片段,作為訓練的合成數(shù)據(jù);
如果開發(fā)者打算用自己的模型,也可以使用其中的視頻tokenizer(圖像和視頻數(shù)據(jù)的tokenizer,也就是將視覺數(shù)據(jù)token化;可應用于圖片和視頻生成,及為開發(fā)多模態(tài)生成式AI模型整合數(shù)據(jù))——NVIDIA宣稱Cosmos tokenizer可以達成相較其他tokenizer更高8倍的壓縮率和12倍的性能;
還有對應的、實現(xiàn)了AI加速的視頻數(shù)據(jù)處理pipeline,基于CUDA加速處理海量視頻數(shù)據(jù)——NVIDIA將其稱作面向自動駕駛汽車與機器人公司構建訓練數(shù)據(jù)的game changer…
當然也支持模型的guardrail,也就是限定范圍的規(guī)范化,確保安全和可靠使用;及支持模型fine-tune,以自有數(shù)據(jù)對模型做定制;

本次發(fā)布的Diffusion和自回歸模型應當都已經(jīng)登陸Hugging Face和NVIDIA NGC;Cosmos平臺也開啟了授權。據(jù)說這些基礎模型本身經(jīng)過了2000萬小時視頻數(shù)據(jù)的訓練,包括諸多自然動態(tài)屬性,如行走、手部動作、操縱方式、快速的攝像頭視角移動等…換句話說,也就是教AI理解物理世界…
CES期間發(fā)布的不同規(guī)模的Cosmos世界基礎模型主要包括有:Cosmos Nano, Cosmos Super, Cosmos Ultra,對應于快速、主流、高精度與高質量的模型選擇。
NVIDIA對于Cosmos應當是寄予了厚望的,“我們希望Cosmos世界基礎模型之于機器人和工業(yè)AI,就相當于Llama 3之于企業(yè)AI。”或者說NVIDIA希望Cosmos在physical AI時代的價值,就相當于Llama之于智能體AI時代。
一言蔽之,Cosmos模型作為生成自動駕駛和機器人行動模型的基礎模型存在;或者Cosmos模型可以扮演teacher model的角色,提供強化訓練AI反饋,來提升和測試機器人策略。Rev介紹說已經(jīng)有合作伙伴(1X Technologies)用Cosmos來評估其自家模型,看模型在特定場景下的表現(xiàn)如何。
所以不同的企業(yè)應當是可以根據(jù)自己的需要,來選擇Cosmos平臺中的不同構成要素去輔助機器人開發(fā)的。
很自然的,延續(xù)3臺計算機解決方案思路,而且涉及到物理級世界合成數(shù)據(jù),NVIDIA把Cosmos和Omniverse放到了一起。我們知道Omniverse是NVIDIA的元宇宙,或者說符合物理世界規(guī)則的數(shù)字孿生平臺。黃仁勛形容Omniverse為“physics grounded”。這么做也算是真正把Omniverse延展到了物理世界。
“將Omniverse與Cosmos聯(lián)結,實現(xiàn)生成的可控。”如果要類比兩者的結合,可以理解為LLM + RAG,確保AI生成是基于ground truth的。Omniverse + Cosmos也邁向機器人和汽車,實現(xiàn)了符合物理世界規(guī)則、可控的數(shù)據(jù)生成。

開發(fā)者在Omniverse中構建3D世界,基于特定需求在這個虛擬空間打造真實世界場景;然后渲染圖像和視頻進入到Cosmos中,也就能生成視頻片段大型數(shù)據(jù)集,用于post training。
換句話說,基于生成不同的多物理可信場景(phsically plausible scenario),讓機器人在AI虛擬世界里嘗試各種不同的可能性。一個比較有趣的比方,是NVIDIA將Omniverse + Cosmos比作是多元宇宙模擬引擎。
因為對于汽車和機器人而言,這就是個多元宇宙、嘗試不同可能性的模擬仿真過程,“就像‘奇異博士’模擬出了各種可能性的未來”。
電影《復仇者聯(lián)盟3:無限戰(zhàn)爭》有這樣一個情節(jié),奇異博士因為手持時間寶石能夠穿梭于未來和現(xiàn)在;他基于這樣的能力,做出各種不同選擇,來事先看到未來復仇者聯(lián)盟及人類可能的不同結局走向,并返回現(xiàn)實選擇一個最優(yōu)解。

Cosmos締造的多元宇宙
實際上,仔細想一想我們所知NVIDIA的機器人及汽車解決方案,乃至擴展到所有數(shù)字孿生、Omniverse解決方案,都可以形象地比作奇異博士的這一能力。現(xiàn)在將其拿來給Cosmos做比,還是可見NVIDIA市場部門的鬼才操作的。數(shù)字孿生+AI本來就是通過模擬各種可能的方向,來最終選擇正確路徑或可行的最優(yōu)解。
目前NVIDIA公布已經(jīng)開始采用NVIDIA Cosmos的企業(yè)包括有小鵬汽車、Uber、Galbot、Fourier、Wayve、Agility Robotics等。
CES期間還有一些相關Cosmos的發(fā)布,比如已經(jīng)就Cosmos展開與某些生產(chǎn)制造企業(yè)的合作,與高校合作配套的benchmark基準測試,以及針對physical AI的兩個Blueprints(即NVIDIA官方發(fā)布的更具體的參考工作流)等。因為篇幅的原因,本文只選擇某些具代表性的稍作介紹。
傳統(tǒng)人形機器人和汽車的一大差異,還是在于人形機器人需要模仿人類的某些動作,畢竟汽車只需要解決在路上行駛的問題就夠了——從這個角度來看人形機器人的訓練和模仿數(shù)據(jù)收集獲取也更有難度。

這顆倒不是時間寶石,而是新發(fā)布面向機器人與汽車的Thor(Hyperion 9平臺)
對機器人而言,哪怕只是針對一個簡單的任務(比如把某對象撿起從一個框放進另一個框里),人類動作的演示不光要有量,還需要經(jīng)過嚴密規(guī)劃,然后藉由AI和Omniverse來進行合成數(shù)據(jù)的量級擴增。基于這樣的邏輯,NVIDIA發(fā)布了名為Isaac GR00T的合成動作生成(synthetic motion generation)參考流程。
Isaac GR00T面向人形機器人開發(fā)者提供了4個核心組件:機器人基礎模型、合成動作與數(shù)據(jù)生成pipeline、模擬框架(Isaac Lab & Isaac Sim)、Thor(也就是第3臺計算機,本次新發(fā)布的Thor Blackwell機器人處理器)。在開發(fā)者不需要太多的人類動作演示的情況下,就生成大型數(shù)據(jù)集,其流程如下圖所示。

首先借助GR00T-Teleop,用Apple Vision Pro頭顯將演示者(比如操作人員)的動作演示記錄并轉為機器人可參考的數(shù)字孿生,在不需要機器人的情況下也能抓取數(shù)據(jù)。通過一系列的操作演示,抓取動作軌跡,GR00T-Mimic會將這些動作軌跡擴增為更大型的數(shù)據(jù)集。
隨后基于Omniverse + Cosmos的GR00T-Gen實現(xiàn)指數(shù)級的數(shù)據(jù)集擴增,在前述“多元宇宙模擬引擎”的加持下訓練機器人策略。訓練完成后,開發(fā)者就可以在Isaac Sim中進行SIL軟件在環(huán)測試和驗證,最終部署到機器人身上。已經(jīng)有包括1X, Fourier, Galbots等在內的企業(yè)開始采用這套流程。
除了Isaac GR00T之外,NVIDIA這次還發(fā)布了針對機器人集群模擬的Mega參考工作流,已經(jīng)有包括Kion, Accenture等在內的供應鏈解決方案或服務企業(yè)開始采用等,此處不再做列舉。不過很顯然,無論是所謂50萬億市場價值的工業(yè)制造,還是10萬億規(guī)模的倉儲與分發(fā)服務市場,NVIDIA都準備以機器人為出發(fā)點,從中分一杯羹。
而且如果將汽車也視作機器人的一部分,本文甚至還未對NVIDIA在汽車市場的發(fā)展狀況做介紹(尤其和豐田的合作、DRIVE OS通過最高ASIL-D功能安全認證等)…

不過到這里,我們也會發(fā)現(xiàn)一個有趣的事實:以相對低成本訓練機器人所需的軟硬件,都是在這個時代剛剛準備就緒的,比如像Apple Vision Pro這樣的數(shù)字與現(xiàn)實世界入口,以及承載合成數(shù)據(jù)生成、模型訓練與調優(yōu)的硬件,乃至部署到機器人身上的芯片或計算機載體。
在機器人的3臺計算機和周邊生態(tài)、開發(fā)工具相繼準備就緒的情況下,黃仁勛自然從去年開始反復強調通用機器人的ChatGPT時刻已經(jīng)到來。“所有我今天談論的技術都將在未來數(shù)年內成為可能,在通用機器人領域看到快速和令人驚嘆的突破。”
這也踐行了在AI高速發(fā)展時代,萬物皆可生成的預言——去年GTC上黃仁勛就提出的萬物皆可token化,萬物皆可生成。“應用是無止盡的。實際上針對我們所見的幾乎任意AI應用,問出這樣3個基本問題:習得的輸入模態(tài)(modality)是什么,轉化以后的信息模態(tài)是什么,生成的信息模態(tài)是什么?也就關乎于每個應用都能推理。”
“當我們看到各種AI驅動、AI原生的應用,其基本概念也就是如此。”“機器學習變革了每個應用構建的方式,改變了計算實現(xiàn)的方法,衍伸了各種可能性。”而機器人顯然是諸多AI應用中的一個,也是NVIDIA眼中的下一個大趨勢或市場價值重心。

