英偉達在2026年8月11日正式發布了Nemotron 3.5 Lightning,這是一款面向長時運行智能體工作負載的開源模型,也是該公司在開源AI領域最新且最具針對性的產品。
Nemotron 3.5 Lightning的核心定位非常明確——它不是用來與GPT-5.6或Claude Opus 4.8爭奪通用推理王座的,而是為了解決一個更實際的問題:在長時運行的智能體系統中,絕大多數計算資源都消耗在工具調用、結果驗證和子任務委派這類高頻執行環節上,如果每一步都調用前沿大模型,成本和延遲都會迅速失控。
這款模型采用了混合專家架構,總參數量為300億,但每輪推理僅激活約30億參數。這種設計使其在帶寬受限的設備上也能保持極高的解碼速度。它專為代碼審查、工具調用、安全警報監控和賬單問答等專項任務構建,能夠在多智能體系統中承擔高容量的執行工作。
在性能表現上,Nemotron 3.5 Lightning的輸出速度比同類模型快約4倍,智能體任務完成速度提升30%。在衡量智能體實際工作效率的PinchBench基準測試中,它達到了86%的準確率,同時在完成10000個任務的速度上比同等準確率的Qwen3.6 35B快了約30%。在Artificial Analysis Intelligence Index這一綜合九項評估的指標中,該模型也處于準確率與速度的帕累托前沿(Pareto frontier)。

該模型完全開源,企業可自由下載、使用、修改,無需獲得許可或向英偉達付費。權重、訓練數據和配方均在OpenMDW-1.1許可下發布,支持商業使用。企業可以通過LoRA或全量微調進行領域適配,也可以使用NeMo RL和NeMo Gym進行強化學習后訓練。英偉達還發布了一個名為Nemotron-RL Agentic Terminal Pivot的強化學習數據集,專門用于提升編碼智能體能力。
在部署層面,它支持從NVIDIA Jetson、GeForce RTX 5090到DGX Spark的本地運行,同時也兼容Ollama、llama.cpp、LM Studio等主流工具鏈。模型內置了多token預測能力以支持推測解碼,并同步提供了DFlash和DSpark兩個草稿模型,其中DSpark針對DGX Spark本地部署和低并發數據中心場景進行了優化。
與模型同步發布的還有NeMo Switchyard,這是一個開源的智能路由庫。它的作用是在多模型系統中自動將每個請求分配給最適合的模型——復雜規劃任務交給前沿大模型,高頻執行工作交給Nemotron 3.5 Lightning。英偉達內部基準測試顯示,這種路由策略可以將任務完成成本降至單獨使用Opus 4.8的約三分之一。

LangChain在實際測試中將145個多輪深度智能體任務的成本降低了74%,僅將7%的調用路由至前沿模型,準確率折讓約為6%。Ramp使用該工具后在SWE-Bench中匹配了前沿模型性能,同時成本降低58%、運行時間降低33%。Cognition將Switchyard集成至Devin Desktop后,在FrontierCode Main上實現了接近前沿的性能,平均成本相對單一前沿模型降低28%。
Nemotron 4:又一個萬億參數模型
在Nemotron 3.5 Lightning發布的同一時間,關于下一代Nemotron 4的消息也開始浮出水面。據外媒報道,Nemotron 4的最大版本將擁有至少1萬億參數,這一目標直接對標全球頂級開源模型。該模型由Nemotron Coalition聯合開發,目前最終訓練尚未完成,最早可能在今年深秋發布,但英偉達尚未設定確定的發布日期,也未確認相關細節。
從參數規模來看,Nemotron 4與Nemotron 3.5 Lightning之間存在數量級的差距。前者是萬億級參數的前沿通用模型,旨在與全球最強的開源模型競爭;后者是300億總參數級的專用執行模型,專注于在智能體工作流中處理高容量、低延遲的任務。兩者在Nemotron家族中的分工也反映了英偉達的整體產品思路:前沿大型號負責復雜推理和編排,Nemotron 3.5 Lightning負責高頻執行,而未來的Nemotron 4則有望在通用智能層面與閉源巨頭正面交鋒。
英偉達生成式AI副總裁Kari Briski在聲明中表示,公司投資Nemotron是因為相信每家公司和每個國家都需要可獲取的前沿開放模型,以加強安全與保障、加速創新,并提供一個可以代代相傳的基礎。這一表態與黃仁勛近期在美國的游說行動形成了呼應。
“免費AI有利于芯片”
英偉達之所以大力投入開源模型,其底層商業邏輯在黃仁勛接受Axios采訪時被一語道破:“免費AI應該有利于硬件,免費AI應該有利于芯片,免費AI應該有利于數據中心。”

(Axios采訪黃仁勛報道標題)
這句話揭示了一個關鍵事實:開源模型本身可以免費獲取,但運行這些模型所需的算力必須付費購買,而英偉達正是全球最大的算力供應商。對英偉達而言,開源AI是芯片銷售的助推器,因為模型終究需要運行在GPU上,而更低的使用價格能夠刺激用量,超過OpenAI和Anthropic等專有模型。
與此同時,英偉達正在積極游說美國政府支持開放模型。黃仁勛在7月首次于X平臺發帖為開源模型辯護,并發布公開信呼吁政策制定者支持開放權重模型,同時“避免過早限制”以免將創新推向海外。他寫道:“開放模型加強安全與網絡安全,加速創新與普及,并實現主權。”這一行動的背景是中國開源模型的快速崛起,特別是月之暗面發布的Kimi K3縮小了與美國頂尖模型的差距,引發了華盛頓對國家安全和知識產權的擔憂。英偉達隨后與Microsoft等科技巨頭簽署公開信支持開放權重模型,并組建了AI安全聯盟。

(黃仁勛在X平臺上的首條推文)
從更宏觀的視角看,英偉達的轉型遵循著一條清晰的“從賣鏟子到賣礦場”的路徑。它不再滿足于只做AI時代基礎設施供應商的角色,而是試圖通過CUDA生態、NIM微服務、Nemotron開源模型和NeMo工具鏈,構建一個從芯片到模型再到應用的全棧平臺。當客戶使用Nemotron模型時,他們自然會選擇英偉達的GPU進行部署;當企業采用NeMo Switchyard進行模型路由時,它們也更傾向于留在英偉達的生態內。