NVIDIA 推出 Nemotron 3.5 Lightning:30B MoE 僅啟用 3B 參數,瞄準長時間 AI Agent 執行層
30秒摘要
NVIDIA 發表開放式 AI 模型 Nemotron 3.5 Lightning,採用 300 億參數的混合專家(MoE)架構,但每次推論僅啟用約 30 億參數,主攻長時間運作 AI Agent 中大量、重複且對延遲敏感的工具呼叫、結果驗證與子代理協作工作。NVIDIA 同時推出 NeMo Switchyard 模型路由框架,試圖建立「大型推理模型負責規劃、小型高效率模型負責執行」的多模型 Agent 架構。官方數據顯示,Nemotron 3.5 Lightning 在 PinchBench 達到 86% 準確率,並在相近準確率下完成 1 萬項任務的時間較 Qwen3.6 35B 快約 30%。
重點摘要
- 01Nemotron 3.5 Lightning 採用 30B MoE 架構,但每次推論僅啟用約 3B 參數,降低實際計算需求。
- 02模型主要鎖定長時間 AI Agent 的執行層,包括工具呼叫、結果驗證、格式化與子代理任務等高頻工作。
- 03NVIDIA 主張採用 System of Models 架構,由大型 Frontier Model 負責規劃,小型 Lightning 模型負責大量執行。
- 04NeMo Switchyard 可依任務難度與需求進行模型路由,讓不同請求送往最適合的模型。
- 05官方表示 Nemotron 3.5 Lightning 在 PinchBench 達到 86% 準確率,完成 10,000 項任務較 Qwen3.6 35B 快約 30%。
- 06模型導入 Multi-Token Prediction、DSpark、DFlash 等 speculative decoding 技術,提高推論吞吐量。
- 07提供 BF16 與 NVFP4 checkpoint,並支援 NVIDIA Blackwell、Hopper、Ampere GPU。
- 08模型可部署於資料中心,也瞄準 DGX Spark、GeForce RTX 5090、Jetson 等本地 AI 環境。
- 09NVIDIA 開放模型權重、訓練資料與 recipes,支援 LoRA、SFT、強化學習與 Agent 環境客製化。
- 10Nemotron 3.5 Lightning 顯示 Agent 產業可能從『單一大型模型』逐漸轉向『多模型分工與智慧路由』架構。
隨著 AI Agent 從一次性問答逐漸走向能夠持續數小時甚至長期運作的自主系統,模型成本與推論延遲正在成為新的工程瓶頸。NVIDIA 最新推出 Nemotron 3.5 Lightning,希望解決的正是這個問題:並非讓每一個步驟都交給最強大的前沿推理模型,而是把大量日常執行工作交給更小、更快的專用模型。
Nemotron 3.5 Lightning 是一款開放式 300 億參數混合專家模型(Mixture-of-Experts,MoE),但每次處理 token 時僅啟用約 30 億參數。MoE 架構透過 Router 將不同 token 分配給少數適合的 Expert,因此不必讓全部 300 億參數同時參與計算,在保留較大模型容量的同時,將實際運算量壓低至更接近小型模型的水準。
這項設計特別針對長時間 AI Agent。NVIDIA 指出,Agent 真正大量消耗運算資源的部分,往往不是高階規劃本身,而是後續數以百計甚至數以千計的執行步驟,例如呼叫工具、執行 git pull、驗證工具輸出、格式化資料、檢查結果,以及將任務分派給其他子代理。如果所有步驟都交由 Frontier Reasoning Model 執行,成本與延遲會快速累積。
因此 NVIDIA 正推動一種「System of Models」架構:Nemotron 3 Ultra 等大型推理模型負責複雜規劃、推理與任務編排,Nemotron 3.5 Lightning 則下沉至執行層,處理高頻率、相對結構化的工作。概念上就像一個 AI 團隊,資深決策者負責制定策略,而大量具體執行工作交由速度更快、成本更低的專業成員完成。
為了讓這套架構真正運作,NVIDIA 同時推出 NeMo Switchyard。Switchyard 是一套模型路由函式庫,可依照任務特性把請求送往不同模型。複雜規劃可以向上路由至 Frontier Model,而大量執行工作則向下交給 Lightning 等較小模型,目標是在模型能力、延遲與 token 成本之間取得更好的平衡。
Nemotron 3.5 Lightning 本身也針對 Agent Harness 進行訓練,可搭配 OpenClaw、Hermes Agent 等 Agent 執行環境,並可透過 NVIDIA NemoClaw 開源安全與管理堆疊部署長時間運作的 AI Agent。
在效能方面,NVIDIA 表示 Nemotron 3.5 Lightning 位於 Artificial Analysis Intelligence Index 的準確率與速度 Pareto Frontier。該指數整合九項評測,涵蓋 Agent 任務、程式設計、科學推理與一般智能等能力。官方宣稱 Lightning 在同級模型中能提供最高約 4 倍輸出速度。
不過 NVIDIA 強調,Agent 系統真正重要的並非單純的 tokens per second,而是完成有效任務所需的總時間。在 PinchBench 測試中,Nemotron 3.5 Lightning 達到 86% 準確率;在相近準確率條件下,完成 10,000 項任務的速度較 Qwen3.6 35B 快約 30%。這類指標更貼近長時間 Agent 的實際使用情境,因為 Agent 最終追求的是完成任務,而非單純快速吐出文字。
Lightning 的另一項核心技術是 speculative decoding,也就是推測式解碼。模型在訓練期間加入 Multi-Token Prediction(MTP),讓模型能預測多個後續 token,再透過驗證機制一次接受其中正確的部分,以降低逐 token 自回歸生成造成的延遲。NVIDIA 也在預訓練後加入專門的 MTP boosting 階段,提高多 token 預測準確度。
除了內建 MTP,NVIDIA 還提供 DSpark 與 DFlash 兩種 Draft Model。DSpark 主要建議用於 DGX Spark 以及低並發資料中心推論環境;MTP 則較適合中高並發工作負載,並且最佳 Draft Length 會隨並發程度提高而下降。DFlash 則提供另一種推測式解碼方案,開發者可依照實際部署環境進行比較。
量化也是 Lightning 提升部署效率的重要環節。模型除了 BF16 之外,也提供 NVFP4 checkpoint,並採用與 Nemotron 3 Ultra 相同類型的專用 NVFP4 Kernel。NVIDIA 表示相關技術可橫跨 Blackwell、Hopper 與 Ampere GPU 使用,使同一模型能從資料中心一路延伸至較小型的本地 AI 系統。
在本地端部署方面,NVIDIA 將 Nemotron 3.5 Lightning 定位為可以運行於 Jetson、GeForce RTX 5090 與 DGX Spark 等系統的 Agent 模型,並支援 LM Studio、llama.cpp、Ollama、Unsloth 等常見工具。這也意味著部分企業或開發者可以將 Agent 執行層部署在自己的硬體環境,而不必讓所有請求都送往大型雲端模型。
Lightning 的另一個定位是高度可客製化。NVIDIA 表示模型權重、訓練資料與 recipes 以 OpenMDW-1.1 授權方式釋出,開發者可利用 NeMo Automodel、NeMo Megatron Bridge 進行 LoRA 或完整 SFT 微調,也能透過 NeMo RL 與 NeMo Gym 執行強化學習、環境評測與 rollout。
此次發布還包含 Nemotron-RL Agentic Terminal Pivot 開放資料集,該資料集曾用於訓練部分 Coding Agent 能力,進一步凸顯 NVIDIA 並非只將 Nemotron 定位為聊天模型,而是朝可操作工具、程式碼與工作環境的 Agent 基礎模型發展。
從產業角度來看,Nemotron 3.5 Lightning 更值得關注的地方,可能不是單一 Benchmark 是否超越另一款模型,而是 NVIDIA 對下一代 Agent 架構的判斷。當 Agent 一次任務可能包含數百次模型呼叫時,讓最昂貴、最大的模型處理所有步驟並不一定具有經濟效益。未來 Agent 系統可能更接近異質運算:不同規模、不同專長的模型依任務需求動態分工。
這與現代運算系統中 CPU、GPU 與各類加速器各自處理不同工作負載的思路相似。Frontier Model 負責高難度推理與決策,小型模型處理大量例行工作,再由 Switchyard 類型的 Router 決定每個請求應該送到哪一層。如果這套架構成熟,AI Agent 的競爭焦點可能逐漸從『誰擁有最大的單一模型』,轉向『誰能以最低成本調度最適合的模型完成整個任務』。
NVIDIA 目前已建立涵蓋模型訓練、推論、Agent Framework、雲端平台與企業服務的合作生態,包括 Ollama、LM Studio、LangChain、OpenHands、Cline、Amazon SageMaker JumpStart、Google Cloud、CoreWeave、Together AI、Fireworks AI 等平台與工具。Nemotron 3.5 Lightning 模型則可透過 NVIDIA Build、OpenRouter、Hugging Face 與 ModelScope 等管道取得。
對 NVIDIA 而言,Nemotron 3.5 Lightning 的意義也不只是一款新的開放模型。從 Nemotron、NeMo、Switchyard、TensorRT-LLM 到 DGX 與 GPU 硬體,公司正在嘗試建立涵蓋模型、路由、訓練、推論與運算平台的完整 Agent 技術堆疊。在 AI Agent 從 Demo 走向長時間、持續運作的生產環境後,『每次任務到底需要多少模型能力』,可能會成為控制 AI 基礎設施成本的下一個關鍵問題。
原始來源
developer.nvidia.com

