Nvidia週二(8/11)開源 AI模型Nemotron 3.5 Lightning及模型路由工具NeMo Switchyard,前者可替AI代理人執行特定工作,後者則能依照工作內容,自動選擇最適合的AI模型。
Nemotron是Nvidia專為AI代理人所開發的開放模型系列。 Nvidia去年12月推出Nemotron 3家族 ,陸續發布Nano、Super及Ultra。此次新增的Nemotron 3.5 Lightning仍被列為Nemotron 3家族成員。
Nemotron 3.5 Lightning與Nemotron 3 Nano同樣採用300億參數、每次啟用30億參數的設計,但進一步針對AI代理人的大量、高頻率工作最佳化。它加入多Token預測、推測式解碼及代理人框架最佳化訓練,主要用於工具呼叫、結果驗證及子代理人分派等工作。
Nvidia宣稱,Nemotron 3.5 Lightning的輸出速度最高可達同等規模開放模型的4倍。在PinchBench測試中,該模型以86%的準確率完成1萬項代理任務,準確率與Qwen3.6 35B相近,所需時間則縮短30%。
至於NeMo Switchyard則是一套供AI代理人使用的開源模型路由工具,可依照每項工作的內容,自動從多款AI模型中選擇最適合的對象。組織可同時納入Nvidia、其他開放模型或專有模型,並將複雜規畫交給大型前沿模型,把工具呼叫、格式整理及結果驗證等例行性工作分派給Nemotron 3.5 Lightning等較小型模型。
組織可自行設定Switchyard的模型分派原則,例如優先選擇準確率較高、回應較快或成本較低的模型,也能利用內部資料訓練路由器,使程式開發、財務及客服等不同工作自動交給相應模型。Switchyard可直接整合至既有AI代理系統,而無需改寫原有應用程式。
Nvidia內部測試顯示,相較於把所有工作都交給Opus 4.8,Switchyard會將較簡單的工作分派給成本較低的模型,在準確率相近的情況下,可把整體任務成本降至約三分之一。
在合作夥伴的測試中,Ramp利用Switchyard將較簡單的程式開發工作交給成本較低的模型,結果在維持整體表現的情況下,成本降低58%、執行時間縮短33%。LangChain採取更積極的節省方式,只把7%的請求交給前沿模型,雖然成本降低74%,但準確率也隨之下降6個百分點。