当地时间 8 月 11 日,英伟达发布了一款新的开源人工智能模型 Nemotron 3.5 Lightning,进一步扩充其 Nemotron 系列,并把重心放在了当下最热门的「智能体」工作负载上。

与动辄几千亿参数的旗舰大模型不同,这款模型走的是「小而快、专干执行层苦力活」的路线。英伟达给它的定位,不是负责复杂规划的「大脑」,而是在多智能体系统里承担代码审查、安全监控、数据处理等高频、重复、对速度与成本极其敏感的执行任务。
300 亿参数,每次只激活 30 亿
Nemotron 3.5 Lightning 采用混合专家(MoE)架构,总参数为三百亿,但每次推理只激活约三十亿参数。这种「总量大、激活小」的设计,让它在资源占用与推理效率之间找到了新的平衡点。
英伟达称,与同级别开源模型相比,它的输出速度最高可提升四倍,相应地把智能体任务的整體完成速度加快约三成。需要指出的是,单项输出速度提升明显,但由于多智能体协作中存在通信与调度开销,整体任务的加速比并没有达到四倍——这也是它被定位为「特定任务」加速器,而非通用全流程加速器的原因。
在基准测试方面,该模型在 PinchBench 上拿到 86 分,与 OpenAI 的 gpt-oss-120b 相当,仅落后规模为其四倍的 Nemotron-Super 两分。英伟达强调,它的核心价值不在绝对性能排名,而在智能体工作流里的执行效率。
本地就能跑,还能自动路由
部署门槛是这款模型的一大卖点。它可以直接运行在本地 AI 设备上,包括搭载 RTX 显卡的 PC、DGX Spark、Jetson 边缘设备,也能扩展到数据中心与云端。发布当天,vLLM、Ollama、llama.cpp 与 LM Studio 等主流推理框架即宣布提供支持。
英伟达同时放出了配套的 NeMo Switchyard 路由库。它允许开发者定义模型池与路由策略,把工作流的每一步调度到最合适的模型上。内部基准显示,借助路由,系统能在维持前沿级任务完成度的同时,把成本压到单独运行 Opus 4.8 的大约三分之一。已有企业在真实场景中验证这套方案:LangChain 在一百四十四个多轮智能体任务里,仅把百分之七的调用量路由给前沿模型,就实现了百分之七十四的成本下降;Ramp 在 SWE-Bench 基准上匹配了前沿模型性能,同时降低百分之五十八的成本与百分之三十三的运行时间。
从卖芯片到卖整套 AI 工作流
多家媒体指出,Nemotron 3.5 Lightning 与 Switchyard 的打包推出,标志着英伟达正从单纯的硬件供应商,向全栈 AI 生态服务商实质性转型。当企业 AI 应用从「单模型对话」走向「多智能体协作」,执行层模型的市场空白正在被打开。
值得注意的是,英伟达并未停下更大模型的脚步。据多家媒体报道,公司还在开发参数规模至少达到一万亿的开源模型 Nemotron 4,意图与全球领先的开源大模型正面竞争。对开发者而言,一个由芯片厂商主导、软硬件协同优化的开源模型生态,正在快速成形。
来源:CNBC / The New Stack / NVIDIA(2026 年 8 月 11 日)







