工程 / 官方
NVIDIA Nemotron 3.5 Lightning:专为智能体高频调用设计的混合专家模型
NVIDIA于2026年8月发布Nemotron 3.5 Lightning,这是一款总参数量300亿、每个token仅激活约30亿参数的混合专家(MoE)语言模型。其架构融合了Mamba-2、注意力机制与MoE层,并支持多token预测和两种推测解码加速器DSpark与DFlash。该模型专为智能体工作流中的高频执行环节设计——当一个智能体需要反复调用模型来选择工具、编辑文件、验证结果时,Lightning凭借较低的延迟和成本优势成为理想选择。在OpenRouter平台上,标准端点提供262,144 token上下文窗口,免费端点则支持高达100万token上下文。与同门的Nemotron 3 Ultra(550B参数)相比,Lightning的定价仅为后者的约十分之一,适合与Ultra搭配使用,将复杂推理交给Ultra、高频执行交给Lightning,从而在可靠性与成本之间取得平衡。
Nemotron 3.5 Lightning是NVIDIA面向智能体执行层推出的开放权重模型。其核心设计理念在于:一个长时运行的智能体往往需要发起数十次模型调用,其中大多数并非复杂推理,而是选择工具、生成参数、检查结果或编辑文件等目标明确的步骤。Lightning正是为这类高频、范围清晰的调用而生,而非用于需要深度推理的规划环节。
在架构层面,Lightning采用30B-A3B设计,即总参数300亿、每token激活约30亿。路由器在处理每个token时动态选择激活哪些专家,使模型在保留较大总容量的同时,将实际计算量控制在接近30亿参数密集模型的水平。此外,模型还融合了Mamba-2与MoE交错层及选择性注意力层,并提供BF16、NVFP4和GGUF多种精度版本,以适应不同部署场景。
与同系列的Nemotron 3 Ultra相比,两款模型定位截然不同。Ultra拥有550B总参数、55B活跃参数,适合处理模糊问题的深度推理与工作流编排;Lightning则以更低成本承担高频执行任务。在OpenRouter平台上,Lightning的输入价格为每百万token 0.065至0.10美元,输出为0.18至0.25美元,而Ultra的输入价格高达0.50至0.625美元,输出则为2.20至3.125美元,差距显著。
NVIDIA报告称,Lightning的吞吐量最高可达同规模开放模型的四倍,在PinchBench的1万个智能体任务测试中,完成速度比对照组快约30%,且准确率相当。不过,这些均为厂商自测数据,实际部署时仍需针对具体工作负载进行独立验证,以评估吞吐量与任务完成质量是否符合预期。
在OpenRouter平台上,Nemotron 3.5 Lightning提供两个端点:标准模型(nvidia/nemotron-3.5-lightning)在所有当前提供商处均支持262,144 token上下文及结构化输出,其中两家提供商支持工具调用;免费模型(nvidia/nemotron-3.5-lightning:free)则提供高达100万token的上下文,最大补全长度为65,536 token,但暂不支持结构化输出。用户也可使用Auto Router(openrouter/auto)将模型选择交由平台自动完成。
对于希望在智能体系统中控制成本的开发者而言,Lightning提供了一种实用的分层策略:将需要深度推理或高风险决策的调用路由至Ultra,将重复性执行步骤交给Lightning处理。模型权重以OpenMDW-1.1许可证开放,支持本地部署与领域定制,为有私有化需求的团队提供了额外的灵活性。
要点
- Nemotron 3.5 Lightning采用30B总参数、每token激活约3B的MoE架构,专为智能体工作流中的高频执行调用设计,而非复杂推理任务。
- 与Nemotron 3 Ultra相比,Lightning的推理成本约为后者的十分之一,适合与Ultra组合使用以平衡成本与能力。
- 在OpenRouter平台上,标准端点提供262,144 token上下文,免费端点支持高达100万token上下文,两者功能配置有所差异。
- 模型以OpenMDW-1.1许可证开放权重,提供BF16、NVFP4和GGUF多种格式,支持本地部署与定制化微调。
- NVIDIA报告的吞吐量和速度提升数据来自厂商内部测试,实际效果需结合具体工作负载进行独立评估。