英伟达发布Nemotron 3.5 Lightning开源模型 同步推进万亿参数Nemotron 4
英伟达发布Nemotron 3.5 Lightning开源模型 同步推进万亿参数Nemotron 4
英伟达8月11日发布30B参数MoE开源模型Nemotron 3.5 Lightning,专为长时运行智能体设计,输出速度较同类快4倍、任务完成速度提升30%。同步发布开源路由库NeMo Switchyard,可降低74%智能体成本。万亿参数Nemotron 4也在研发中。
8月11日,英伟达正式发布Nemotron 3.5 Lightning开源模型,这是一款面向长时运行智能体工作负载的300亿参数混合专家(MoE)模型,每轮推理仅激活约30亿参数。该模型并非与GPT-5.6或Claude Opus争夺通用推理王座,而是聚焦解决智能体系统中高频执行环节的成本和延迟问题。
核心信息:
- 架构设计:30B总参数MoE架构,3B激活参数,支持多token预测和推测解码,内置DFlash和DSpark两个草稿模型,可在Jetson、RTX 5090到DGX Spark等设备本地运行。
- 性能表现:输出速度比同类模型快约4倍,智能体任务完成速度提升30%;PinchBench基准达86%准确率,完成10000个任务比Qwen3.6 35B快约30%。
- 开源许可:权重、训练数据和配方均在OpenMDW-1.1许可下发布,支持商业使用,企业可自由下载、修改和LoRA微调。
- NeMo Switchyard路由库:同步发布的开源智能路由库可自动将复杂规划任务交给前沿大模型、高频执行交给Nemotron 3.5 Lightning。LangChain测试中145个多轮任务成本降低74%,仅7%调用路由至前沿模型;Ramp在SWE-Bench中成本降低58%、运行时间降低33%。
- Nemotron 4曝光:下一代Nemotron 4最大版本将拥有至少1万亿参数,由Nemotron Coalition联合开发,对标全球顶级开源模型,最早可能今年深秋发布。
- 战略逻辑:英伟达生成式AI副总裁Kari Briski表示投资Nemotron是因为相信每家公司都需要可获取的前沿开放模型。黄仁勋一语道破底层逻辑:"免费AI应该有利于硬件,有利于芯片,有利于数据中心。"
英伟达正从AI芯片供应商向"芯片+模型+工具链"全栈平台转型,通过开源模型扩大GPU生态需求。Nemotron 3.5 Lightning已登陆Perplexity Agent API,定价为输入0.0115美元/百万tokens、输出0.17美元/百万tokens。