月访问量
0
累计浏览
0
用户评分
4.2
收录时间
2026-08
产品介绍
产品介绍
NVIDIA Nemotron 3.5 Lightning 是英伟达于 2026 年 8 月 11 日发布的开源混合专家(MoE)模型,专为长时运行的 AI 智能体工作负载设计。模型总参数 300 亿,每次推理仅激活 30 亿参数,在单块消费级 GPU 上即可运行。通过推测解码、多 Token 预测和 NVFP4 量化等技术,输出速度可达同级别模型的 4 倍,智能体任务整体完成速度提升 30%。模型权重、训练数据和配方完全开源,采用宽松许可协议。
核心功能
- 30B MoE 架构 / 3B 激活参数:高效率推理,单卡可部署
- 100 万 Token 上下文窗口:支持超长智能体会话和文档分析
- 4 倍吞吐量提升:DFlash 推测解码 + 多 Token 预测,输出速度远超同级别模型
- 30% 任务加速:针对智能体工具调用、结果验证等高频步骤优化
- 完全开源:权重、数据、训练配方全部开放,支持微调和私有化部署
- NVFP4 / BF16 双精度:提供量化和全精度检查点,适配不同硬件
- NeMo Switchyard 智能路由:可与其他模型协同部署,按任务步骤自动分配最优模型
- Harness 优化训练:针对主流智能体框架(Agent Harness)专项训练
API 调用
通过 OpenRouter 调用:
from openai import OpenAI
client = OpenAI(
api_key="your-openrouter-key",
base_url="https://openrouter.ai/api/v1"
)
response = client.chat.completions.create(
model="nvidia/nemotron-3.5-lightning:free",
messages=[{"role": "user", "content": "Explain quantum computing"}]
)
print(response.choices[0].message.content)
也可通过 NVIDIA build.nvidia.com、Together AI 访问。本地部署使用 vLLM、SGLang 或 TensorRT-LLM。
典型使用场景
- 长时运行智能体系统(工具调用、结果验证、子智能体调度)
- 高并发、低延迟的批量推理任务
- 私有化部署和数据敏感场景
- 多模型协同系统中的专用任务执行
- 学术研究和模型微调
平台支持
通过 build.nvidia.com、OpenRouter、Together AI 访问;权重可从 HuggingFace 和魔搭社区下载。支持 vLLM、SGLang、TensorRT-LLM 部署框架。