黄仁勋“站台开源”后首款模型落地:英伟达正式推出 Nemotron 3.5 Lightning,单张 GPU 即可运行
当地时间 8 月 11 日,英伟达正式宣布推出开源 AI 模型Nemotron 3.5 Lightning。这是英伟达 CEO 黄仁勋上月底在 X 平台首次发声、公开表态支持开源模型后,英伟达发布的首款开源模型。
一个月前,黄仁勋联合 25 家科技巨头签署公开信,力挺开源 AI。一个月后,他用一款实实在在的产品,兑现了“开源”的承诺。现在看来整个事件都是一场商业的布局的精准落子,步步为营,英伟达以一种全新的方式加入了AI战局。
一、专为“执行”而生:300 亿参数,单次只激活 30 亿
Nemotron 3.5 Lightning 是一款300 亿参数的混合专家(Mixture-of-Experts, MoE)模型。MoE 架构的核心优势在于:虽然总参数达 300 亿,但每次推理只激活约 30 亿参数。
这意味着,它用“小模型的计算成本”实现了“大模型的容量”。
英伟达对这款模型的定位非常清晰——它不是用来取代前沿推理模型的,而是成为多智能体系统里的“执行型”模型。在一个复杂的企业 AI 系统里,大模型负责任务规划和复杂推理,Nemotron 3.5 Lightning 则承担大量代码审查、安全监控、数据处理、告警分析这类专业化工作。
用英伟达的话说:“前沿推理模型可以规划和协调工作流,而像 Lightning 这样的小型专用模型可以执行目标任务。”
二、性能炸裂:输出速度提升 4 倍,任务提速 30%
作为一款主打“效率”的模型,Nemotron 3.5 Lightning 的性能数据相当亮眼:
速度层面:相比同类模型,输出速度最高可提升4 倍,智能体任务整体完成速度加快 **30%**。在预发布测试中,其输出速度接近每秒 670 个 token。
精度层面:在衡量智能体实际工作效率的PinchBench基准测试中,它达到了86% 的准确率,同时在完成 10000 个任务的速度上,比同等准确率的 Qwen3.6 35B 快了约 **30%**。
第三方评测:在 Artificial Analysis 的 Intelligence Index 中,Nemotron 3.5 Lightning 得分24,与 OpenAI 的 gpt-oss-120b 持平。在代理任务相关的GDPval-AA v2评测上,其 Elo 达到824,超越了 Nemotron 3 Super 和 gpt-oss-120b。
推理优化:模型支持推测解码和多令牌预测技术,并配备 DFlash 和 DSpark 两个辅助模型,可在多种服务场景下实现更全面的推理优化。
三、真正“平民化”:单张 GPU 可跑,随时随地部署
Nemotron 3.5 Lightning 最令人惊喜的特点,是它的轻量化。
据 CNBC 报道,这款模型“轻量高效”,可在普通笔记本电脑或台式机的单块 GPU 上流畅运行。具体支持的平台包括:NVIDIA RTX PC、NVIDIA DGX Spark、NVIDIA DGX Station 以及 NVIDIA Jetson 系列。
同时,它也可无缝扩展至边缘 AI 设备、RTX PRO 工作站、数据中心及云端环境。
部署生态方面,模型已获得广泛支持,包括Ollama、LM Studio、Amazon SageMaker JumpStart、Google Cloud、Microsoft Foundry 和 Oracle Cloud Infrastructure等主流平台。
四、开源诚意:权重、数据、配方全开放
Nemotron 3.5 Lightning 的开源程度,超越了多数“开源”模型——不只是模型权重,训练数据和训练配方也一并开放。
模型采用OpenMDW-1.1 开源协议发布。开发者可以:
使用NeMo Automodel和NeMo Megatron Bridge进行 LoRA 或全量微调
使用NeMo RL和NeMo Gym运行强化学习和基于环境的评估
将英伟达的后训练数据与企业自有数据混合,定制专属模型
英伟达生成式 AI 副总裁 Kari Briski 用了一个形象的比喻:“这正在把后训练和微调变成把碗放进洗碗机、然后按下启动键。”
低成本定制的案例已经出现:CodeRabbit 用英伟达的标准模型配方训练了一个 epoch,约两小时、花费 85 美元就产出了一个路由智能体。另一个合作伙伴用单张 H100 卡就完成了训练。
五、配套发布:NeMo Switchyard——解决“模型太多,谁来调度”
与 Nemotron 3.5 Lightning 同步发布的,还有一款开源模型路由库 ——NeMo Switchyard。
它的作用是:在智能体工作流的每一步,把请求路由到最适合该任务的模型。复杂请求交给强大的推理模型,常规执行任务交给 Nemotron 3.5 Lightning。
这一发布揭示了一个关键趋势:当模型足够多之后,“路由”正在成为新的软件层。企业选模型的标准,正在从“哪个最强”转向“哪个够用、哪个快、哪个划算”。
六、行业落地: CrowdStrike、Harvey、CodeRabbit 已率先采用
Nemotron 3.5 Lightning 并非停留在实验室阶段,多个行业头部玩家已在定制和使用:
CrowdStrike:用于网络安全领域
Harvey with Trajectory:用于法律服务
CodeRabbit with Baseten:用于代码审查
Lila Sciences:利用它提高物理和生命科学领域智能体任务的推理能力
Fastino Labs:在软件开发、金融和医疗工作负载方面取得了领先的准确性
写给开发者
1. 别再拿“大模型”干“小活”了
Nemotron 3.5 Lightning 传递的信号非常明确:未来的 AI 系统是多模型系统,而不是单模型通吃。大模型负责规划和推理,小模型负责高频执行。开发者在设计 AI 应用时,应该从“选一个最强的模型”转向“为每个任务选最合适的模型”。
2. 开源模型正在“平民化”推理成本
单张 GPU 可跑、85 美元微调出一个智能体——这意味着中小团队也能拥有定制化 AI 的能力,不再需要为每次推理支付高昂的 API 费用。对于创业公司和个人开发者,这是一个值得认真评估的机会。
3. 英伟达的战略:从“卖芯片”到“卖整个 AI 工作流”
Nemotron 3.5 Lightning + NeMo Switchyard 的组合,本质上是在构建一个完整的 AI 工作流生态。开源模型用得越多,GPU 需求越大——英伟达正在用软件生态巩固自己的硬件护城河。
4. 模型已上线,现在就可以下载
Nemotron 3.5 Lightning 已在Hugging Face和ModelScope平台同步上线,全球开发者可免费下载、使用和修改,无需向英伟达付费或申请额外许可。
写在最后
从黄仁勋在 X 平台发布第一条推文力挺开源,到 Nemotron 3.5 Lightning 正式上线,刚好过去三周。
这款模型的意义,不只是“又一个大模型开源了”——它标志着英伟达正在从“AI 算力的卖水人”走向“AI 工作流的定义者”。当芯片巨头亲自下场定义“什么样的模型该跑在什么样的硬件上”,整个 AI 开发范式的底层逻辑,正在被重新书写。
正如黄仁勋上月底所说:“优秀的开源 AI 大模型对整个行业大有裨益。”现在,他用一款产品证明了这句话不只是说说而已。
关键词标签:#英伟达 #Nemotron3.5Lightning #开源模型 #AI智能体 #MoE #黄仁勋 #NeMoSwitchyard #大模型 #AI开发者 #HuggingFace