
问题已经不再是谁的算力更强,而是哪一个任务该交给哪一个模型。
英伟达今天的两个发布,是对这条逻辑的直接回应。
它推出了一款高度可定制、主打高效率的新模型 Nemotron 3.5 Lightning,以及一个名为 NeMo Switchyard 的智能体模型路由器。前者补上 " 执行型 " 模型的位置,后者则解决 " 模型足够多之后,谁来调度 " 的问题。
一款为 " 执行 " 而生的轻模型
Nemotron 3.5 Lightning 是一个总参数约 300 亿的混合专家模型,单次推理只激活约 30 亿参数。英伟达称,相比同类模型,它的输出速度最高提升约 4 倍,智能体任务完成速度提升约 30%。
它的定位不是取代最强的前沿模型,而是成为多智能体系统里的 " 执行型 " 模型。在一个复杂的企业 AI 系统里,大模型负责任务规划和复杂推理,Lightning 则承担大量代码审查、安全监控、数据处理、告警分析这类专业化工作。混合专家架构的价值正在于此,总参数不小,但每次推理只激活其中一小部分,单次 token 计算成本随之下降。
这里需要厘清一个落差,输出快 4 倍,并不意味着整个任务能快 4 倍。
模型推理只是智能体工作流的一环,工具调用、API 响应、多智能体之间的任务编排都会形成新的瓶颈,实际任务提速被压缩到约 30%。这也是英伟达在同一个节点端出 Switchyard 的原因,只解决 " 单个模型跑得快 " 远远不够,还要解决 " 每一步该用哪个模型 "。
第三方评测机构 Artificial Analysis 的数据印证了 Lightning 的执行能力。它的 Intelligence Index 得分为 24,比上一代小尺寸型号 Nemotron 3 Nano 高出 9 分,与 OpenAI 的 gpt-oss-120b 相当,仅落后于规模约为其 4 倍的 Nemotron 3 Super 2 分。在代理任务相关的 GDPval-AA v2 评测上,它的 Elo 达到 824,超越 Nemotron 3 Super 和 gpt-oss-120b;在 Terminal-Bench v2.1 上拿到 24% 的成绩,而 Nemotron 3 Nano 只有 7%。在预发布测试中,其输出速度接近每秒 670 个 token。
模型足够多之后,路由成为新软件层
Lightning 的另一重差异化在于它开放且易于定制。企业可以在自己的硬件上,用 NeMo 针对专有领域数据、工具和工作流进行二次训练。
" 我们听到的是,Lightning 极易定制。" 英伟达生成式 AI 副总裁 Kari Briski 说。据她介绍,CodeRabbit 用英伟达的标准模型配方训练了一个 epoch,约两小时、花 85 美元就产出了一个路由智能体。另一个伙伴把 Lightning 直接放进已有的后训练栈," 无需任何改动 "。还有一个公司用单张 H100 卡就完成了训练,另一个干脆晚上跑训练任务,早上来取结果。
" 这正在把后训练和微调变成把碗放进洗碗机、然后按下启动键。"Briski 说。
英伟达同时放出了它的数据集、后训练数据集,以及训练模型所用的配方和框架。开发者可以把英伟达的后训练数据与企业自有数据混在一起,做出 " 取两家之长 " 的混合模型。" 这就是为什么我们看到人们很快得到很好的结果。"Briski 说。
NeMo Switchyard 是一个开源的模型路由库。它会考虑当前有多少模型可用、各自能力如何,在智能体工作流的每一步,把请求路由到当时最合适、最高效的模型。开发者可以根据质量、延迟、成本等优先级,自定义路由策略。
对未来的多智能体系统而言,真正重要的或许已经不是 " 哪个模型最好 ",而是哪个任务该由哪个模型完成。企业不必让每一个任务都用最贵的模型。英伟达与 Boomi、Cadence Design Systems、Classmethod、Cognition、Kong、Langchain、Nous Research、Siemens 等一批生态伙伴合作,把智能路由接入开发者已在使用的工具。
把 Lightning 和 Switchyard 放在一起看,英伟达的判断清晰可见,随着模型数量越来越多,模型之间的调度和协同会成为新的软件层。
从 Nemotron 4 到与 OpenAI 的微妙关系
这两次发布只是英伟达开源模型战略的局部。Nemotron 3 家族去年 12 月推出,当时有三个尺寸,Nano、Super、Ultra。据 The Information 报道,英伟达正在开发下一代 Nemotron 4,目标参数量至少 1 万亿,约为其现有最大模型 Nemotron 3 Ultra 的两倍,旨在与全球顶尖开源模型比肩。
它还组建了一个包含 Reflection、Cursor、Thinking Machines、Mistral 等在内的 "Nemotron 联盟 ",多方在推进自身模型的同时,向 Nemotron 4 贡献训练数据、评估支持和设计方案。
这背后是英伟达微妙的处境。其芯片需求高度集中于 OpenAI、微软、SpaceX 等少数前沿实验室和云服务商,而英伟达已向 OpenAI 投资 300 亿美元;另一边,Nemotron 4 恰恰定位为企业提供成本更低的替代方案,与这些前沿实验室形成竞争。它一边给客户供芯片,一边下场造模型,边界正在变得模糊。
不过对英伟达而言,这未必是零和游戏。AI 模型评测机构 Arena 的首席执行官 Anastasios Angelopoulos 的一句话点破逻辑," 无论哪家公司做出优秀的开源模型,英伟达都是赢家。" 开源生态越繁荣、参与主体越多元,GPU 的整体需求就越旺盛。
英伟达的角色正在从卖芯片的,变成卖整个 AI 工作流的。只要模型跑在英伟达的路由、推理和部署体系里,无论企业最终选择谁的模型,它都能从整个工作流中获得价值。这才是 Switchyard 与 Nemotron 3.5 放在一起发布的真正含义。(本文首发钛媒体 APP,作者 | 硅谷 Tech_news,编辑 | 秦聪慧)