关于ZAKER Skills 合作
钛媒体 32分钟前

从卖芯片到卖整个 AI 工作流:英伟达发布 Nemotron 3.5 与模型路由器

企业选模型的标准正在从 " 哪个最强 " 转向 " 哪个够用、哪个快、哪个划算 "。当 AI 智能体成为企业应用的标配,它们承担的任务从成批的简单小任务,一路延伸到需要跨深度知识领域的复杂推理。前者交给能快速处理批量小任务的轻量模型即可,后者才需要高智能、强推理的前沿模型。

问题已经不再是谁的算力更强,而是哪一个任务该交给哪一个模型。

英伟达今天的两个发布,是对这条逻辑的直接回应。

它推出了一款高度可定制、主打高效率的新模型 Nemotron 3.5 Lightning,以及一个名为 NeMo Switchyard 的智能体模型路由器。前者补上 " 执行型 " 模型的位置,后者则解决 " 模型足够多之后,谁来调度 " 的问题。

一款为 " 执行 " 而生的轻模型

Nemotron 3.5 Lightning 是一个总参数约 300 亿的混合专家模型,单次推理只激活约 30 亿参数。英伟达称,相比同类模型,它的输出速度最高提升约 4 倍,智能体任务完成速度提升约 30%。

它的定位不是取代最强的前沿模型,而是成为多智能体系统里的 " 执行型 " 模型。在一个复杂的企业 AI 系统里,大模型负责任务规划和复杂推理,Lightning 则承担大量代码审查、安全监控、数据处理、告警分析这类专业化工作。混合专家架构的价值正在于此,总参数不小,但每次推理只激活其中一小部分,单次 token 计算成本随之下降。

这里需要厘清一个落差,输出快 4 倍,并不意味着整个任务能快 4 倍。

模型推理只是智能体工作流的一环,工具调用、API 响应、多智能体之间的任务编排都会形成新的瓶颈,实际任务提速被压缩到约 30%。这也是英伟达在同一个节点端出 Switchyard 的原因,只解决 " 单个模型跑得快 " 远远不够,还要解决 " 每一步该用哪个模型 "。

第三方评测机构 Artificial Analysis 的数据印证了 Lightning 的执行能力。它的 Intelligence Index 得分为 24,比上一代小尺寸型号 Nemotron 3 Nano 高出 9 分,与 OpenAI 的 gpt-oss-120b 相当,仅落后于规模约为其 4 倍的 Nemotron 3 Super 2 分。在代理任务相关的 GDPval-AA v2 评测上,它的 Elo 达到 824,超越 Nemotron 3 Super 和 gpt-oss-120b;在 Terminal-Bench v2.1 上拿到 24% 的成绩,而 Nemotron 3 Nano 只有 7%。在预发布测试中,其输出速度接近每秒 670 个 token。

模型足够多之后,路由成为新软件层

Lightning 的另一重差异化在于它开放且易于定制。企业可以在自己的硬件上,用 NeMo 针对专有领域数据、工具和工作流进行二次训练。

" 我们听到的是,Lightning 极易定制。" 英伟达生成式 AI 副总裁 Kari Briski 说。据她介绍,CodeRabbit 用英伟达的标准模型配方训练了一个 epoch,约两小时、花 85 美元就产出了一个路由智能体。另一个伙伴把 Lightning 直接放进已有的后训练栈," 无需任何改动 "。还有一个公司用单张 H100 卡就完成了训练,另一个干脆晚上跑训练任务,早上来取结果。

" 这正在把后训练和微调变成把碗放进洗碗机、然后按下启动键。"Briski 说。

英伟达同时放出了它的数据集、后训练数据集,以及训练模型所用的配方和框架。开发者可以把英伟达的后训练数据与企业自有数据混在一起,做出 " 取两家之长 " 的混合模型。" 这就是为什么我们看到人们很快得到很好的结果。"Briski 说。

NeMo Switchyard 是一个开源的模型路由库。它会考虑当前有多少模型可用、各自能力如何,在智能体工作流的每一步,把请求路由到当时最合适、最高效的模型。开发者可以根据质量、延迟、成本等优先级,自定义路由策略。

对未来的多智能体系统而言,真正重要的或许已经不是 " 哪个模型最好 ",而是哪个任务该由哪个模型完成。企业不必让每一个任务都用最贵的模型。英伟达与 Boomi、Cadence Design Systems、Classmethod、Cognition、Kong、Langchain、Nous Research、Siemens 等一批生态伙伴合作,把智能路由接入开发者已在使用的工具。

把 Lightning 和 Switchyard 放在一起看,英伟达的判断清晰可见,随着模型数量越来越多,模型之间的调度和协同会成为新的软件层。

从 Nemotron 4 到与 OpenAI 的微妙关系

这两次发布只是英伟达开源模型战略的局部。Nemotron 3 家族去年 12 月推出,当时有三个尺寸,Nano、Super、Ultra。据 The Information 报道,英伟达正在开发下一代 Nemotron 4,目标参数量至少 1 万亿,约为其现有最大模型 Nemotron 3 Ultra 的两倍,旨在与全球顶尖开源模型比肩。

它还组建了一个包含 Reflection、Cursor、Thinking Machines、Mistral 等在内的 "Nemotron 联盟 ",多方在推进自身模型的同时,向 Nemotron 4 贡献训练数据、评估支持和设计方案。

这背后是英伟达微妙的处境。其芯片需求高度集中于 OpenAI、微软、SpaceX 等少数前沿实验室和云服务商,而英伟达已向 OpenAI 投资 300 亿美元;另一边,Nemotron 4 恰恰定位为企业提供成本更低的替代方案,与这些前沿实验室形成竞争。它一边给客户供芯片,一边下场造模型,边界正在变得模糊。

不过对英伟达而言,这未必是零和游戏。AI 模型评测机构 Arena 的首席执行官 Anastasios Angelopoulos 的一句话点破逻辑," 无论哪家公司做出优秀的开源模型,英伟达都是赢家。" 开源生态越繁荣、参与主体越多元,GPU 的整体需求就越旺盛。

英伟达的角色正在从卖芯片的,变成卖整个 AI 工作流的。只要模型跑在英伟达的路由、推理和部署体系里,无论企业最终选择谁的模型,它都能从整个工作流中获得价值。这才是 Switchyard 与 Nemotron 3.5 放在一起发布的真正含义。(本文首发钛媒体 APP,作者 | 硅谷 Tech_news,编辑 | 秦聪慧)

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容