关于ZAKER Skills 合作
全天候科技 11小时前

英伟达宣布 Groq 3 LPX 全面投产,Vera Rubin 推理效率数倍提升,SpaceXAI 加码智能体与太空 AI

英伟达正在加速把 AI 基础设施的竞争,从传统的模型训练和推理性能,推进到围绕智能体 AI(Agentic AI)的 Token 生成速度、能耗和成本展开的新阶段。

美东时间 24 日周一,英伟达宣布面向交互式 AI 推理的 Groq 3 LPX 正式全面投产。作为 Vera Rubin 平台的重要组成部分,Groq 3 LPX 主打超低延迟 Token 生成,英伟达称,在 Artificial Analysis 测试中,搭载 Gemma 4 31B 模型、100,000 Token 上下文时,Groq 3 LPX 实现每秒 3400 个输出 Token,为该模型创下最高纪录;针对智能体编程等低延迟工作负载,其响应速度最高达到最近竞争平台的 4 倍。

同时,英伟达公布 Vera Rubin NVL72 在真实智能体工作负载下的新测试结果:基于 SemiAnalysis 的 AgentX 工作负载、采用 DeepSeek V4 Pro 模型,Vera Rubin 每兆瓦(MW)吞吐量最高达到上一代 GB300 NVL72 的 30 倍,每 Token 成本最高降低 35 倍。英伟达强调,智能体任务不同于传统聊天或摘要,任务上下文会随着数百个步骤不断累积,甚至达到数十万 Token。

同一天,英伟达还宣布 SpaceXAI 将采用 Vera CPU 加速下一代智能体 AI 应用,并扩大基于 Vera Rubin 的平台建设,随着其算力规模向数 GW 扩张;此外,SpaceXAI 计划将优化版 Vera Rubin NVL72 延伸至太空,用于首代 Starmind AI 卫星。

Groq 3 LPX 全面投产,英伟达补齐智能体 " 最后一公里 "

英伟达此次将 Groq 3 LPX 正式推向全面生产,核心目的并不是用专用推理芯片取代 GPU,而是为 Vera Rubin 补充传统 GPU 架构在低延迟 Token 生成方面的能力。

对于智能体而言,一次任务往往不再是 " 一问一答 ":智能体需要读取文件、调用工具、执行代码、检查结果,再根据结果继续推理,可能循环数百甚至数千个步骤。在这一过程中,每一步 Token 生成的速度都会影响整个任务的完成时间。

英伟达称,智能体 AI 因此带来了两个不同的计算挑战:一方面需要高效处理不断增长的大规模上下文,另一方面需要以极低延迟持续生成 Token。Vera Rubin NVL72 负责更广泛的训练、推理以及上下文处理,而 Groq 3 LPX 则针对单用户交互速度进行优化,提升 Token 生成速率。

英伟达最新测试显示,Groq 3 LPX 在 Gemma 4 31B、100K 上下文条件下达到 3400 个输出 Token/ 秒;在智能体任务和其他延迟敏感型工作负载中,响应速度最高达到最近竞争平台的 4 倍。英伟达称,这种速度可以让智能体更快完成代码编写、测试、工具调用和结果验证等连续任务。

商业化方面,AI 云服务商 Nebius 将成为首个采用 Groq 3 LPX 的云厂商,并计划将其部署到 Nebius Token Factory 生产推理平台。Groq 也计划成为该平台最早一批采用者之一。

这意味着,随着 Groq 3 LPX 进入全面投产,英伟达此前收购 Groq 技术所形成的能力,开始真正嵌入 Vera Rubin 的数据中心产品体系。

30 倍不是 " 速度 "30 倍,而是每兆瓦能完成更多智能体工作

相比 3400 Token/ 秒这样的单项性能指标,英伟达此次更值得关注的,是其对每兆瓦吞吐量和 Token 成本的强调。

英伟达公布的测试数据显示,在 SemiAnalysis AgentX 工作负载下,Vera Rubin NVL72 每兆瓦吞吐量最高达到 GB300 NVL72 的 30 倍,对应每 Token 成本最高降低 35 倍。该测试使用真实的智能体编程轨迹,保留了实际的上下文增长、工具调用和子智能体生成等环节。

因此,每兆瓦吞吐量最高提升 30 倍只是 AI 推理效率大幅提升的一种体现,并不是单纯意味着芯片的推理速度提高 30 倍。

这一指标对于 AI 数据中心的意义尤其突出。

传统大模型服务更多关注单次请求的延迟和吞吐量,而智能体工作负载会持续消耗 Token。英伟达援引 OpenRouter 数据称,智能体 AI 工作负载消耗的 Token 数量可以达到简单聊天请求的 15 倍。原因在于,一个智能体可能先查询数据库,再搜索新闻和文件,调用子智能体进行分析,运行代码并反复验证,整个过程中上下文不断累积。

这也使得 AI 基础设施的经济性开始出现新的衡量方式:同样一兆瓦电力,到底能够完成多少有效智能体任务?

对于电力和数据中心资源日益成为 AI 扩张瓶颈的背景而言,提高单位电力能够产生的 Token 数量,可能比单纯提高峰值算力更加重要。

Vera Rubin 从 "GPU 平台 " 变成完整 AI 工厂

从架构来看,Groq 3 LPX 并不是孤立的产品,而是英伟达 Vera Rubin" 极致协同设计 " 路线的一部分。

英伟达此前已经将 Vera Rubin 定义为面向智能体 AI 时代的 AI 工厂平台。整个系统并非单纯由 GPU 组成,而是围绕计算、网络、存储和软件进行协同设计,涵盖 Rubin GPU、Vera CPU、Groq 3 LPX、BlueField-4 DPU、Spectrum-6 SPX 等不同组件。

其中,Rubin GPU 承担大规模训练、推理以及上下文处理等任务;Groq 3 LPX 负责高速 Token 生成;Vera CPU 则处理智能体在模型调用之间产生的大量 CPU 密集型工作,包括工具编排、代码执行、数据处理和模拟。

英伟达此前公布的架构信息显示,Vera Rubin 平台通过七款芯片和五种专用机架进行协同设计,目的就是让不同硬件分别承担最适合自己的任务,而不是让一类处理器包办整个 AI 工作负载。

这意味着,英伟达正在把 AI 基础设施从 "GPU 集群 " 进一步升级为一个异构计算系统

对于 AI 云厂商而言,这种架构的意义在于,可以针对训练、长上下文推理、Token 生成、工具调用等不同阶段进行资源配置,从而提高整座数据中心的利用率和经济回报。

SpaceXAI 加码 Vera:智能体 AI 从数据中心走向太空

就在 Groq 3 LPX 全面投产之际,SpaceXAI 也宣布进一步采用英伟达 Vera Rubin 体系。

英伟达 8 月 24 日宣布,SpaceXAI 将部署 Vera CPU,用于下一代智能体 AI 应用。Vera 专门针对模型推理之外的 CPU 工作负载进行设计,包括工具调用、代码执行、数据处理、任务编排和模拟。

Vera 采用 88 颗英伟达自主设计的 Olympus 核心,并配备高带宽 LPDDR5X 内存,带宽最高达到 1.2TB/s。英伟达称,在智能体 AI、强化学习和数据处理等工作负载中,Vera 任务完成速度最高可达到 x86 CPU 的 1.8 倍。

对于 SpaceXAI 而言,Vera 的价值并不仅仅在于提高 CPU 性能。

智能体运行过程中,大量任务发生在 GPU 推理之间,例如执行代码、处理数据、调用工具和协调不同智能体。如果这些任务由 CPU 处理速度不足,就可能导致 GPU 等待,从而降低整个 AI 工厂的利用率。

因此,SpaceXAI 希望利用 Vera 处理这些 " 模型之外 " 的工作,让 GPU 更多地专注于模型训练和推理,从而提高整个系统的效率。

SpaceXAI 同时计划扩大基于 Vera Rubin 的 Grok AI 基础设施,随着计算能力向数 GW 规模扩张;更进一步,该公司还计划将优化版 Vera Rubin NVL72 用于首代 Starmind AI 卫星。

这意味着英伟达的加速计算体系正在从地面数据中心向轨道计算延伸。

从 " 聊天机器人 " 到 " 自主执行 ",AI 算力需求正在换挡

从 Groq 3 LPX 全面投产,到 Vera Rubin 公布 30 倍每兆瓦吞吐量,再到 SpaceXAI 将 Vera Rubin 延伸至 Starmind 卫星,英伟达此次连续释放的信息背后,指向的是同一个变化:AI 应用正在从生成内容走向自主完成任务。

在聊天和摘要场景中,用户往往只需要模型快速给出一段文字;而在智能体场景中,模型需要持续推理、调用工具、执行代码、访问外部数据并不断验证结果。

这意味着,未来 AI 基础设施的核心指标也可能发生变化——从过去关注 " 训练一个更大的模型 ",逐渐转向关注单位电力能够产生多少有效 Token、单位成本能够完成多少任务,以及智能体完成一项复杂任务究竟需要多长时间

英伟达此次把 Groq 3 LPX、Vera CPU 和 Rubin GPU 放进同一套 AI 工厂体系,正是在针对这一变化重新设计基础设施。

而 SpaceXAI 则提供了一个更具想象力的应用方向:如果这套体系最终能够从地面数据中心延伸到轨道,AI 计算的边界也将不再局限于传统的数据中心机房。

全天候科技

全天候科技

提供专业快速完整的科技商业资讯

订阅

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容