关于ZAKER Skills 合作
雷科技 10小时前

首次把时间纳入模型!小鹏第二代 VLA 全新版本来了,成为物理 AI 公司?

雷科技汽车组 | 编辑:失魂引 | 监制:罗超

8 月 27 日,小鹏物理 AI 分享暨第二代 VLA 全新版本体验日活动中,小鹏汽车详细介绍了第二代 VLA 全新版本的技术路线,雷科技 / 电车通受邀到现场参会。

据小鹏集团通用智能中心负责人刘先明介绍,第二代 VLA 全新版本升级的核心,是首次把「时间」纳入模型,让 AI 理解世界的维度从「3D 空间」跃迁到「4D 时空」。空间告诉模型世界是什么样,时间告诉模型世界正在发生什么。

(图源:雷科技 / 电车通现场摄制)

全新引入 Infini-VLA 长时序架构,能够记忆前 30 秒的世界,模型在做决策时可结合更长的上下文有效信息。

X-Foresight 预测世界模型则可以预测未来 6 秒会发生什么,比如通过相邻车道车辆的动向,推测其会不会加塞,根据前车的速度变化,推测其会不会停车等等。

基于 Infini-VLA 和 X-Foresight,小鹏第二代 VLA 全新版本实现了单一确定性到多解的升级,再经过强化学习,模型生成的轨迹更加自然、拟人。

传统智驾模型是「看 - 算 - 输出 - 再看」逻辑,第二代 VLA 全新版本则是「边看 + 边想 + 边做」。为了让模型决策速度跟上环境的变化速度,第二代 VLA 全新版本还加入了流式自回归推理,端到端的响应提速 300%。

(图源:小鹏)

刘先明还提到,端侧算力终究是有限的,模型的泛化能力却与参数量息息相关。第二代 VLA 全新版本在模型参数量提高 3.5 倍,达到主流 VLA 的 1.5 倍以上的同时,还引入了 MoT 混合架构。

MoT 架构拆分完整 Transformer Block,保留全局联合共享注意力,不同 Transformer 子塔可以互相交换信息,负载均衡压力小于 MoE。

小鹏训练第二代 VLA 全新版本的数据,来自百万车队和十亿级数据资产,单次训练数据吞吐量比半年前增长 10 倍,并且模型可主动优化数据分布、识别异常数据,不断挖掘长尾数据,提高模型能力上限。

不仅如此,小鹏还用做机器人的方式重构车机大脑,推出了 Master Agent,将 VLA 与 VLM 融合。基于 Omni 全模态模型,Master Agent 能更准确的理解自然语言和模糊语义,并主动将用户的语音指令拆分成任务。通过语音指令,用户可以控制车辆停车、泊车、导航,并加入途经点。

这一整套基座贯穿了 L2 到 L4,既可以向上触及 L4 级自动驾驶,还能向下蒸馏以兼容更多车型。甚至,该基座打通了汽车与机器人,小鹏人形机器人 Iron 搭载 3 颗图灵 AI 芯片,端侧部署该模型后无需遥控即可主动完成任务。

另外,图灵 AI 芯片可搭载 XLLM 通用大模型计算框架,在单颗芯片上进行独立推理任务,平均推理速度能达到每秒超过 20tokens。

看到这里,相信小鹏车主们最关心的是什么时间能用上第二代 VLA 全新版本,这次小鹏没有让我们久等,第二代 VLA 全新版本和第二代 VLA Lite 蒸馏版都将于 9 月开启推送,前者面向 Ultra 和 Ultra SE 车型,后者面向搭载单颗图灵芯片的 Max 版车型,小鹏 G9L 首发搭载第二代 VLA 全新版本和第二代 VLA Lite 蒸馏版。

今年第一季度,「小鹏汽车」升级为「小鹏集团」,新能源汽车、飞行汽车、Robotaxi、人形机器人业务全面铺开。此时的小鹏,需要一套可以打通全场景、全品类的 AI 基座。

显而易见,第二代 VLA 全新版本就是这样一套基座,它实现了模型理解能力从空间到时间的跃迁,能够记忆 30 秒超长有效时序,并预测未来 6 秒周围物体的运动轨迹,确保了汽车产品自动驾驶的安全性,还能让人形机器人自主完成任务。

第二代 VLA 全新版本的到来,才让小鹏真正从车企进化成「物理 AI 公司」。

End

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容