关于ZAKER Skills GEO服务 合作
autocarweekly 34分钟前

GPT-6 Astra,没能攻破机器人公司的护城河

文|三少爷

最近一两年,OpenAI、Anthropic 每发一款大模型,具身智能的研究者都会把它接进机器人本体试下成色。每试一次,机器人公司都会松一口气:不过尔尔嘛。但这一次,似乎狼真的来了。

这回的主角,是 GPT-6 Astra。有人把它接上车,让它自己看路、打方向,跑完整段封闭场地测试,媒体说它 " 考过了科目二 ";斯坦福大学的研究人员给它接上宇树 G1,进厨房收拾、干活,新环境没采数据重训,就干成了;银河通用拿它做具身操作——在公开评测基准 RoboDojo 上,GPT-6 Astra 加上 π 0.5 的混合模式下,十个任务平均得分 62.6,领先第二名近一倍。

一个并非为机器人造的通用大模型,正零训练地接管 " 机器人大脑 " 那份活:看懂环境、做决策、调度动作。有人甚至叫它具身智能的 " 银子弹 " ——机器人公司再也不用苦哈哈攒数据、训专用模型了。可它真是那颗银子弹吗?

GPT-6 Astra,表现惊艳但有短板

GPT-6 Astra 开上真车、接进机器人收拾厨房,这件事本身不是噱头。通用大模型驱动机器人做事,早有先例—— 2024 年 Figure 01 就接上 OpenAI 的 GPT-4V 视觉语言模型,做过能对话、能多步推理执行的演示,但那一代的泛化与成功率都很有限。GPT-6 Astra 这一回,是把成功率与跨环境泛化能力大幅推高:零训练跨环境、靠上下文自我修正、连真车都能从第一次失败里学出第二次策略——这一步,值得认真看待,而不是一句 "Demo 罢了 " 就可以打发掉的。

但 Demo 和能用的产品之间,隔着实打实的工程门槛。把 GPT-6 Astra 在成本、实时性、精细操作三个维度上拆开看,它的天花板清晰可见。

先说成本。DrivingBench 让 GPT-6 Astra 控制一辆真车跑完 134.7 米的封闭道路,单次驾驶烧掉约 660 万 Token,按模型价格算成本约 7.74 美元。单公里大几十美金,显然不是能摊到量产自动驾驶车辆上的成本结构。通用模型按 Token 计费,而物理世界的动作是连续的、稠密的,需要海量的 Token 消耗,这笔账算不过来。

再说实时性。DrivingBench 的这次测试里,平均车速只有 0.42 米 / 秒,大约每小时 1.5 里,这是一个让乌龟都发笑的速度。GPT 6 Astra 的反应周期以秒计,而真正的自动驾驶要的是毫秒级的感知与控制。斯坦福的 HomeBody 项目也证实了这一点—— GPT Astra 的推理延迟会在每一次技能切换之间制造停顿。

最难的是精细操作。在银河通用的评测里,Astra 直接模式(不搭配 π 0.5)在高精度接触、稳定抓取上的成功率断崖式下降。至于原因,斯坦福在报告里解释得很直白—— HomeBody 的导航,以地图坐标里的 2D 目标点和朝向点为基准,单位是米。米级精度意味着它只知道 " 大概到哪 ",能在封闭的无人场景里把车开到终点,却做不了厘米级的高精接触与稳定抓取。

把这些摆在一起:成本按 Token 计费、实时性卡在秒级、精细操作停在米级——这三道坎,恰好都是具身智能要量产落地必须跨过去的坎。云端大脑与端侧具身大模型相比,在实时性、成本、以及对物理空间的精细感知与操作能力上全面落后,它不会成为主流路线。能扛起具身智能的,终究是那个和本体贴在一起、跑在端侧、和毫秒级控制长在同一块板子上的大脑。

分层架构,挑战一段式端到端

通用大模型接入机器人、开上车,最容易被误读成 AI 巨头要来抢自动驾驶公司和机器人公司的饭碗了。但技术上的真问题其实是,具身大脑该选择什么样的架构。

跟自动驾驶探索技术路线时曾经经历过的大乱战一样,具身大脑的架构设计,目前分化成了两条技术路线。

一条是一段式端到端——把视觉、语言、动作放进同一个模型,从识别物体一路学到完成动作。这条路线在自动驾驶领域已经成为不容讨论的共识,甚至被当成了第一性原理。另一条是分层双系统:系统 1 负责快思考,执行抓取、移动、轨迹追踪,通常由连续动作策略实现;系统 2 负责慢思考,理解任务、做长程规划、在关键节点纠错和恢复,通常由 VLM 实现。

GPT-6 Astra 评测把这场争论搅得更凶了,它用一份榜单,把两条路线摆到了同一把尺子下:比谁的叙事动听,不如比谁在真实任务上更能打。看 RoboDojo 评测里的数据:混合模式下,Astra 的十任务平均分数 62.6,而 Xiaomi R1 只有 33.97,π 0.5 更是只有 24.43。一个接进机器人本体的强系统 2,把分数拉高了一倍左右——这既说明一段式端到端架构的 VLA 模型能力确实不够看,也说明强大的系统 2 有多关键。

不过,系统 2 如果直接绕过系统 1,即采用直接模式,精细操作会拉胯,十任务平均分数由 62.6 直接掉到了 37.83。既然都带了 Astra,显然其中的差别不在 Astra 聪不聪明,而在有没有一个能精准联动语义和动作的队友。更值得一提的是,即便没有能精准联动语义和动作的系统 1(VLA),Astra 直接模式的表现也超越了 Xiaomi R1 和 π 0.5,这表明,分层架构非常值得认真做下去——让快的管快、慢的管慢,比逼着一个模型把两件事都干利落更现实。

除了 GPT Astra 能不能绕开系统 1 的问题,更重要的还有怎么克服端侧部署的重大挑战。前面说的是架构选择,这里说的是算力现实。

云端基座动辄万亿参数,端侧芯片装得下的只有百亿量级,差着两个数量级。而把大模型压小的蒸馏这条路,历史上从来只有几倍压缩。小鹏把云端 720 亿的基座蒸馏到端侧百亿出头,七倍上下的蒸馏幅度已经很激进了,拿智谱的 GM-5.3 和其 Flash 版本做对比,压缩幅度只有 2.3 倍而已。所以,万亿参数的云端大脑,蒸馏不成端侧百亿的模型,这可不是工程上「再优化一下」就能解决的。那么好解决,咱不早就对 OpenAI、Anthropic 弯道超车了嘛,还成天就到底是落后三个月还是六个月吵个啥?

机器人公司的护城河

蒸馏不易,是不是可以认为机器人公司可以高枕无忧矣?当然不是,OpenAI 掌门人奥特曼最近在播客里把话挑明了:" 我们肯定会研发人形机器人 "。言外之意清晰无比:OpenAI 迟早会为具身智能定制一款大模型。它不会是 GPT-6 这种万亿参数体量,而是千亿级别;再叠上端侧芯片算力升级、几倍压缩,他们完全可能做出效果惊艳的几百亿参数端侧模型。当事情真的进展到了这一步,机器人公司的考验就真的来了:当 AI 王者把聪明的脑袋塞进机器人的身体里,它们的护城河到底在哪里?

只讨论大脑、模型,机器人公司的前景当然是领盒饭、提前下线。但是,模型本身只是机器人这个产品中的其中一层。真正把一家公司留在牌桌上的,是它对场景的死磕和对 Know-How 的掌握。这是从现场一点点磨出来的隐性知识——机器人公司和客户要一轮轮交流迭代,在每一次争吵、争辩里试错,信任也在磕碰中建立,最后才沉到对方的生产环节和作业内部。靠着深厚的客户关系,机器人公司才得以摸得到客户内部的深海数据;而这中间又时常纠缠着股权交叉、控股与投资,全是技术之外的功夫。

这些工作的结晶最终沉淀成了数据——行业里叫它暗数据。这些不是能从网上爬下来、从市场买过来的东西。它们只能靠一天天站在现场、一个个项目跑出来:哪次抓取失败了、哪次错误被救回来了、客户那条不愿外传的业务流程长什么样。暗数据从不会出现在公开榜单上,它只沉淀在企业自己的系统里。

把这点放到宁德时代和理想汽车的拉扯里看,会格外清楚。理想汽车掌门人李想曾解释,为什么电池不再选用宁德时代——理想希望供应商把数据和定义跟他深度互通。可在 AI 时代,数据是最核心的资产和命根子。宁德时代宁可丢掉理想这位大客户,也要守住自己的数据防线。同理,机器人公司手里那些在千辛万苦之中积累的场景暗数据,也是 OpenAI 这类公司无法轻易突破的防线。

写在最后

银子弹的说法,从一开始就把模型的能力当成了产品的能力,这是典型的以偏概全。

GPT-6 Astra 确实把机器人的 " 大脑 " 顶到了没人到过的高度,可它顶高的也只是大脑;真正让一家机器人公司最终立足的,不只在模型身上,更在脚下那块具体的场景——产线的节拍、料箱的种类、跟客户们一场场交流磨出来的信任,这些东西一天天攒成暗数据,通用大模型巨头买不到,也爬不下来。

这次狼来了的争论愈辩愈明,也让所有人看清,AI 时代最底层的资产是数据。谁站在现场、握着数据,谁才能最终留在牌桌之上。

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容