关于ZAKER Skills 合作
钛媒体 28分钟前

李飞飞的 Atlas,为具身智能推开新世界大门

文 | 超前实验室,作者 | 青苹吹果,编辑 | star 皆空

" 世界即所发生的一切。"

这是路德维希 · 维特根斯坦在 1921 年出版的《逻辑哲学论》中写下的名言。一个世纪后,这句话被 AI 领军人物之一李飞飞引用,而她创办的 World Labs 正在让 AI 理解空间。前段时间,World Labs 发布新一代世界模型 Atlas,官方称其为 " 全球首个 " 能同时处理文字、图片、视频和 3D 的多模态世界模型。

来看 demo,十分惊艳:喂进两三个视角的照片,它能重建出整个场景,再让镜头飞到从没人站过的位置。

这无疑为行业打开了新世界大门:

长期以来,传统 3D 重建高度依赖密集拍摄,必须围绕场景进行多角度、高覆盖率的图像采集,才能拼合出相对完整的模型。这种方式对设备、时间和人力要求极高,导致 3D 内容生产始终难以规模化,门槛居高不下。

Atlas 正在改变这一范式。依托大模型的强大先验知识与生成能力,它仅需少量普通手机拍摄的图像,就能实现高保真 3D 重建。

由此,3D 内容创作的门槛被大幅拉低,无需专业设备,也无需密集采集,海量旧照片、旧影像都有机会转化为可用的 3D 资产,沉睡的数据潜力被重新激活。

不止于此,传统 AI 生成模型主要服务于影视、游戏等创意产业,核心是生成 " 看起来逼真 " 的内容;

而 Atlas 通过构建可交互、可推演的 " 世界模拟器 ",将 AI 生成能力拓展至机器人领域,即 Real-to-Sim。

它让生成结果不再只是静态画面,而是能够被进入、被操作、被验证的动态环境。

在机器人领域,这意味着机器人可以在 AI 生成的模拟环境中进行海量试错与策略训练,通过 " 想象 " 预测不同动作可能带来的后果,在虚拟世界中快速积累经验,再迁移到真实世界。

这直击机器人真实世界训练数据匮乏、采集成本高昂的核心瓶颈,为具身智能提供了一条低成本、高效率、可扩展的训练路径,也将加速机器人从实验室走向现实应用。

给 Atlas 一张照片,TA 能造出一个世界

先来看 Atlas 干了件什么事。

过去两年,视频生成模型的相机控制全靠玄学抽卡。

你给出一句话或一张图,TA 顺着往下想象画面,镜头怎么动基本靠提示词碰运气,生成的画面次次不一样。

而 Atlas 换了底层逻辑,把 " 相机 " 直接做进了模型。

相机位姿参数作为原生输入,要什么角度什么轨迹,直接喂数据给坐标。

World Labs 将这套机制称为 " 空间上下文 ",每一张送进模型的图片,都会被锁定在三维空间里的某个具体坐标上,相机的姿态和深度信息,也连同图像一起被带进模型。

模型手里拿的不是一叠孤立的照片,而是一张带坐标的世界草图。

于是你就能像坐进导演椅一样调度它。

官方 demo 里最出圈的一段,是用三到五台普通手机拍同一瞬间,模型就能冻结时间、把镜头绕进牛奶溅起的那一刻。

放在二十多年前,《黑客帝国》那个子弹时间镜头靠的是上百台相机围着绿幕棚转圈,如今几台手机就能复刻个大概。

3D 重建方面也是同样惊艳。

按 World Labs 官方博客的说法,斯坦福主方庭那段航拍,输入只是 2 到 25 张站在地面随手拍的游客照。

传统三维重建讲究把每个角落都拍全,围着场地转几百圈是家常便饭;Atlas 给三五张、几十张就能交差。

看到这里,你可能会大受震撼,感叹现在的 AI 已经开始懂物理世界了!

但其实不然。

官方在博客和访谈中说了两件事:一是 Atlas 已经在几何层面做到了 " 空间上下文 " 理解,二是团队的长远目标是让模型最终理解物理规律。很多人把两者混为一谈。

可几何和物理压根不是一回事。

几何是入场券,物理才是难关

几何和物理的区别在哪里?

几何回答 " 东西在哪、长什么样、换个角度还是不是原来的形状 ";物理则是回答 " 推它一下会怎么动、会不会倒、捏多重会碎 "。

Atlas 这次惊艳的部分,基本全落在几何这一栏,碰撞、摩擦、形变这些要真物理的活儿,官方 demo 里几乎没有体现。

而 World Labs 本身也清楚这一点。

他们今年 6 月发过一篇梳理世界模型的长文,开篇就自嘲 " 世界模型是当下 AI 圈被用得最滥的词 ",接着按功能把各类产品划成三档:只会吐画面的渲染器、能吐出经得起检验的物理状态的模拟器、直接输出动作的规划器。

照这把尺子量,Atlas 只是从「渲染器」往「模拟器」的方向迈出了一大步,可离真正懂物理还差距甚远。

过去评一个世界模型好不好,基本只看画面像不像,那类指标说白了是在比像素分布:模型完全可以生成逼真但物理上错得离谱的画面,照样拿高分。

但这两年开始换考卷了。

面向具身智能的评测 WorldArena,把 " 轨迹准不准 "" 物理遵不遵循 " 单拎出来当考题。

值得一提的是,今年 8 月底 WorldArena2.0 的首版榜单上,国内影溯的 InSpatio-Curious 拿下 77 个参评模型的总分第一。

而其画面质量分比第二名低了将近 9 分,居然还能照样登顶,这是因为轨迹精度、深度准确度、时空一致性这些硬指标把它抬了上去。

可见,在新考卷里," 画得美 " 越来越不值钱。

除此之外,还有由 UCLA、耶鲁、索尼 AI 与美国陆军研究实验室今年 1 月联合放出的 WorldBench,把物理概念拆开逐项考。

结论相当不留情面:所有被测模型在生成靠谱的物理交互这件事上,一个都没过关。

这样一看,Atlas 这份成绩单既没发论文,也没有 model card,对比数据出自官方自测,而且同场比较的对手只能拿文字描述运镜,它却握着精确轨迹,赢面天生占优。

更准确地说,Atlas 在官方设定的机位控制任务上展示了目前最强的能力。但它没有经过第三方物理评测,不能直接说它 " 懂物理 "。真正的物理关卡,Atlas 还没被严格考过;而 WorldBench 的结论是,现有模型在物理交互上都没过关。

既然如此,大家为什么还一股脑往 " 物理对不对 " 这个方向卷?

Atlas 为代表的新路径,有望成为具身智能 " 练功房 "

因为物理是否正确,是仿真数据生成能不能用的前提。

李飞飞在发布后的访谈里说:机器人眼下最大的瓶颈是数据,芯片还排不上号。

互联网上现成的文字、图片、视频管够,机器人却学不会这些,它需要的是 " 从这个角度、用这个力度捏下去会发生什么 " 这类带物理后果的经验。

但真实采集贵得离谱。

World Labs 的创始团队举过例子:过去想重建一个空间,专业采集员也得围着它拍几百上千张,换普通人上手,在一间屋子里转悠一两个小时是常事。

这套成本降不下来,机器人训练的数据就永远攒不够。

于是," 从仿真到现实 " 这套流程,从实验室的冷门话题变成了兵家必争之地:

先把真实环境快速搬进虚拟世界,再批量做随机化,电线换个方向弯、杯子换个颜色摆、光照随时变,让机器人在虚拟环境里把该踩的坑先踩一遍。

World Labs 今年 7 月悄悄把专攻机器人仿真的 SceniX 收进囊中,Atlas 正是这条战略第一次以模型形态落地。

而把镜头拉长一点,你会发现给 AI 造 " 练功房 " 这件事,人类其实练了很多年。

上世纪 30 年代,美国人埃德温 · 林克捣鼓出第一台像样的飞行模拟器,二战期间数十万盟军飞行员先在模拟舱里摔够了,才被允许登上真机。那会儿连晶体管都还没影儿,全靠机械装置硬模拟仪表反应。

到了自动驾驶时代,这套打法卷土重来:Waymo 曾公开披露,它的系统在虚拟环境里跑出的测试里程,比真实路测高出两个数量级不止。

飞机靠模拟舱练出飞行员,汽车靠仿真路练出老司机,如今轮到 AI,它要练手的对象是整个物理世界。

把历史看明白了,再看资本的动作就不难懂。

这两年涌进世界模型赛道的钱以百亿计,资本赌的早不是哪家的画面更漂亮,谁能用最低成本把真实世界搬进模型、让 AI 在里面反复试错,谁就站在下一代 AI 的上游。

而 Altas 的方向,有望让数据采集和仿真成本断崖式下降,使得初创公司无需依赖巨额硬件投资即可完成机器人训练,有望推动 " 仿真优先、真机验证 " 新范式普及。

AI 要想真正理解物理世界,还为时尚早。

但 Atlas 至少证明,几何做对这件事,是个可以被工程化解决的,而且一旦做对,立刻能变成产品力。

世界模型的竞赛,正在从 " 谁生成的画面更像真的 ",转向 " 谁生成的状态更经得起算 "。

从渲染器到模拟器,这一步跨过去,AI 才算真正摸到物理世界的门。

Atlas 是把门推开了一条缝,物理 AI,终于有了第一块踏脚石。

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容