文 | 超前实验室,作者 | 青苹吹果,编辑 | star 皆空
" 世界即所发生的一切。"
这是路德维希 · 维特根斯坦在 1921 年出版的《逻辑哲学论》中写下的名言。一个世纪后,这句话被 AI 领军人物之一李飞飞引用,而她创办的 World Labs 正在让 AI 理解空间。前段时间,World Labs 发布新一代世界模型 Atlas,官方称其为 " 全球首个 " 能同时处理文字、图片、视频和 3D 的多模态世界模型。
来看 demo,十分惊艳:喂进两三个视角的照片,它能重建出整个场景,再让镜头飞到从没人站过的位置。
这无疑为行业打开了新世界大门:
长期以来,传统 3D 重建高度依赖密集拍摄,必须围绕场景进行多角度、高覆盖率的图像采集,才能拼合出相对完整的模型。这种方式对设备、时间和人力要求极高,导致 3D 内容生产始终难以规模化,门槛居高不下。
Atlas 正在改变这一范式。依托大模型的强大先验知识与生成能力,它仅需少量普通手机拍摄的图像,就能实现高保真 3D 重建。
由此,3D 内容创作的门槛被大幅拉低,无需专业设备,也无需密集采集,海量旧照片、旧影像都有机会转化为可用的 3D 资产,沉睡的数据潜力被重新激活。
不止于此,传统 AI 生成模型主要服务于影视、游戏等创意产业,核心是生成 " 看起来逼真 " 的内容;
而 Atlas 通过构建可交互、可推演的 " 世界模拟器 ",将 AI 生成能力拓展至机器人领域,即 Real-to-Sim。

在机器人领域,这意味着机器人可以在 AI 生成的模拟环境中进行海量试错与策略训练,通过 " 想象 " 预测不同动作可能带来的后果,在虚拟世界中快速积累经验,再迁移到真实世界。
这直击机器人真实世界训练数据匮乏、采集成本高昂的核心瓶颈,为具身智能提供了一条低成本、高效率、可扩展的训练路径,也将加速机器人从实验室走向现实应用。
给 Atlas 一张照片,TA 能造出一个世界
先来看 Atlas 干了件什么事。
过去两年,视频生成模型的相机控制全靠玄学抽卡。
你给出一句话或一张图,TA 顺着往下想象画面,镜头怎么动基本靠提示词碰运气,生成的画面次次不一样。
而 Atlas 换了底层逻辑,把 " 相机 " 直接做进了模型。
相机位姿参数作为原生输入,要什么角度什么轨迹,直接喂数据给坐标。
World Labs 将这套机制称为 " 空间上下文 ",每一张送进模型的图片,都会被锁定在三维空间里的某个具体坐标上,相机的姿态和深度信息,也连同图像一起被带进模型。
模型手里拿的不是一叠孤立的照片,而是一张带坐标的世界草图。
于是你就能像坐进导演椅一样调度它。
官方 demo 里最出圈的一段,是用三到五台普通手机拍同一瞬间,模型就能冻结时间、把镜头绕进牛奶溅起的那一刻。

3D 重建方面也是同样惊艳。
按 World Labs 官方博客的说法,斯坦福主方庭那段航拍,输入只是 2 到 25 张站在地面随手拍的游客照。

看到这里,你可能会大受震撼,感叹现在的 AI 已经开始懂物理世界了!
但其实不然。
官方在博客和访谈中说了两件事:一是 Atlas 已经在几何层面做到了 " 空间上下文 " 理解,二是团队的长远目标是让模型最终理解物理规律。很多人把两者混为一谈。
可几何和物理压根不是一回事。
几何是入场券,物理才是难关
几何和物理的区别在哪里?
几何回答 " 东西在哪、长什么样、换个角度还是不是原来的形状 ";物理则是回答 " 推它一下会怎么动、会不会倒、捏多重会碎 "。
Atlas 这次惊艳的部分,基本全落在几何这一栏,碰撞、摩擦、形变这些要真物理的活儿,官方 demo 里几乎没有体现。
而 World Labs 本身也清楚这一点。
他们今年 6 月发过一篇梳理世界模型的长文,开篇就自嘲 " 世界模型是当下 AI 圈被用得最滥的词 ",接着按功能把各类产品划成三档:只会吐画面的渲染器、能吐出经得起检验的物理状态的模拟器、直接输出动作的规划器。

过去评一个世界模型好不好,基本只看画面像不像,那类指标说白了是在比像素分布:模型完全可以生成逼真但物理上错得离谱的画面,照样拿高分。
但这两年开始换考卷了。
面向具身智能的评测 WorldArena,把 " 轨迹准不准 "" 物理遵不遵循 " 单拎出来当考题。
值得一提的是,今年 8 月底 WorldArena2.0 的首版榜单上,国内影溯的 InSpatio-Curious 拿下 77 个参评模型的总分第一。

可见,在新考卷里," 画得美 " 越来越不值钱。
除此之外,还有由 UCLA、耶鲁、索尼 AI 与美国陆军研究实验室今年 1 月联合放出的 WorldBench,把物理概念拆开逐项考。
结论相当不留情面:所有被测模型在生成靠谱的物理交互这件事上,一个都没过关。
这样一看,Atlas 这份成绩单既没发论文,也没有 model card,对比数据出自官方自测,而且同场比较的对手只能拿文字描述运镜,它却握着精确轨迹,赢面天生占优。
更准确地说,Atlas 在官方设定的机位控制任务上展示了目前最强的能力。但它没有经过第三方物理评测,不能直接说它 " 懂物理 "。真正的物理关卡,Atlas 还没被严格考过;而 WorldBench 的结论是,现有模型在物理交互上都没过关。
既然如此,大家为什么还一股脑往 " 物理对不对 " 这个方向卷?
Atlas 为代表的新路径,有望成为具身智能 " 练功房 "
因为物理是否正确,是仿真数据生成能不能用的前提。
李飞飞在发布后的访谈里说:机器人眼下最大的瓶颈是数据,芯片还排不上号。
互联网上现成的文字、图片、视频管够,机器人却学不会这些,它需要的是 " 从这个角度、用这个力度捏下去会发生什么 " 这类带物理后果的经验。
但真实采集贵得离谱。
World Labs 的创始团队举过例子:过去想重建一个空间,专业采集员也得围着它拍几百上千张,换普通人上手,在一间屋子里转悠一两个小时是常事。
这套成本降不下来,机器人训练的数据就永远攒不够。
于是," 从仿真到现实 " 这套流程,从实验室的冷门话题变成了兵家必争之地:
先把真实环境快速搬进虚拟世界,再批量做随机化,电线换个方向弯、杯子换个颜色摆、光照随时变,让机器人在虚拟环境里把该踩的坑先踩一遍。

而把镜头拉长一点,你会发现给 AI 造 " 练功房 " 这件事,人类其实练了很多年。
上世纪 30 年代,美国人埃德温 · 林克捣鼓出第一台像样的飞行模拟器,二战期间数十万盟军飞行员先在模拟舱里摔够了,才被允许登上真机。那会儿连晶体管都还没影儿,全靠机械装置硬模拟仪表反应。
到了自动驾驶时代,这套打法卷土重来:Waymo 曾公开披露,它的系统在虚拟环境里跑出的测试里程,比真实路测高出两个数量级不止。
飞机靠模拟舱练出飞行员,汽车靠仿真路练出老司机,如今轮到 AI,它要练手的对象是整个物理世界。
把历史看明白了,再看资本的动作就不难懂。
这两年涌进世界模型赛道的钱以百亿计,资本赌的早不是哪家的画面更漂亮,谁能用最低成本把真实世界搬进模型、让 AI 在里面反复试错,谁就站在下一代 AI 的上游。
而 Altas 的方向,有望让数据采集和仿真成本断崖式下降,使得初创公司无需依赖巨额硬件投资即可完成机器人训练,有望推动 " 仿真优先、真机验证 " 新范式普及。
AI 要想真正理解物理世界,还为时尚早。
但 Atlas 至少证明,几何做对这件事,是个可以被工程化解决的,而且一旦做对,立刻能变成产品力。
世界模型的竞赛,正在从 " 谁生成的画面更像真的 ",转向 " 谁生成的状态更经得起算 "。
从渲染器到模拟器,这一步跨过去,AI 才算真正摸到物理世界的门。
Atlas 是把门推开了一条缝,物理 AI,终于有了第一块踏脚石。