关于ZAKER Skills 合作
雷锋网 2小时前

原生全模态世界模型:从模拟世界到交互世界

8 月 19 日,世界机器人大会(WRC 2026)期间,由跨维智能主办、《财经》杂志协办的 " 物理 AI 引领者论坛暨 2026《财经》中国 AI 100 榜单启动仪式 " 在北京举行。论坛以 " 物理 AI 进行时 " 为主题,汇聚具身智能领域的顶尖学者、企业创始人和一线技术负责人,共同探讨通用物理智能的技术演进与产业路径。

作为原生全模态世界模型代表企业,智象未来(HiDream.ai)创始人兼 CEO 梅涛发表了题为《原生全模态世界模型:从 " 模拟世界 " 到 " 交互世界 "》的主旨演讲。他从 AI 大模型的技术演进趋势出发,系统阐述了大模型从多模态走向原生全模态、从模拟世界走向交互世界的核心逻辑,为 Physical AI 的底层能力建设提供了新的技术视角与路径思考。

01 高 IQ 不等于全能:AI 从 " 理解世界 " 到 " 改变世界 "

梅涛博士在演讲中指出,过去几年 AI 大模型的发展可谓一日千里。从大语言模型到多模态模型再到具身智能,三条曾经独立演进的技术路线正在加速走向融合,2026 年被很多人称为 " 世界模型的元年 "。

他分享了一组数据:今年年初,顶级大模型的 IQ 水平约为 130,相当于中科大少年班天才的水平;而到如今,最新大模型的 IQ 已经接近 140。但梅涛特别强调了一个关键观点—— " 高 IQ 不代表全能 "。就像孩子成绩好不代表综合能力强一样,一个在考试中表现优异的模型,不等于能在真实物理世界中长期、稳定、可靠地完成任务。这正是 Physical AI 之所以重要的根本原因。

大语言模型强在对世界的理解、对知识的压缩和推理;多模态模型强在对世界的生成与预测;具身交互模型则强在与世界的交互。而真正的世界模型,需要同时具备对世界状态的完整表达、对物理规律和因果关系的推演,以及对世界的重构能力。从文本、多模态到具身,过去各自独立演进的三条路线,今天正在加速走向融合。

02. 从 DiT 到 UiT:原生全模态架构突破行业上限

基于自研 UiT(Unified Transformer)架构,智象未来近日正式发布了原生全模态交互式世界模型 HiDream-O1-World。该模型首次参评即在权威榜单 WBench 中登顶 Navi 分榜榜首。

HiDream-O1-World 支持文本、图像及交互式操控等多模态输入,具备漫游、编辑、交互三项核心能力,同时支持多种主体与风格化场景构建,可高度还原真实空间,也可生成二次元卡通、3A 游戏渲染等风格化世界。

从技术底层来看,HiDream-O1-World 的核心突破在于长时程的时空一致性与物理一致性,使模型在长时序交互中能够 " 记住 " 已探索的场景结构,在复杂交互中保持较高的物理合理性。

HiDream-O1-World 正在打开全新的产业应用空间:AI 互动影游中,用户成为叙事的主动参与者;具身智能仿真中,模型可搭建高保真虚拟训练底座;3D 场景生成中,创作者可高效生成结构完整的 3D 空间,大幅缩短创意到成品的迭代路径。

以此为起点,智象未来正围绕世界模型的定义持续拓展边界,逐步完善覆盖图像模型、视频模型及交互式世界模型等方向的模型矩阵。

03. 数据 · 模型 · 智能体 · 具身:连接物理世界的闭环

谈到具身智能的能力底座,梅涛博士将关键关系概括为:" 世界模型和具身智能的发展,需要把数据、世界模型、智能体和具身本体连接起来。" 其中,数据构建认知,世界模型负责理解世界状态、推演物理规律,智能体基于预测结果进行决策和规划,具身本体完成真实执行,而真实环境反馈又回流成为新的训练数据。由此形成 " 数据—认知—行动—反馈 " 的闭环飞轮。梅涛博士表示,世界模型正是这一飞轮中的认知中枢;没有高质量世界模型,仿真难以逼近真实物理,具身智能的数据飞轮也难以真正转动起来。

最底层是数据底座,包括 " 互联网的先验数据、仿真的物理试错数据、行动闭环的真实交互数据 ",三类数据缺一不可——真实环境的行动反馈,又会回流成为新的训练数据,驱动飞轮持续加速。以互联网先验数据为例,智象未来已积累近千万小时时长的视频数据。中间层是世界模型,作为具身智能的内核,推演世界规律、回答 " 世界是什么 " 和 " 接下来会发生什么 "。最上层是智能体与具身系统,基于世界模型的预测结果做自主决策,并由具身本体执行物理动作,完成从认知到行动的完整闭环。

梅涛博士特别强调了仿真数据在 Physical AI 中的价值。他以智象未来与诺亦腾机器人的合作为例:利用原生全模态大模型对真实采集的人体动作数据进行增强处理,可以生成大量符合物理约束的视频,即同一动作在不同背景、不同场景、不同肤色下均保持一致。这种数据增强能力可以大幅降低真实数据采集的成本和压力,让机器人先在仿真环境中学习,再到真实环境中操练。

这些实践的背后,是智象对未来 AI 演进方向的一贯判断:大模型让 AI 理解世界,智能体与具身系统让 AI 行动于世界,而原生全模态世界模型则将认知、行动与反馈连为一体,让 AI 真正具备在物理世界中持续学习与进化的能力。

从模拟世界到理解世界,从推演世界到交互世界,智象未来将持续深耕原生全模态世界模型,以技术创新与生态协同双轮驱动,既服务数字智能,也加速具身智能在真实物理环境中的训练与执行落地,助力 Physical AI 从技术探索迈入规模化、商业化的全新发展时代。

最新评论

没有更多评论了
雷峰网

雷峰网

读懂智能&未来

订阅

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容