智象未来发布交互式世界模型,一键生成可漫游可编辑的完整3D世界

首页 / AI资讯 / AI建模

0:00
0:00
1x
定时

从生成视频到生成世界,AI在理解物理规律的道路上迈出关键一步。8月17日,合肥人工智能企业智象未来(HiDream.ai)正式发布原生全模态交互式世界模型HiDream-O1-World。与传统视频生成模型主要生成连续画面不同,交互式世界模型需要用户在不断移动视角、改变环境和操控角色的过程中,持续保持场景稳定,并让物体运动符合现实世界的基本规律。HiDream-O1-World支持文本、图像及交互式操控等多模态输入,提供漫游、编辑、交互三类核心能力,用户可以第一人称或第三人称视角在场景中自由行走,驱动角色完成抓取、奔跑、跳跃等动作,甚至触发降雨、物体坠落等动态事件,一键生成一个可持续探索和交互的数字世界。

WBench登顶背后,时空一致与物理一致的双重攻坚

HiDream-O1-World亮相即登顶,第三方评测数据颇为亮眼。在美团LongCat团队与复旦大学联合推出的交互式视频世界模型评测基准WBench中,该模型以平均分80.9分位列Navi分榜第一,其中物理维度得分73.3分排名第一,一致性维度得分88.0分位居前列;相比参测模型平均水平,视觉合理性提升13.6%,因果保真度提升12.7%。Navi分榜考察的是模型在交互漫游过程中的场景稳定性与物理合理性,这一成绩意味着模型在镜头移动、视角切换时,场景几何结构保持高度稳定,物体不会消失或变形,碰撞、遮挡、重力响应也高度符合真实世界的因果逻辑。

支撑这一成绩的,是智象未来自研的原生全模态UiT架构。针对交互式世界模型公认的两大核心技术挑战,即长时程时空一致性与物理一致性,模型通过"3D先验注入Memory上下文"与"Test-Time Training在线维护"的协同设计解决:前者让模型在生成过程中持续记录场景的几何结构、物体位置及空间关系,减少镜头移动过程中的物体漂移、形变或消失;后者在推理阶段根据当前场景进行轻量级在线自适应,持续维护物理合理性。

在物理一致性方面,模型训练阶段引入了大量物理模拟数据,覆盖刚体碰撞、流体运动、柔性形变、重力抛射及光影变化等场景,同时强化跨帧时序因果建模,让物体间的相互作用符合常识物理。这种"训练数据+推理机制"双管齐下的路线,让模型在因果保真度上取得显著优势,也为后续在具身智能仿真、AI互动影游等场景的应用奠定了基础。

从造物到造世界,三大能力重构3D内容生产范式

漫游、编辑、交互,是HiDream-O1-World区别于传统视频模型的三大核心能力。漫游能力支持第一人称和第三人称视角切换,用户可自由驱动角色行走并调整视角方向,在3A游戏、虚拟展厅、文旅导览等场景中可以直接作为可探索的虚拟环境使用;编辑能力允许用户实时驱动角色完成抓取、奔跑、下蹲、跳跃等动作,或触发降雨、物体坠落等动态事件,为内容创作者提供了"可操控的拍摄现场";交互能力则支持人类、动物、虚构角色等多种角色构建,覆盖真实城市场景、自然地貌、室内空间以及二次元、游戏渲染等多种风格。

这一范式变化对3D内容生产的意义深远。传统3D内容制作依赖人工建模、动画绑定、渲染等繁琐流程,成本高、周期长;而交互式世界模型让用户通过文字、图片或简单交互即可生成完整世界,并自由漫游、操控角色和改变环境,将3D内容的生产门槛压缩到"一句话"级别。对于游戏开发者、影视创作者、虚拟制片团队而言,这意味着可以快速生成可交互的场景底稿,大幅提升前期创意验证与预演效率。

智象未来CTO姚霆在发布时表示,交互式世界模型的价值,不在于生成一个逼真的三维场景,而在于AI开始真正理解空间的深度、物体的质感、运动的惯性与光影的逻辑,这是对物理世界运行规律的系统性认知与重塑。这一判断点明了世界模型的技术本质:从"渲染画面"走向"构造世界",模型内部需要具备3D空间表征,并能预测"动作的后果",这正是世界模型与传统视频生成的分水岭。

瞄准具身智能与影游,世界模型的产业落地图景

在应用层面,HiDream-O1-World的产业定位十分清晰。其一是具身智能仿真:模型可生成城市、工厂、室内等虚拟环境,为机器人、自动驾驶及智能制造提供高精度的仿真训练底座,让具身智能体在虚拟世界中完成海量试错,再迁移到真实场景,大幅降低数据采集与训练成本;其二是AI互动影游:模型为互动影视、剧情游戏提供分支剧情演进能力,玩家可以与场景、角色实时交互,获得沉浸式的叙事体验;其三是3D场景生产:模型可快速生成和编辑不同类型的3D场景,辅助游戏资产、虚拟制片、空间设计等生产流程。

值得注意的是,世界模型赛道已吸引谷歌、World Labs、DeepMind等全球巨头押注,而国产厂商的入场正在改变竞争格局。HiDream-O1-World的发布,标志着中国团队在交互式世界模型这一前沿方向站上了第一梯队。智象未来表示,随着开发者与创作者不断加入,交互式世界模型的应用边界将远超当前所能描绘的范围,公司将持续推动原生全模态架构技术路线的纵深发展,构建世界模型的核心技术壁垒。

从更宏观的视角看,世界模型被认为是通往通用人工智能的关键拼图。它让AI不再只是处理文本与图像的"信息处理器",而是能够模拟物理世界运行规律、预测行动后果的"世界模拟器"。当AI能够准确模拟世界的运行,它在科学研究、工业设计、机器人控制等领域的价值将指数级放大。HiDream-O1-World的发布,为这一宏大叙事提供了一个具体的、可交互的注脚,也让世界模型从概念走向了落地验证的新阶段。

素材来源:凤凰网科技、环球网、合肥日报、网易科技 发布时间:2026-08-19