判断一个世界模型好不好,最直观的办法不是看它生成的画面美不美,而是看它推演几十帧之后,桌子还在不在原来的位置、光线的方向有没有突然改变。这类被称为场景漂移的失效,是长视频生成里最难缠的问题。WorldArena 2.0全球终榜近日揭晓,成都企业考拉悠然旗下的悠然无界世界模型在Track 1视频质量赛道获得全球第二,并在背景一致性与JEPA相似度两项核心指标中位列第一。
WorldArena是具身智能领域的评测榜单,由清华大学牵头,联合普林斯顿大学、新加坡国立大学、北京大学等8所学术机构共同研发。本次评测汇集了来自阿里巴巴、中国科学院等科技企业、科研机构及具身智能公司的80个模型,围绕世界模型的视频生成质量、时序一致性与物理演化能力展开统一评估。
指标体系分为视觉质量、运动质量、内容一致性、物理遵循性、3D空间准确性和可控性六大维度,另设数据引擎、策略评估器、动作规划器三类具身应用任务,主要考察感知精度、对物理规律的理解、三维空间认知以及动作预测四方面能力。
两项第一都落在长时推演的稳定性上。背景一致性居首,意味着模型能在整段生成过程中稳定维持全局环境与场景布置,不会推演到几十帧后让背景纹理、光照或物体摆放悄悄改变。JEPA相似度的含金量更高,它不比对像素,而是在高层表征空间中度量生成结果与真实世界演化过程之间的距离,考察场景语义、物体状态与动作变化是否被正确保留。两项叠加指向同一个结论:模型不只是画得像,而是学到了物理世界随时间演化的规律。
长时推演的困难可以拆成两个来源。一是误差累积:每一帧的微小偏差都会成为下一帧的输入,推演越长偏差越被放大,最终画面偏离原始场景。二是分布漂移:当模型遇到训练数据里没见过的环境,内部表征会偏离有效区间,输出的物理规律随之失真。
针对这两个问题,团队做了两层架构设计。据官方介绍,悠然无界世界模型基于结构化4D世界建模与动态场景记忆等技术,前者为场景建立带时间维度的结构化表示,让物体与空间关系在推演过程中保持约束;后者负责记住已经建立的环境状态,避免后续帧重新猜测背景。
从产品演进看,这条路线经过了三次迭代验证。2025年7月公司首发1.0版本;2026年5月2.0版本稳居WorldArena 1.0榜单前列,其中开源版本拿下Track 1第一,闭源版本第二;2026年9月3.0版本在WorldArena 2.0中再度领先,两项核心指标均列全球第一。连续三个版本在同一榜单上保持竞争力,说明成绩不是单次调参的结果。
榜单成绩之外,更值得关注的是落地路径。基于悠然无界世界模型构建的通用具身智能体Geek Mind已被集成到四足机器人平台,面向大型央企制造车间提供巡检解决方案。世界模型在这里承担的是预演与判断功能:机器人在行动前先在内部推演动作后果,降低真实环境中的试错成本。
公司把这条技术路线概括为三跨能力。空间无界指模型在现实世界与虚拟世界之间都能感知空间,并把感知、理解、行动、反馈连成持续循环;任务无界指把去检查那个有异响的设备这类长程模糊指令自主拆解为可执行队列;本体无界指认知能力可以在四足机器狗、轮式底盘与无人机之间无缝迁移。
三跨里最难的是本体无界,因为它要求模型学到的不是某个特定机身参数下的动作,而是与形态解耦的空间与物理常识。这也是世界模型被视为具身智能底层技术的原因:没有它,每换一种机器人本体就要重新采集数据、重新训练策略。
落地案例不止一个。考拉悠然与长虹科技共同研发的智能导购机器人已应用于线下门店,与成都交投信息科技合作的智能机器狗在2025世运会期间亮相世运村。公司由20余位海内外名校博士联合创立,具备底层模型自研能力,深耕边端小参数模型与私有化工程部署,拥有200余项核心专利及知识产权。
WorldArena的排名变化本身说明了赛道的热度。今年5月底,智元机器人的GE 2.0登上Track 1榜首;6月,中国科学院工业人工智能研究所宣布自研的PAIWorld登顶该榜单;到9月的2.0终榜,考拉悠然在两项核心指标上领先。头部名次在几个月内多次变化,说明各家技术路线还没有收敛。
更值得留意的是评价重心的移动。榜单研究团队在论文中指出,视觉质量高并不必然意味着具身任务能力强,这也是榜单把看起来像与用起来行分开评测的原因。市场关注的焦点也从能不能生成场景,转向能不能实时交互、低成本普及、能否适配产业真实需求。
对国内团队来说,这个转向既是机会也是压力。机会在于产业场景与数据供给的优势可以转化为模型迭代速度,工业、交通、城市管理等场景提供了大量真实约束;压力在于客户不会为榜单名次付费,只会为能替代人力、能降低试错成本的方案付费。世界模型要证明自己,最终要在车间与街区里跑出可复制的成绩。