AI世界模型补上物体恒存性这一课,用150万段视频训练出新能力

首页 / AI资讯 / AI建模

0:00
0:00
1x
定时

9月23日,一篇题为《在世界模型中训练物体恒存性》的论文出现在预印本平台上,作者共31人,其中包括来自牛津大学、耶鲁大学与Adobe研究团队的多位研究者。论文关注一个看似朴素却长期困扰视频生成模型的问题:当一个物体被遮挡后移出视野,模型是否记得它还在那里。当前的视频生成模型是应用最广泛的一类世界模型,它们经常在物体被挡住之后把它忘掉,一个球滚到箱子后面再也不出来,或者出来的时候变成了别的东西。

世界模型为什么会忘事

视频生成模型的工作方式是逐帧预测画面,每一帧都以前一帧或提示词为条件。这种机制在短片段里表现良好,一旦涉及遮挡与重现,就会出现状态丢失。模型没有维护一份关于场景里有哪些物体、它们分别在什么位置的显式记录,因此当某个物体暂时离开视野,它的信息就从上下文里滑走了。等它应该重新出现时,模型只能根据当前的画面线索临时生成,结果自然是变形或者消失。

这个问题在实际应用里的代价比想象中大。在点云与扫描场景中,遮挡不是边角情况,而是大部分场景的常态,一根柱子后面的东西占据了相当大的比例。对一个需要在三维空间里保持一致判断的世界模型来说,忘记被遮挡的物体意味着它无法支撑机器人导航、建筑巡检或者自动驾驶这类任务。这也是论文把物体恒存性单独拎出来研究的原因,它考察的不是画质,而是模型对物理世界的基本理解。

把一个心理学测试变成数据工厂

物体恒存性是发展心理学里的经典概念,用来描述婴幼儿理解物体在看不见时依然存在的认知能力。研究团队把这项测试转化成了可批量生成的数据任务。他们手工设计了150个遮挡任务,分属六类认知场景,在三维渲染软件中生成,每个任务都对速度、光照与相机角度做随机化处理,同时保留任务本身的底层结构不变,每个任务产出超过一万个样本。

这种做法的聪明之处在于,它没有去发明新的网络架构,而是先把模型应该具备的能力写清楚,再用渲染器把证据规模化地造出来。任何一个具体的失败案例,都可以被还原成一个可复现的渲染任务,进而变成训练数据。对做三维重建与点云处理的团队来说,这条思路有直接的借鉴价值:与其反复调参去碰运气,不如把模型失败的情形固化成任务,让数据自己把能力补上。

150万段训练语料与一场盲测

论文最终释放了150万样本的训练语料,以及一套包含300道题的考试集。评测部分采用盲测配对的方式,让评审在两段结果之间做选择,再用Elo评分排出名次,参与评测的共有14个视频模型,覆盖三类任务:参考图转视频、视频编辑与视频续写。这种评测设计比单看指标更接近真实观感,也更能暴露模型在遮挡场景下的具体短板。

公开数据之外,这项工作还提供了一个观察角度:物体恒存性是可以被量化和被训练的。过去讨论世界模型能力时,评价标准往往集中在画面清晰度、物理合理性或者长程稳定性上,缺少针对具体认知能力的细分测试。把一项认知能力拆解成任务集合,再用统一标准评测不同模型,这种做法有助于把模糊的能力讨论转化为可比较的工程指标,也让后续改进有了明确的方向。值得注意的是,评测集与训练集是分开设计的,考试题的规模被控制在三百道,目的是让结果可复核,而不是靠堆题量拉开差距。

16B的PWM-WROP是怎么排到第一的

在评测的基础上,团队训练了一个名为PWM-WROP的模型,参数量160亿,建立在英伟达Cosmos3-Nano之上。在续写类模型中它排名第一,在全部14个模型里综合排名第三。这个结果说明,通过针对性的数据训练,通用视频模型在特定认知能力上可以获得明显提升,而不必从头重训一个更大的基座。

这条路线与行业内另一条思路形成对照。一部分团队选择把三维重建、几何约束或者物理仿真直接嵌入模型结构,试图让模型天生理解空间;另一部分团队则选择用数据与评测驱动的方式,把需要的能力逐个补上。两种做法各有代价,前者工程复杂度高,后者依赖高质量的任务设计与数据规模。从这篇论文看,后一条路在短时间内更容易看到可衡量的进步,尤其是在遮挡这类边界清晰、可以大量合成的场景里。

对三维工作的启示与边界

需要保持清醒的是这项工作的边界。论文明确标注许可为非商业用途,训练数据来自合成的渲染场景,与真实的杂乱环境仍有距离。一个在干净合成场景里学会记住遮挡物体的模型,到了堆满杂物的机房里是否还可靠,需要额外验证。合成数据的优势是可控与可扩展,劣势是分布与真实世界的差距,这个矛盾在三维视觉领域一直存在。

尽管如此,方法论的价值是明确的。它示范了一种处理能力缺口的通用套路:先定义清楚模型应该具备什么能力,再把它拆成可复现、可批量生成的任务,用评测结果驱动训练。对国内的建模与空间智能团队来说,这套做法可以迁移到更多场景,例如透明与反光材质的重建、动态物体的长期追踪、多视角之间的外观一致性。当生成能力逐渐趋同,谁能把具体的认知能力补得更扎实,谁就更接近可交付的三维世界模型。

素材来源:arXiv、Hugging Face、3D Geodata Academy、Unite.AI 发布时间:2026-09-30