在通往4D世界模型的路上,一个关键瓶颈长期困扰着研究者:现有动态三维重建技术极度擅长插值回忆过去,却在外推预测未来时束手无策。当观测时间一旦停止,画面中的物体往往会发生违背物理常识的扭曲与崩坏。7月31日,浙江大学联合多所高校发布的研究成果ParticleGS给出了全新的解题思路,该成果凭借基于物理的建模与4D预测上的突破,被计算机视觉顶会CVPR 2026接收为Highlight论文。
ParticleGS的核心创新,是抛弃对轨迹的死记硬背,让神经网络学习底层的神经物理规律。该框架无需人工设定繁琐的先验假设或几何网格,直接从RGB视频中学习3D高斯粒子的神经动力学,实现了极其稳定、符合物理直觉的未来运动外推。这项工作同时公开了论文与代码,为学术界与产业界探索4D世界模型提供了可复现的基座。
要理解ParticleGS的价值,需要先看清现有4D重建方法的困境。目前的动态3D重建技术,如动态3D高斯溅射和神经辐射场,通常把物体的变形直接建模为时间的函数,模型在观测时间内拟合轨迹,表现往往相当出色,能够还原出流畅的动态画面。然而这种轨迹拟合式的方法缺乏对底层物理规律的理解,一旦输入时间超出观测范围,模型就无法推演物体接下来的运动,预测出的轨迹会严重偏离真实物理规律,出现穿模、扭曲甚至整体崩坏。
另一类尝试引入物理先验的方法,如直接注入纳维-斯托克斯方程,则面临泛化能力极差的难题。这类方法极度依赖人工设定的外部力场和严苛的假设条件,换一个场景往往就要重新调整方程参数,难以在大规模数据上训练。ParticleGS的突破口在于换了一种思路:不再手工指定物理规则,而是让神经网络从海量视频数据中自己学习物理规律,把物理先验从人工工程变成可学习的表征。
ParticleGS在技术实现上采用了一个简洁而有力的设计。它以3D高斯粒子作为场景的基本单元,将视频序列中的观测映射为粒子状态,并训练一个神经网络来学习这些粒子状态随时间的演化规律。由于高斯粒子天然携带位置、尺度与外观信息,模型能够在不依赖任何几何网格的情况下完成场景的连续表示。更关键的是,模型学到的不是某一特定场景的轨迹,而是具有泛化能力的动力学规律,这意味着它可以将学到的物理知识迁移到未见过的运动模式上。
这种神经动力学的建模方式带来了两个直接收益。一方面,模型在观测时段内的重建精度保持稳定,另一方面,在观测时段之外的外推预测能够保持物理一致性,物体不会出现违背直觉的崩坏。实验表明,相较于现有的时间条件方法,ParticleGS在多种动态场景的未来预测任务上都展现出明显优势,能够稳定预测出合理的运动轨迹。研究团队将这项工作定位为通向4D世界模型的第一步,因为真正的世界模型不仅要能复刻已观测的三维世界,更要能推演未知的动态未来。
ParticleGS的突破并非孤立事件,而是折射出整个行业对物理一致性日益增长的关注。无论是具身智能机器人需要预测物体在真实环境中的运动,还是自动驾驶需要推演其他交通参与者的轨迹,都依赖模型对物理世界的深层理解。过去,这些能力分散在专门的物理仿真引擎中,难以与生成式模型无缝衔接;如今,让神经网络直接学习物理规律的技术路线正在成为主流。
从产业视角看,物理驱动的内容生成将显著降低仿真数据生产成本。机器人公司可以用这类模型批量生成符合物理规律的交互场景,用于训练具身智能;影视与游戏团队可以快速生成物理可信的动态资产,减少人工调校。浙大团队的这项工作证明,从视频中学习物理规律不仅在学术上可行,更具备广阔的工程化前景。当4D重建从回忆过去走向预测未来,世界模型的故事才刚刚开始。
ParticleGS的价值还在于它给出了一个可复用的技术范式。以往构建物理仿真通常依赖手工搭建的物理引擎,规则复杂、参数繁多,且难以覆盖开放世界的全部可能性。而基于神经动力学的路线,让模型直接从数据中归纳物理规律,天然具备扩展到未知场景的能力。这种范式的可迁移性意味着,它不只适用于视频重建,同样可以应用于流体模拟、布料仿真、机械运动预测等广泛的物理AI任务。
从产业节奏看,4D世界模型正处在从论文走向工程的关键阶段。具身智能企业对预测未来环境状态的需求尤为迫切:机器人需要预判物体的运动轨迹才能完成抓取与避让,自动驾驶需要推演其他交通参与者的行为才能保证安全。浙大团队表示,未来将进一步扩展ParticleGS在更长时序预测与多物体交互场景上的能力,并与下游应用团队合作推进工程化验证。团队同时公开了完整的代码实现与训练配置,让更多研究者可以在此基础上复现与迭代。当物理一致性成为AI理解世界的基本要求,像ParticleGS这样打通视频学习与物理推演的学术突破,正在为整个行业铺设通往4D世界模型的基础轨道。