H-JEPA把感知与控制拆开建模,世界模型研究迎来动作条件新架构

首页 / AI资讯 / AI建模

0:00
0:00
1x
定时

世界模型的研究热度正从产业界烧回学术界。一篇题为H-JEPA的预印本论文近日被图灵奖得主杨立昆在社交平台转发后,迅速在研究社区引发讨论。这篇由特拉维夫大学研究者主导的工作提出了一种动作条件化的世界模型架构,其最鲜明的特征是把感知与控制拆成两个独立设计的模块,让模型先学好看懂世界如何随动作变化,再去解决怎么动作的问题。在具身智能风头正劲的当下,这项工作回应的恰恰是世界模型设计中最基础的分岔路口问题。

动作条件化:世界模型的第三条路

要理解H-JEPA的定位,需要先看清世界模型研究的两大主流路线。一条路线走生成式:模型学着重构或预测未来画面,视频生成模型天然带有这种气质,画面越逼真,看起来越像理解了世界;另一条路线走强化学习:模型在试错中直接学习动作策略,环境模型只是隐含在策略网络里。两条路线各有软肋:生成式路线把大量算力花在渲染像素细节上,而这些细节对决策未必有用;端到端强化学习则把感知与控制搅在一起,策略一旦换环境就要重学。

H-JEPA选择的是介于两者之间的第三条路:显式地把感知与控制分开。感知模块负责从观察中提取一个宽阔的表征空间,预测模块在这个表征空间里预测世界在特定动作之后会怎样变化,也就是以动作为条件来建模世界的演化。关键在于,预测发生在抽象表征层面而非像素层面,模型不需要画出未来每一帧的长相,只需要回答动作执行后哪些量会变、往哪个方向变。这种设计直接继承自联合嵌入预测架构的思想,即在世界模型中预测表征而非像素,把算力集中在对决策有意义的变量上。

这种拆分带来的工程好处很实际:感知模块一旦训练好,可以在不同任务之间复用,控制模块则可以针对具体任务独立优化,两者互不拖累。对机器人行业而言,这契合了一个朴素的愿望,那就是感知能力是通用资产,控制策略才是任务专属品,架构上的分离为这种复用提供了形式化的通道。

各向同性正则化解决什么

H-JEPA在技术上的第二处贡献,是对感知表征空间施加了几何约束。研究团队没有让表征自由生长,而是通过正则化手段引导宽阔的感知编码向各向同性的几何形态靠拢,也就是让表征空间的各个方向尽量均匀分布、避免少数维度垄断全部信息。听上去抽象,背后却是自监督学习里一个老生常谈的塌缩问题:如果不对表征施加约束,模型很容易学出一个处处相似的坍缩表征,看起来什么都在预测,实际上什么也没区分。

各向同性约束的价值在于既防塌缩又保信息。表征的各个方向被拉平之后,预测任务无法靠死记几个显著特征蒙混过关,必须真正编码环境的结构化信息;同时均匀的几何分布让下游的控制模块面对一个良态的输入空间,学习难度显著下降。这个思路与自监督表征学习领域的多项经典技术一脉相承,把它落到动作条件化世界模型的场景里,是一次有针对性的组合创新。

正则化的强度选择本身就是一门平衡术:约束太强,表征会被压得过于平滑,丢掉环境中的细微差别;约束太弱,塌缩问题卷土重来。研究团队通过在多个基准上扫描超参数来确定合适的工作区间,这也给复现者提了个醒:直接照搬论文里的最终配置未必适配自己的任务,表征维度的选择与正则化权重需要联合调优。工程细节看似琐碎,却往往决定这类方法能否在新环境中站住脚。

成绩与验证的边界

在评测端,论文给出的数字相当亮眼:在立方体操控类基准上,模型仅用十个训练轮次就取得了百分之九十一点九的成绩,样本效率明显优于对比方法。不过需要保持清醒的是,这篇工作目前还是未经同行评审的预印本,基准成绩出自作者自己的实验设置,独立复现尚需时间。世界模型领域的评测长期存在环境多样、指标不一的问题,单一基准上的领先并不直接等同于通用能力的领先,这几乎是这个领域所有论文的通用注脚。

更值得关注的验证方向是真实机器人上的迁移表现。仿真基准上的漂亮数字与真机部署之间隔着仿真到现实的鸿沟,H-JEPA的表征学习方式是否能在真实传感数据的噪声与缺失面前保持稳定,决定了这项工作是停留在论文里,还是真正进入工程实践。研究团队公开方法细节的做法值得肯定,接下来几周里,其他实验室能否快速复现并扩展到新的环境,将是检验这项工作成色的第一道关卡。

样本效率本身也是一个值得单独看待的卖点。十个训练轮次的成绩意味着训练算力门槛显著低于同类工作,对算力预算有限的学术实验室格外友好,这与世界模型研究里动辄成百上千卡天的大模型式训练形成了鲜明对照。如果后续工作能证明这种效率优势可以扩展到更多环境类型,它对整个领域的方法论影响会比单一基准纪录更深远。

JEPA路线的产业回响

把镜头拉远,H-JEPA的走红嵌在一条更大的叙事线上。杨立昆多年鼓吹的世界模型路线,主张智能体应当在抽象空间中预测世界、在想象中规划行动,与当下火热的视频生成式世界模型形成了两种哲学的分野。行业研究机构年初发布的世界模型报告里,曾把联合嵌入预测架构与物理仿真、三维重建、视频生成、强化学习、反事实推理并列为六大技术路线,各家公司在路线选择上的分歧,本质是对什么才是理解世界这个问题给出了不同答案。

对国内的世界模型与具身智能创业者,这项工作提供的参照是具体的:当全行业都在用视频生成的画质比拼世界模型成色时,学术界提醒大家表征层面的效率可能才是长期竞争力,预测像素不如预测变化。数据与算力都不占优的团队,或许更应该关注这类轻量、强调样本效率的架构路线,在垂直场景里以小博大。学术研究与产业落地的时钟差通常以年计,但每一次架构层面的突破,最终都会变成下一轮产品竞争的地基,世界模型的这场路线之争,现在才刚刚翻开第一页。

素材来源:arXiv论文、AI Hunt日报、杨立昆社交平台 发布时间:2026-10-06