中国公司深度机智发布的物理基座模型PhysBrain 1.5,近日经多家渠道密集报道后进入行业视野。这个8B参数规模的模型在28项公开具身评测基准上取得72.5的综合均分,位居参评开源模型首位,与GPT-6 Astra的73.3分、Gemini 3.6 Flash的73.0分只差不到1分,排在得分67.9的Claude Opus 5之前。一个参数量只有百亿级的开源模型挤进闭源前沿的分数区间,把物理智能这条赛道最核心的问题摆上了桌面:决定机器人能力上限的,究竟是本体与数据规模,还是基座模型对物理世界的理解深度。
28项基准被组织成五类能力:视觉空间感知、空间与多视角理解、具身认知与规划、空间指向与可供性、视觉轨迹推理。PhysBrain 1.5在28项中拿下14项开源第一、10项开源第二,也就是24项进入开源前二,五类能力没有明显偏科。分项成绩中,RoboSpatial-Home空间理解取得73.9分,Part-Affordance可操作部位识别取得84.0分,RoboRefIt视觉目标定位取得89.8分,三项分别对应看清物体关系、判断哪里可以下手、在复杂场景中锁定目标。
与同场的开源对手相比,它比排名第二的Hy-Embodied-VLM-1.0高出6.5分,比RynnBrain 1.1高出9.4分。更值得注意的是同时开放的2B版本,综合得分66.6,虽然按官方规则不参与排名,但已超过所有非PhysBrain的参评开源模型,包括总参数达30B的混合专家模型。以约十五分之一的参数规模取得这样的成绩,说明这套能力并非来自堆参数,而是来自训练方式本身。
PhysBrain 1.5的底座是Qwen3-VL-8B-Instruct,但它在一个模型里同时输出三类内容:语言回答、末端执行器动作块、以及约一秒后的未来画面。技术报告把这一设计称为一张词表装三种token。动作侧通过ActionPiece把来自不同机器人、不同采样频率的连续动作转换成大模型可以学习的动作单元,单臂、左腕、右腕共用同一套动作词表与码本,因此一份权重就能驱动不同构型的机器人。
未来状态预测则同时输出RGB图像、深度图与机器人掩码三路信息,三者空间对齐、彼此关联,共同描述动作执行后的场景。把预判结果做成可训练的token而非事后渲染,意味着模型在动手之前就能推演环境会如何变化。这一能力是闭环能够自我纠错的前提,也是多数只做感知或只做动作的模型所缺失的一环。
团队用物理闭环描述物理智能的运转方式:观察世界、理解空间与任务、判断动作后果、执行、再依据新的观察修正下一步。难点在连续性,杯子会滑动、工具会被遮挡,任务要一次做完,就必须在整个过程中维持对世界的理解并根据反馈自我纠错。而现有的物理AI系统多数是把理解模型、动作模型与预测模型拼接起来,各自都能做好自己那一段,彼此之间却没有共同的世界表征,循环因此转不起来。
PhysBrain 1.5的做法是把三段能力放回同一个模型、同一个训练目标下联合训练,让理解把判断交给动作,动作把改变后的世界交给预测,预测再把预演结果交回理解。报告给出的一个可量化信号是动作预测能力从24%提升到54%,这种跨能力的相互牵引,正是拼接式架构难以获得的部分。物理闭环能否在同一模型内部闭合,正在成为判断物理基座模型成色的关键指标。
数据侧的选择同样值得拆开看。深度机智的预训练监督完全来自人类交互视频,采集体系名为Ego360,用全景视频记录任务执行时的周围环境,并同步保留全身姿态、手部运动与任务级语音,使一段交互不只是孤立的动作片段,还带着连续的任务与状态变化上下文。官方口径是这套体系目前每月新增万小时级数据,路线图自2025年12月提出情境数采、2026年7月升级为全景数采。
把人类动作变成机器人可执行的动作,靠的是Human-as-Humanoid转换框架,同步采集的第一视角与外部视角视频经人体重建与关节换算后,可直接转成适配自研本体的动作训练数据。团队披露原始示范吞吐量达到传统遥操作的4.8至7.2倍,并在部分任务上实现从人类数据到真机执行的迁移,无需针对目标机器人采集示范。人类经验能否成为动作建模的规模化燃料,这个问题的答案正在从理念变成可复算的数据。
把成绩单翻到另一面,短板也很明确。技术解读显示,模型在多视角空间推理与指代定位两项上输给了对手,MMSI-Bench与RefSpatial-Bench均未拿下第一。这两项能力与真实操作中的遮挡处理、跨视角目标确认直接相关,属于具身场景里绕不开的部分。此外,动作生成与未来状态预测目前只有定性结果,缺少公开的真机成功率数据,评测工具包开放的是理解类基准,执行层面的能力验证仍然不足。
模型的开放性也值得单独评价。2B与8B两个尺寸的权重、完整技术报告以及评测工具包全部以Apache 2.0协议开源,上线三天Hugging Face下载超过3000次,任何人都可以照着把这张成绩单重算一遍。在物理基座模型普遍只公开结论的当下,把得出结论的整条路径一并交出,本身就是在给这个领域建立可比性,而可比性恰恰是物理AI从演示走向部署最缺的东西。