空间理解能力的竞赛正在从静态走向动态。8月29日,阿里巴巴旗下高德正式发布首个无长程依赖的万帧级流式3D重建模型ABot-Recon,仅凭连续12帧局部画面,即可实时稳定重建上万帧的3D场景,实现边拍边建。这一模型解决了传统流式重建技术中误差累积与显存过大的核心难题,在多项公开基准测试中刷新纪录,并已在GitHub开源推理与评测代码和权重,被视为物理AI时代空间感知能力的重要突破。
ABot-Recon的技术创新在于彻底摆脱长程记忆依赖。主流的流式3D重建方案通常依赖长程记忆锚点进行帧间对齐,模型需要记住并处理大量历史帧信息,随着序列变长,计算复杂度不断上升,误差也容易累积。ABot-Recon选择了一条截然不同的路径,模型只以最近的12帧连续画面作为局部上下文窗口,每次仅预测当前相机坐标系下的局部点云和相邻两帧之间的相对位姿,计算复杂度保持恒定,再通过在线组合逐步拼出完整的全局轨迹与三维场景,从机制上规避了长序列带来的精度与性能衰减。
针对局部预测中的误差累积问题,ABot-Recon在预测端和训练端分别设计了纠偏与误差约束机制。预测时,模型实时校准轨迹误差,防止局部偏差被逐步放大;训练时,误差约束机制强化模型对轨迹平滑性的学习,让重建结果在长序列上依然稳定。这种局部位姿预测加残差优化的组合,是ABot-Recon能在无长程依赖条件下保持万帧级稳定重建的关键。对于自动驾驶、具身智能等需要在开放环境持续移动的场景,这种无需记忆全量历史的轻量化方案,具有显著的技术与工程优势。
性能数据是ABot-Recon技术实力的直接证明。精度方面,在Oxford Spires长序列基准测试中,ABot-Recon的平均轨迹误差较行业代表方法LingBot-Map降低40.6%,重建的空间结构更加精准。速度方面,在KITTI-02测试中,ABot-Recon实现了24.45FPS的实时重建,推理速度达到行业代表方法的1.24倍,能够跟上移动设备的采集节奏。显存方面,ABot-Recon的峰值显存占用仅约6.71GB,约为同类模型的三分之一,这意味着它可以在更经济的硬件配置上运行,大幅降低了部署门槛。
三项核心指标的全面提升,源于模型架构的精细设计。固定12帧的局部窗口让计算量不随序列长度增长,为实时性提供了保障;局部位姿预测加残差优化的组合在精度上超越依赖全局优化的传统方案;而显存优化则得益于模型对历史信息的压缩处理,无需保存长序列的中间特征。这些设计相互配合,让ABot-Recon在精度、速度与资源消耗三个维度同时取得领先,这种综合性能的优势,在实际部署中比单点指标的突破更具价值。
ABot-Recon对输入条件的宽容度拓展了其应用边界。模型仅需单目RGB视频输入,无需额外的深度传感器或已知相机参数,就能实现万帧级的实时三维重建。这意味着普通的手机摄像头、车载行车记录仪拍摄的画面,都可以直接作为重建输入,数据采集成本大幅降低。高德在发布中介绍了两个主要落地方向,一是测绘行业的私域建图与底图更新,二是具身智能、自动驾驶等需要实时空间理解的场景,模型都能在移动过程中持续构建对环境的理解。
在具身智能场景中,ABot-Recon解决的是机器人在移动中理解空间的核心问题。商场、园区、仓库等私域场景定位信号弱、环境变化快,机器人无法依赖一次性建图或事后重建,需要在运动过程中边感知边构建地图,判断自己在哪、周围有什么、下一步怎么走。ABot-Recon的边拍边建能力正契合这一需求,机器人搭载普通摄像头即可实时更新环境模型。在测绘领域,ABot-Recon则可用于低成本的移动测图,替代部分专业设备的测绘工作,为底图更新提供更灵活的技术手段,两条落地路径共同指向物理AI大规模商用的现实需求。
ABot-Recon的开源发布,对行业的意义在于降低了流式3D重建技术的使用门槛。高德将推理及评测代码和权重在GitHub开源,并在魔搭社区上线体验专区,开发者可以快速上手评估与二次开发。开源策略让这项技术不再局限于高德内部,科研机构、创业公司与行业用户都能基于其进行创新,推动流式3D重建技术在更广泛场景的落地验证。在空间智能成为AI发展新方向的大背景下,这类基础能力的开放共享,有助于整个行业的技术进步与生态繁荣。
从技术趋势看,ABot-Recon代表了空间理解从静态重建到动态感知的演进方向。过去3D重建主要面向静态场景,对动态环境的重建依赖高算力与复杂设备;如今以ABot-Recon为代表的流式重建方案,让移动设备在行进中实时构建三维空间理解成为可能,这为自动驾驶的安全决策、机器人的自主导航与数字孪生的实时构建奠定了基础。当然,模型在极端光照、快速运动等复杂场景下的表现仍有提升空间,但从无长程依赖的技术路线到开源生态的构建,高德的这一步已经为物理AI时代的空间智能打开了新的可能,未来空间理解技术的竞争,将从单点性能比拼转向工程落地与生态协同的综合较量。