新闻网讯 近日,人工智能与自动化学院2024级直博生熊壮在陶文兵教授的指导下,以第一作者身份撰写的论文“VGGT-Motion: Motion-Aware Calibration-Free Monocular SLAM for Long-Range Consistency”被国际机器学习顶级会议 International Conference on Machine Learning(ICML 2026)正式录用为亮点(Spotlight)论文。ICML 是机器学习领域最具影响力的国际顶级学术会议之一,也是中国计算机学会(CCF)推荐的 A 类国际会议。本次会议有23918篇有效投稿,比去年投稿量增加了1倍,共录用了6352篇论文,录用率26.6% ,其中仅 536篇论文录用为亮点论文,录用率仅为2.2%。
聚焦长序列 SLAM 难题,突破基础模型落地瓶颈
单目视觉SLAM是自动驾驶、机器人导航、增强现实和具身智能等领域的关键技术。近年来,DUSt3R、MASt3R、VGGT等三维视觉基础模型为免标定三维重建和SLAM提供了新思路,但在长距离真实视频中仍面临计算开销大、尺度漂移、轨迹断裂和全局一致性下降等问题。
针对以上问题,团队提出了 VGGT-Motion,一个面向长距离轨迹的运动感知、免标定、单目 SLAM 框架。该方法以运动动态为核心线索,重新组织长序列输入,并结合高效的锚点驱动配准与轻量级位姿图优化,在公里级场景中实现了高精度、高效率和强泛化的全局一致性建图。

图1 VGGT-Motion整体框架。
——运动感知子图构建,破解长序列“盲目分块”难题。现有基础模型 SLAM 方法通常采用固定长度切分策略处理长视频,容易切断关键运动片段,导致尺度漂移和轨迹断裂。VGGT-Motion 提出运动感知子图构建机制,判断输入帧静止、转弯和直行等不同运动状态,在减少冗余帧和噪声干扰的同时,保留对轨迹稳定性最关键的运动信息。
——锚点驱动直接 Sim(3) 配准,实现高效稳定的子图对齐。长序列 SLAM 的核心难题之一是不同子图之间的稳定对齐。VGGT-Motion 利用三维视觉基础模型输出的像素级稠密点图,通过共享锚点帧建立天然的三维对应关系,绕过传统特征提取、特征匹配和最近邻搜索等复杂步骤。提升复杂道路、低纹理和光照变化场景下的配准鲁棒性,同时降低计算开销。
——轻量级子图位姿图优化,支撑公里级全局一致性建图。在完成运动感知分块和锚点驱动配准后,系统构建子图级位姿图优化框架,以子图为节点、以重叠约束和回环约束为边,在Sim(3)空间中进行全局优化。相比逐帧级优化,该方法以更低成本维护长序列轨迹的一致性。
多场景刷新性能表现,兼具精度、效率与泛化能力
实验表明,VGGT-Motion 在 KITTI、Waymo Open、4Seasons、Complex Urban 和 A2D2 等数据集上取得优异表现。在无需相机标定的条件下,该方法具备与强标定SLAM系统竞争的轨迹估计能力,并相较现有基础模型SLAM方法进一步降低误差。
在长序列泛化测试中,面对数万帧、公里级轨迹、季节变化、弱纹理和高速运动等复杂场景,部分方法出现显存溢出或跟踪失败,而VGGT-Motion仍能稳定运行。相比VGGT-Long,该方法在长序列场景中实现 85%-95% 的轨迹误差与漂移降低,并取得 18-36倍运行加速。

图2 长序列场景下的轨迹精度与效率对比。
面向真实世界部署,推动三维视觉基础模型走向长程 SLAM
VGGT-Motion 为基础模型驱动的三维视觉系统解决长序列一致性与效率瓶颈提供了新思路。该工作表明,面向真实开放场景的SLAM系统不仅需要强大的局部几何预测能力,也需要合理的运动组织机制、稳定的跨子图配准策略和高效的全局优化框架。未来,团队将继续围绕三维感知、定位建图与具身智能系统开展研究,推动相关技术走向真实复杂场景应用。
编辑:史梦诗
来稿审核:曹攀辉
审核:万霞、范千
审定发布:詹健