【论文导读】2026年论文导读第八期

【论文导读】2026年论文导读第八期

CCF多媒体专委会 

2026512日 15:01 山东 



论文导读

2026年论文导读第八期(总第一百四十八期)



 目 录

1

SLAM3R:    Real-Time Dense Scene Reconstruction from Monocular RGB Videos

2

Visual    Representation Learning through Causal Intervention for    Controllable Image Editing

3

A    Unified Approach to Interpreting Self-supervised Pre-training    Methods for 3D Point Clouds via Interactions

4

DiffusionDrive:    Truncated Diffusion Model for End-to-End Autonomous Driving

5

XLRS-Bench:    Could Your Multimodal LLMs Understand Extremely Large    Ultra-High-Resolution Remote Sensing Imagery?

01

SLAM3R: Real-Time Dense Scene Reconstruction from Monocular RGB Videos



作者:

刘宇政1†,董思言2†*,王书哲3,尹英达1,扬言超2*,樊庆楠4,陈宝权1*

单位:

1北京大学

2香港大学

3阿尔托大学

4VIVO

邮箱:

liu_yuzheng@stu.pku.edu.cn

siyandong.3@gmail.com

wang_shuzhe@apple.com

yingda.yin@gmail.com

yanchaoy@hku.hk

fqnchina@gmail.com

baoquan@pku.edu.cn

论文:

https://arxiv.org/pdf/2412.09401

代码链接:

https://github.com/PKU-VCL-3DV/SLAM3R

发表会议:CVPR 2025 Highlight

*通讯作者

共同第一作者



1. 研究背景

在计算机视觉与机器人感知领域,基于单目摄像头的高质量三维环境感知与重建一直是极具挑战性的课题。过去三十年间,研究者们建立了完善的多视角几何理论和方法,通常依赖运动恢复结构(SfM)、同时定位和地图构建(SLAM)以及多视角立体视觉(MVS)等算法的复杂集成。这些方法虽具备扎实的数学基础,但往往需要耗时的离线迭代优化,或因流程复杂而引入误差。近年来,以 DUSt3R为代表的大型基础模型开创性地实现了双目图像的端到端高效三维重建,但处理视频输入时仍需依赖全局迭代优化,严重影响了运行效率。可见,重建系统的准确度、完整度与高效率之间存在固有的权衡,构成了单目视频稠密重建领域的"不可能三角"

输入单目RGB视频(无需预知相机参数),SLAM3R系统逐步输出场景的稠密三维点云



2. 方法介绍

为打破这一局限,我们提出了SLAM3R,将大模型成功应用于长视频序列的实时稠密重建。该系统摒弃了传统方法中复杂的处理流程和耗时的迭代优化,采用统一的前馈神经网络直接预测三维点云。这种端到端的方法具有天然的高运行效率,并且经过大规模训练后能实现高质量重建和极强的泛化能力。SLAM3R系统主要由两个部分组成:Image-to-Points(I2P)网络和Local-to-World(L2W)网络。I2P网络负责从视频片段中恢复局部坐标系下的稠密点云,而L2W网络则将局部重建结果逐步注册到全局场景坐标系中。

2 SLAM3R系统概述

窗口内的多视角三维重建(I2P网络)Image-to-Points (I2P)网络接收一个视频片段作为输入,选择其中一帧作为关键帧来建立参考系,并且恢复该帧在其局部坐标系下的稠密点云。我们基于DUSt3R解码器设计了关键帧解码器,通过最大值池化操作聚合来自多个支持帧的交叉注意力特征,在控制计算开销的前提下有效整合了多视角信息。

窗口间的增量式点云注册(L2W网络):随后,Local-to-World (L2W) 网络使用历史帧重建结果作为坐标系参考,将位于局部坐标系中的关键帧注册到全局场景中。该网络引入了轻量级坐标编码器,将点云输入通过逐层特征叠加的方式注入解码器,使模型在解码时持续接收几何和坐标系的双重引导,实现了可控的坐标系转换。

前馈场景帧检索:检索模块由附加在I2P网络上的轻量级MLP实现。在调用L2W网络注册新帧之前,系统会快速检索K个历史最优参考帧来辅助坐标对齐。这种设计能有效抑制累积漂移误差,保障重建的全局一致性。



3. 实验结果

我们在室内场景数据集7-ScenesReplica上评估了SLAM3R。在重建速度较快(FPS大于1)的方法中,SLAM3R取得了最佳的准确度和完整度。

1 7-Scenes(上方表格)和Replica(下方表格)数据集的重建结果评估。我们以厘米为单位报告重建的准确度和完整性

即使没有全局优化,SLAM3R的重建质量也能媲美需要复杂优化的离线方法。这表明SLAM3R在准确度、完整度和运行效率三个方面实现了良好平衡。

3 SLAM3R系统基于公开数据集与日常视频的场景重建结果展示



4.总结

SLAM3R 将复杂的多阶段三维重建流程简化为轻便高效的前馈网络新范式,大幅降低了高质量三维重建的技术门槛。系统因未引入全局优化,在大规模长轨迹场景中仍面临累积误差的挑战。但凭借出色的实时性能与重建质量,它为三维资产快速获取、具身智能及通用人工智能等应用提供了全新的技术路径与数据支撑。

02

Visual Representation Learning through Causal Intervention for Controllable Image Editing



作者:

黄珊珊1,李昊轩2,郑淳元2,王雷1,廖国瑞1,龚志黎1,杨华逸1,刘礼1*

单位:

1重庆大学

2北京大学

邮箱:

shanshanhuang@cqu.edu.cn

hxli@stu.pku.edu.cn

cyzheng@stu.pku.edu.cn

leiwangtt@stu.edu.cn

guoruiliao@stu.cqu.edu.cn

202224131097@stu.cqu.edu.cn

202224131078@stu.cqu.edu.cn

dcsliuli@cqu.edu.cn

论文:

DOI: 10.1109/CVPR52734.2025.02187

发表会议:CVPR 2025 Highlight

*通讯作者



1.研究背景

可控图像编辑面临的核心挑战在于,具有语义意义的视觉属性并非总是相互独立,因此模型在训练过程中往往受到数据选择偏差的影响而呈现出虚假相关性。然而现有方法大多忽视此类问题,导致因果视觉表征学习存在偏差,并在编辑图像中对无关区域或属性产生意外改变。为解决这一问题,我们提出了一种基于扩散机制的因果视觉表征学习框架CIDiffuser,通过结构因果模型捕捉视觉属性的因果表征,从而有效消除虚假相关性。



2.方法介绍

为解决上述问题,我们提出CIDiffuser框架——一种基于扩散机制的视觉属性因果表征捕捉方法,通过对学习到的视觉表征实施因果干预实现可控编辑。首先,为全面捕捉图像表征,我们将视觉表征分解为两个关键组成部分:处理数据生成因素及其因果关系的高层语义表征,以及捕捉图像随机性或非结构化特征的低层随机表征。其次,借鉴先前因果效应估计方法,引入结构因果模型(SCM)通过整合未测量变量(特别是导致虚假相关性的混杂偏差)来估算视觉表征间的因果效应。特别的,我们设计的因果效应学习模块通过量化属性干预前后预测结果的直接因果效应差异,以有效消除混杂偏差。第三,采用扩散模型对高层表征与低层随机表征进行融合解码,从而在因果表征完整性与生成图像保真度之间实现有效平衡。此外,我们通过将证据下限与因果先验正则化项、因果效应损失以及监督损失相结合,设计了一种新的学习策略,旨在优化表征质量并促进学习表征与图像生成因素(即视觉属性)的对齐。

1 CIDiffuser方法的框架图



3.实验结果

为验证CIDiffuser的有效性,我们在两个公开可用的数据集,包括合成数据集Pendulum和真实世界数据集CelebA上将提出的CIDiffuser与当前最先进的方法进行对比。对比基线的方法包括传统解耦表示学习(TRL)方法(Conditional VAE BetaVAEDiffAE、 PDAEInfodiff和 DBAE)和因果视觉表示学习(CRL)方法(CausalVAEDEARSCM- VAECFI- VAE CausalDiffAE)

不同数据集上不同方法学习到的潜在表征质量的性能对比。最佳结果以粗体显示,次优结果以下划线标示

2 CelebA数据集上不同方法的图像质量性能对比。最佳结果以粗体显示,次优结果以下划线标示

2 CelebA数据集上的视觉结果对比。红色方框突出显示了某些方法中受虚假相关性影响的现象

图 3 Pendulum数据集上的性能对比分析。第1-4行分别展示了对摆锤角度、光源位置、阴影长度及阴影位置进行编辑后的结果。现有方法要么如绿色圆圈所示会降低生成图像的质量,要么如蓝色圆圈所示在编辑结果属性时仍可能影响这些属性

实验结果表明我们提出的CIDiffuser不仅在表征学习方面表现卓越,还能实现高质量图像可控编辑,充分证明了其有效性。



4.总结

本文提出了一种创新的因果视觉表征学习框架CIDiffuser,旨在为可控图像编辑任务学习高质量的因果表征。该框架通过因果建模模块确保学习到的表征能精准捕捉图像生成过程中的底层因果机制。同时,我们提出直接因果效应学习模块,并采用一种新的复合学习策略有效消除数据集中的混杂偏差,从而获得与图像生成要素(即视觉属性)高度匹配的可解释因果表征。在合成数据集和真实数据集上的大量实验表明,相较于现有方法,我们的方法在表征质量与可控图像编辑能力方面均展现出显著提升。

03

A Unified Approach to Interpreting Self-supervised Pre-training Methods for 3D Point Clouds via Interactions



作者:

李强1,阮建1,吴芳昊1,陈禹池1,卫志华1*,沈雯1*

单位:

1同济大学

邮箱:

qli@tongji.edu.cn

jianruan@tongji.edu.cn

2432055@tongji.edu.cn

1953721@tongji.edu.cn

zhihua_wei@tongji.edu.cn

wenshen@tongji.edu.cn

论文:

https://cvpr.thecvf.com/virtual/2025/poster/34814

发表会议:CVPR 2025 highlight

*通讯作者



1.研究背景

近年来,针对3D点云处理任务(如分类、分割),大量自监督预训练方法被提出,用于提升深度神经网络的性能。这类方法通常先在大规模无标签数据上进行预训练,再在下游任务上进行微调,从而显著提升模型表现。

然而,尽管不同预训练方法在实践中均取得了良好效果,其性能提升的内在机制仍不清晰。这一问题带来了两个核心挑战:一方面,缺乏统一的理论解释。现有方法依赖不同的预训练任务设计,但缺少一个统一视角来理解其有效性;另一方面,训练策略缺乏理论指导,即难以明确“什么样的表示更优”,从而限制了模型设计与优化。

与此同时,已有研究表明,深度神经网络可以通过博弈论交互来刻画其内部的推理模式,即模型的输出可以分解为不同子结构之间的组合效应。这为理解模型提供了一种具有坚实理论基础的解释工具。基于此,本文提出以博弈论交互作为统一视角,解释不同自监督预训练方法的共同机制,并进一步用于指导模型训练。



2.方法介绍

本文的核心思想是将神经网络对点云的预测分解为不同子结构之间的交互贡献,并通过分析这些交互来刻画模型的表示能力,进而比较预训练前后的表示差异,从而揭示其共同作用机制。具体而言,我们首先将点云划分为多个区域,并将模型输出解释为这些区域之间不同组合关系的累积结果。在这一框架下,不同复杂度的交互对应不同层次的结构信息特征,其中低阶交互主要刻画局部、简单结构,而高阶交互则对应全局、复杂结构。

交互解释模型示意图,模型输出可分解为不同区域组合交互的累积效果

在此基础上,我们进一步定义了一套度量指标,用于刻画不同阶交互的强度分布,从而分析模型更依赖局部信息还是全局结构。这一度量使得不同模型和训练策略可以在统一标准下进行比较。

2 (a)预训练模型与从头训练模型的交互分布差异,预训练模型具有更强的高阶交互。(b)高阶交互强度与性能呈显著正相关

在对三种3D点云分类模型、五种预训练方法以及三个数据集进行系统分析后,我们发现,不同预训练方法均会增强模型建模的高阶交互,同时抑制低阶交互。进一步分析表明,高阶交互强度与分类准确率之间具有显著相关性,这说明预训练方法的核心作用在于提升模型对全局结构的建模能力,并减少对局部特征的依赖。我们还进一步研究了预训练轮数以及下游微调数据量对该现象的影响,发现这一规律在不同设置下均保持一致,从而进一步验证了上述结论。

基于这一发现,我们提出了一种交互损失项,通过在训练过程中显式引入交互约束,抑制低阶交互并增强高阶交互,从而引导模型学习更具全局性的结构表示,以直接模拟预训练方法所形成的交互分布。该方法无需依赖大规模预训练数据,只需在标准监督学习目标中加入额外约束,即可实现对模型表示能力的直接调控。



3.实验结果

交互损失在分类任务上的性能

交互损失在分割任务上的性能

我们在三个分类任务基准ModelNet40ShapeNetScanObjectNN,以及一个分割任务基准S3DIS上进行了广泛实验,覆盖PointNetDGCNNCurveNetGDANet四种典型模型,以验证所提出交互损失的有效性。

实验结果表明,引入交互损失后,模型在各项任务上均取得了稳定性能提升,并整体达到了与主流预训练方法相当的水平。在不依赖大规模数据进行预训练的情况下,我们的方法依然能够获得具有竞争力的结果,说明通过显式调控交互结构可以有效替代传统预训练策略。



4.总结

本文从博弈论交互的角度出发,对3D点云自监督预训练方法进行了统一分析,揭示了其性能提升的共同机制,即增强模型对全局复杂结构的建模能力,同时降低对局部简单结构的依赖。在此基础上,我们进一步分析了预训练程度与数据规模对该机制的影响,并指出过度强化高阶交互可能带来的泛化风险。

基于上述发现,我们提出了一种无需预训练的方法,通过在训练过程中直接调控交互结构,实现对模型表示能力的显式优化。实验结果表明,该方法在多个任务上能够达到与预训练方法相当的性能。

总体而言,本文不仅解释了预训练方法为何有效,也表明其核心机制可以被显式建模与直接优化,从而为模型设计与训练策略提供了更加清晰的理论依据。

04

DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving



作者:

廖本成1,陈少宇1,尹浩然2,蒋博1,汪成1,鄢思旭1,张兴邦2,李翔宇2,张颖2,张骞2,王兴刚1*

单位:

1华中科技大学

2地平线机器人

邮箱:

bcliao@hust.edu.cn

xgwang@hust.edu.cn

论文:

https://arxiv.org/abs/2411.15139

代码链接:

https://github.com/hustvl/DiffusionDrive

发表会议:CVPR 2025 Highlight

*通讯作者



1.研究背景

端到端自动驾驶范式对比。(a)单模态回归;(b)多模态词表分类;(c)扩散模型;(d)本文提出的截断扩散模型

近年来,端到端自动驾驶技术快速发展,可直接从原始传感器输入学习驾驶策略,是智能出行领域的核心发展方向。如图1所示,主流单模态轨迹回归范式无法适配真实交通场景中驾驶行为的不确定性与多模态特性;基于固定锚点词表的多模态方案,受锚点质量与数量限制,泛化性不足且计算开销高昂,难以满足自动驾驶的实时性要求。

扩散模型在机器人策略学习中展现出多模态动作建模的强大能力,但直接迁移至自动驾驶场景时,面临去噪步骤繁多、推理延迟高,以及轨迹模态坍塌、多样性不足的核心痛点。针对上述问题,本文提出 DiffusionDrive 截断扩散框架,实现了实时、高质量的端到端多模态自动驾驶规划。



2.方法介绍

扩散策略和本文提出的截断扩散策略对比示意图

如图2所示,本文提出截断扩散策略,针对原生扩散策略去噪步骤繁多、实时性不足的核心痛点进行优化。训练阶段,先对训练集驾驶轨迹做 K-Means 聚类得到先验锚点,通过截断的扩散调度,仅向锚点添加少量高斯噪声,构建锚定高斯分布,大幅缩短完整扩散流程。推理阶段,以锚定高斯分布的带噪轨迹为去噪起点,替代原生扩散的纯随机高斯噪声,将去噪迭代步数从 20 步压缩至 步,同时搭配级联扩散解码器优化轨迹重建,在保障多模态轨迹多样性与规划精度的同时,实现自动驾驶实时推理。

基于截断扩散策略,进一步设计扩散解码器,能够根据传感器输入端到端地构建自车驾驶决策轨迹。如图3所示,车载传感器数据经感知模块提取 BEV/PV 特征、智能体与地图先验条件,结合从锚定高斯分布采样的带噪轨迹输入解码器。解码器通过空间交叉注意力、智能体 地图交叉注意力融合场景上下文,经时间步调制与 MLP 输出轨迹置信度和坐标,通过级联迭代去噪,最终生成多样化、高置信度的驾驶轨迹,同时可灵活调整采样数量适配算力需求。

3 DiffusionDrive的总体结构



3.实验结果

1 NAVSIM数据集上的性能比较

如表1所示,在 NAVSIM 数据集上,DiffusionDrive 以仅 20 个锚点取得 88.1 的 PDMS,大幅刷新 SOTA,超越此前最优方案,各核心子指标表现优异。

2 DiffusionDrive的路线图

如表2所示,DiffusionDrive 相较 单模态回归Transfuser 基线,PDMS 综合评分提升 4.1 至 88.1,轨迹模态多样性达 74%;仅需 步去噪,规划模块总耗时仅 7.6ms,参数量 60MFPS 达 45,在规划精度、轨迹多样性与推理效率上实现全面超越。



4.总结

DiffusionDrive 是面向端到端自动驾驶的创新截断扩散模型,针对原生扩散策略去噪步骤多、实时性不足、轨迹模态坍塌的核心痛点,提出嵌入先验驾驶模式的截断扩散策略,搭配高效级联扩散解码器,实现多模态驾驶轨迹的实时生成。该方法在 NAVSIMnuScenes 主流自动驾驶数据集上刷新 SOTA 纪录,在 NAVSIM 数据集取得 88.1 的 PDMS 评分,相较基线方法实现精度、多样性与推理效率的全面领先。同时,DiffusionDrive 完成了实车场景验证,在真实动态交通环境中可稳定输出安全合理的驾驶决策,具备优异的泛化能力与工程落地价值。

05

XLRS-Bench: Could Your Multimodal LLMs Understand Extremely Large Ultra-High-Resolution Remote Sensing Imagery?



作者:

王奉祥1,王洪振2,陈明硕3,王迪4,5,王语霖2,郭宗昊2,马强2,蓝龙1,杨文婧1*,张敬4,6,刘知远2,孙茂松2

单位:

1国防科技大学

2清华大学

3北京邮电大学

4武汉大学

5中关村学院

6武汉大学

邮箱:

wfx23@nudt.edu.cn

chen.mingshuo@bupt.edu.cn

论文:

https://arxiv.org/abs/2503.23771

代码链接:

https://github.com/AI9Stars/XLRS-Bench

数据链接:

https://huggingface.co/collections/initiacms/xlrs-bench

发表会议:CVPR 2025 Highlight

*通讯作者



1.研究背景

近年来,多模态大语言模型(MLLMs)在视觉理解和推理方面取得了显著进展,越来越多的模型被开发用于提升对高分辨率图像的理解能力。遥感(RS)影像在精准农业、城市规划、灾害评估等应用中发挥着不可或缺的作用,因此评估MLLMs在该领域的表现至关重要。然而,现有遥感多模态评测基准存在三方面不足:

一是图像尺寸过小,如VRSBench仅使用512×512的切片,无法全面评估模型对大尺度空间语义关系的捕获能力;二是标注质量不高,基于GPT的自动标注可能引入幻觉和错误,且存在对相似模型的偏向性偏差;三是评估维度有限,缺乏对面向实际应用的高阶推理能力(如规划与时空变化检测)的测试。针对以上不足,本文提出了XLRS-Bench,一个面向超大尺寸超高分辨率遥感影像的多模态大语言模型评测基准。

1 XLRS-Bench与其他评测的对比(分辨率、数据量)



2.方法介绍

XLRS-Bench具有四大核心特点:

(1)最大平均图像尺寸——平均分辨率达8,500×8,500,其中大量影像达到10,000×10,000像素,是现有数据集平均尺寸的24倍;

(2)全面的评估维度——涵盖16个子任务,分为感知和推理两大一级能力,进一步细分为11个二级维度和16个三级维度。感知方面包括图像描述、场景分类、计数、目标属性识别、空间关系理解、视觉定位等10项指标,推理方面包括复杂推理、异常推理、规划、时空推理等6项指标,共计45,942道问题;

(3)高质量标注——所有标注均经过人工参与和多轮交叉验证,由3个标注小组(各15人)互相校验,并由10名具有MLLM经验的专家组成审核团队解决分歧,避免了纯GPT标注带来的偏差和幻觉问题;

(4)中英双语支持——可评估模型在两种语言下的表现。

2 XLRS-Bench子任务数据样例

在图像描述任务中,本文设计了一套半自动标注流程:首先将每张大尺寸影像分割为9个子图,连同压缩后的全图一起输入GPT-4o,通过精心设计的提示词生成详尽的长文本描述(英文平均379词、中文平均663字),最终由人工进行校验和修正,确保描述的准确性和全面性。这种子图与全图结合的方法既能捕获局部细节,又能反映全局布局信息。



3.实验结果

本文在XLRS-Bench上对多个主流通用MLLMs(GPT-4oQwen2-VLInternVL2LLaVA-OneVision)和遥感专用模型(GeoChat)进行了全面评测,主要发现如下:

(1)VQA任务中,Qwen2-VL在中英文两个版本上均表现最优,但所有模型在感知密集型任务上的准确率仅为30%-50%,表明现有模型在精细信息捕获方面仍有很大提升空间。GPT-4o在时空推理任务上表现较弱(准确率低于25%),可能因其缺乏遥感场景变化检测的预训练数据。

(2)在图像描述任务中,MLLMs在生成长文本描述方面普遍表现不佳,GPT-4oGPT-4o-mini凭借强大的长文本生成能力表现突出,显著优于其他模型。

(3)在视觉定位任务中,所有模型的表现均较差,最佳模型GPT-4oAcc@0.5上仅达46%Acc@0.7仅为5%,表明超大尺寸影像中的精确定位仍是MLLMs的重大挑战。

(4)支持更高分辨率输入的模型(Qwen2-VL)显著优于受限于CLIP视觉编码器的模型(LLaVA-1.5),说明输入分辨率是影响遥感场景理解性能的关键因素。

1 XLRS-Bench VQA感知任务结果

2 XLRS-Bench VQA推理任务结果

3 XLRS-Bench Captioning任务结果

4 XLRS-Bench Visual Grounding任务结果



4.总结

本文提出了XLRS-Bench,首个面向超大尺寸超高分辨率遥感影像的多模态大语言模型评测基准。XLRS-Bench以平均8,500×8,500的图像尺寸、16个子任务、45,942道高质量人工校验问题以及中英双语支持,为系统评估MLLMs在真实遥感场景中的感知与推理能力提供了可靠的测试平台。目前已开源所有的visual grounding, captioning数据,并开源了VQA数据的子集版本XLRS-Bench-lite

编辑人:吴建龙、任文琦

专委会责任副主任:张勇东