【论文导读】2026年论文导读第六期

【论文导读】2026年论文导读第六期

CCF多媒体专委会

 202649日 19:09 北京 



论文导读

2026年论文导读第六期(总第一百四十六期)



 目 录

1

Octopus:    Alleviating Hallucination via Dynamic Contrastive Decoding

2

Towards    Enhanced Image Inpainting: Mitigating Unwanted Object Insertion    and Preserving Color Consistency

3

Inst3D-LMM:    Instance-Aware 3D Scene Understanding with Multi-modal Instruction    Tuning

4

SSHNet:    Unsupervised Cross-modal Homography Estimation via Problem    Reformulation and Split Optimization

5

Enduring,    Efficient and Robust Trajectory Prediction Attack in Autonomous    Driving via Optimization-Driven Multi-Frame Perturbation Framework

01

Octopus: Alleviating Hallucination via Dynamic Contrastive Decoding



作者:

索伟1,2†,张利军1,2†,孙梦阳1,2,武林原博3,王鹏1,2*,张艳宁1,2

单位:

1西北工业大学

2空天地海一体化大数据应用技术国家工程实验室

3英国斯旺西大学

邮箱:

suowei1994@mail.nwpu.edu.cn

lijunzhang@mail.nwpu.edu.cn

sunmenmian@mail.nwpu.edu.cn

peng.wang@nwpu.edu.cn

ynzhang@nwpu.edu.cn

论文:

https://openaccess.thecvf.com/content/CVPR2025/html/Suo_Octopus_Alleviating_Hallucination_via_Dynamic_Contrastive_Decoding_CVPR_2025_paper.html

代码链接:

https://github.com/LijunZhang01/Octopus

发表会议:CVPR2025 Highlight

*通讯作者

共同第一作者



1. 研究背景

近年来,大型视觉语言模型(LVLMs)在图像理解、视觉问答和多模态推理等任务上取得了显著进展,但“幻觉”问题仍然十分突出:模型常会生成与图像内容不一致的对象、属性或关系,影响系统的可靠性与可用性。针对这一问题,现有方法主要分为两类:一类通过构造数据重新训练模型,另一类则采用对比解码(Contrastive Decoding,CD),在推理阶段对原始输入和扰动输入的输出分布进行对比,从而抑制虚假内容的出现,相比重训练方法,后者由于不需要改动底层模型权重,而更适合实际部署。

然而,现有 CD 方法大多采用“一刀切”的静态策略,对所有样本、所有生成步骤使用同一种干预方式。但幻觉成因往往是复杂的,如下图所示,不同样本、甚至同一样本中不同的 token,都可能面临不同类型的幻觉挑战。因此,固定单一策略难以有效应对复杂场景。基于上述发现,本研究提出了一种新的Octopus框架,旨在动态识别幻觉类型,并自适应组织对比解码流程。

不同token生成面临的幻觉模式不同



2. 方法介绍

Octopus 的核心思想是:不再固定使用某一种对比解码方法,而是在生成过程中动态选择最合适的策略。具体来说,框架包含两个关键部分:一是“eye”,即一个可学习的决策token,它可以根据模型隐状态识别当前 token 更可能对应的幻觉类型;二是“tentacles”,即多个候选CD动作。本文将已有的VCDM3IDAVISC 等方法视作不同“触手”,分别对应缓解语言先验、视觉信息缺失和注意力偏置等问题,同时还加入“无动作”选项,以避免不必要的干预。

2 Octopus总体框架图

在训练上,我们将策略选择建模为偏好学习问题,利用DPO优化动作序列,而底层LVLM保持冻结。这样既降低了训练和部署成本,也使得框架具备良好的扩展性:未来若出现更强的CD方法,可以继续作为新的“tentacle”接入Octopus



3. 实验结果

论文在生成式和判别式两类多模态幻觉问题上验证了Octopus的有效性。结果表明,Octopus 在各方面指标上均优于已有方法,体现出较强的通用性和稳定性。同时,Octopus 在多个基准上达到新的最优性能,具有良好的部署性和可扩展性。

1 Octopus在生成式任务上的表现

2 Octopus在判别式任务上的表现



4.总结

Octopus 提出了一种面向多模态幻觉抑制的动态对比解码新范式。与以往依赖重训练或固定单一解码策略的方法不同,Octopus 通过“幻觉识别—策略选择—动态解码”这一流程,在不同样本、不同生成步骤中自适应地采用合适的干预方式,从而更有效地降低幻觉。

02

Towards Enhanced Image Inpainting: Mitigating Unwanted Object Insertion and Preserving Color Consistency



作者:

王艺楷1†,曹辰捷1†,喻俊秋1†,樊可1,薛向阳1,付彦伟1*

单位:

1复旦大学

邮箱:

yi-kai.wang@outlook.com

yanweifu@fudan.edu.cn

论文:

https://doi.ieeecomputersociety.org/10.1109/CVPR52734.2025.02164

代码链接:

https://github.com/Yikai-Wang/asuka-misato

发表会议:CVPR, 2025. (Highligh)

*通讯作者

共同第一作者



1.研究背景

图像修复技术旨在填补图像中的破损或缺失区域。随着扩散模型等生成模型的发展,大面积和复杂掩码的修复取得了显著进展。然而,在实际的物体移除和背景修复中,当前模型面临两大严峻挑战:一是“多余物体插入(幻觉生成)”,模型常在缺失区域无中生有地生成与上下文无关的物体;二是“色彩不一致”,由于隐空间对齐不足或VAE解码损失,修复区域常与原图产生明显色差。



2.方法介绍

为彻底解决上述难题,本文提出了ASUKA(Aligned Stable inpainting with UnKnown Areas prior)微调和后处理框架。该框架强调利用未掩码区域作为引导,包含两个核心组件:

 1MAE稳定先验:引入基于重构的掩码自编码器(MAE)作为先验。将MAE提取的特征注入扩散模型,有效限制了模型在掩码区域的过度自由发挥,从而稳定地移除目标物体,避免幻觉生成。

 2)条件VAE解码器:专门设计并训练了一个用于修复任务的VAE解码器。通过引入掩码信息和图像条件的引导,显著减少色彩偏移现象,确保修复区域与背景在光影和色彩上无缝融合。



3.实验结果

本文将ASUKA框架成功应用于SD1.5和最新的FLUX模型中。同时,构建并开源了涵盖多种遮挡场景的多样化评估数据集 MISATO。定性和定量实验一致表明,与其他主流图像修复算法相比,ASUKA在高分辨率下实现了高质量的物体移除,大幅降低了幻觉生成率,并完美保持了色彩一致性和图像保真度。



4.总结

本文提出的ASUKA框架通过巧妙结合MAE重构先验和改进的VAE条件解码器,成功兼顾了图像修复的生成能力与稳定性。开源的ASUKA模型及MISATO数据集,为未来图像编辑等相关领域的研究提供了极具价值的开源基准与强大工具。

针对 1024² 图像的图像修复。ASUKA 解决了当前生成式修复模型中存在的两个问题:(1) 不必要的物体插入:即随机生成与未遮挡区域不一致的元素;(2) 颜色不一致:生成的被遮挡区域发生色彩偏移,导致出现涂抹状的痕迹。ASUKA 为这些模型提出了一种后训练流程,显著缓解了物体幻觉现象,并提升了修复结果的色彩一致性

03

Inst3D-LMM: Instance-Aware 3D Scene Understanding with Multi-modal Instruction Tuning



作者:

于瀚勋1†,李文通2†,王松1,陈俊波3,朱建科1*

单位:

1浙江大学

2南京航空航天大学

3浙江有鹿机器人科技有限公司

邮箱:

hanxun.yu@zju.edu.cn

songw@zju.edu.cn

jkzhu@zju.edu.cn

wentong_li@nuaa.edu.cn

junbo@udeer.ai

论文:

https://arxiv.org/abs/2503.00513

代码链接:

https://github.com/hanxunyu/Inst3D-LMM

发表会议:CVPR 2025 Highlight (Computer Vision and Pattern Recognition)

*通讯作者

共同第一作者



1.研究背景

随着大语言多模态模型(LMM)在 2D 领域取得巨大成功,如何将其扩展到复杂的 3D 场景理解 成为当前的研究热点。然而,现有的 3D LMM 仍面临三大核心挑战:传统方法通常独立编码 3D 点云和 2D 图像特征,忽略了 2D 丰富的语义信息与 3D 几何属性之间的深层交互;现有的模型往往只关注单个物体的特征,难以准确理解 3D 环境中物体之间复杂的成对空间关系;此外,由于缺乏对场景的精简表示,导致大模型(LLM)处理的 Token 成本极高,严重影响了训练和推理效率。



2.方法介绍

本文提出了 Inst3D-LMM,这是一个统一的实例感知3D多模态大模型框架,能够在无需任务特定微调的情况下同时处理多个3D视觉-语言任务(3D视觉定位、3D问答、3D密集描述)

1 Inst3D-LMM 方法总览图

该框架包含两个核心创新模块:

1)多视图跨模态融合模块 (MCMF)

2 MCMF 模块架构图

为了获得细粒度的实例级视觉tokenMCMF 模块利用2D视觉基础模型(SAMCLIP)提取每个3D实例的多视图2D语义特征,并通过可学习的[CLS] token和交叉注意力机制,将多视图 2D 语义注入到对应的 3D 几何特征中 。它采用“由粗到细”的设计,通过交叉注意力机制使 3D 查询向量吸收精细的 2D 语义,从而生成增强的实例表示。

23D 实例空间关系模块 (3D-ISR)

3 3D-ISR 模块原理图

为了增强模型对复杂空间细节的理解,3D-ISR 模块利用物体的中心坐标计算物体间的欧几里得距离、水平角和垂直角 。通过空间条件自注意力机制,生成具有关系感知能力的场景级token



3.实验结果

我们在多个3D视觉-语言基准上进行了全面评估,包括ScanRefer(3D视觉定位)Multi3DRefer(多物体定位)ScanQA(3D问答)Scan2Cap(3D密集描述)。实验结果表明Inst3D-LMM在所有任务上均达到新的最先进水平。

1 3D视觉定位结果(ScanRefer & Multi3DRefer

2 3D问答与密集描述结果(ScanQA & Scan2Cap

4 3D视觉定位可视化对比

绿色为正确预测,红色为错误,蓝色为GTInst3D-LMM能更准确理解复杂描述。

空间关系注意力可视化

相比ViL3DRel3D-ISR能更准确捕捉查询物体与周围物体的空间关系。

Inst3D-LMM通过减少输入token数量显著提升效率。MCMF将每个实例压缩为单个token3D-ISR仅引入8个场景token。相比基线,训练时间从42小时降至4小时,推理速度提升约9倍。



4.总结

本文提出Inst3D-LMM,一个统一的实例感知3D多模态大模型,通过多视图跨模态融合和3D空间关系建模,显著提升了3D场景理解、推理和定位能力。作为一个通用的三维场景感知模型,无需任务特定微调,在多个基准上取得SOTA结果,同时大幅降低计算成本。未来工作将扩展至更丰富的3D-文本数据,并探索在具身智能任务中的应用。

04

SSHNet: Unsupervised Cross-modal Homography Estimation via Problem Reformulation and Split Optimization



作者:

余俊辰1,2,曹思源1,2,3*,张润民2,张程浩2,余柱2,陈书界4,杨柏林4,沈会良2

单位:

1浙江大学,宁波国际科创中心

2浙江大学,信息与电子工程学院

3浙大宁波理工学院

4浙江省大数据与未来电子商务技术重点实验室

邮箱:

yujc@zju.edu.cn

cao_siyuan@zju.edu.cn

runmin_zhang@zju.edu.cn

zch00@zju.edu.cn

yu_zhu@zju.edu.cn

chenshujie@zjgsu.edu.cn

ybl@zjgsu.edu.cn

shenhl@zju.edu.cn

论文:

https://arxiv.org/abs/2409.17993

代码链接:

https://github.com/Junchen-Yu/SSHNet

发表会议:CVPR 2025 (Highlight)

*通讯作者



1.研究背景

跨模态单应估计旨在恢复不同模态图像之间的全局透视变换关系,广泛应用于机器人定位、多模态图像恢复和多光谱融合等任务。相比同模态单应估计,该任务同时面临显著的模态差异与复杂几何形变,因此更具挑战性。

现有的有监督方法虽然性能较强,但依赖真实单应标注。而在实际跨模态场景中,这类标注通常难以获取。而目前的无监督方法多依赖内容一致性进行间接监督,但这种方式容易受到局部极小值影响,训练不稳定。为此,论文提出SSHNet(Split Supervised Homography estimation Network),通过问题重构与分步优化,实现无监督跨模态单应估计的稳定学习。



2.方法介绍

SSHNet的核心思想是:将无监督跨模态单应估计重构为两个带有直接监督形式的子问题。其中,子问题一被构造为“输入模态不完全一致的单模态单应估计问题”。方法先借助模态转换网络,将源模态图像转换到目标模态附近,再结合模拟单应扰动构造训练样本,从而让单应估计网络在近似同模态条件下进行直接监督学习。子问题二则被构造为“监督图像不完全对齐的模态转换问题”,即利用单应估计网络预测出的单应矩阵对目标图像进行反向变换,为模态转换网络提供更合理的监督信号。两个子问题彼此配合、相互促进,并分别由单应估计网络和模态转换网络完成。

无监督多模态单应性估计问题重构

为解决两个网络直接联合训练不稳定的问题,SSHNet进一步提出了分离优化策略。训练过程中,每次仅更新其中一个网络、冻结另一个网络参数,使两个子问题能够交替优化、逐步收敛。在此基础上,论文还设计了两个增强机制。其一是针对相关性单应估计架构提出的额外单应特征空间监督,用于增强跨模态下更适合单应估计的特征一致性;其二是提出采用蒸馏操作,在尽量保持性能的同时减少模型参数,并提升跨数据集泛化能力。

2 SSHNet总体框架示意图



3.实验结果

论文在GoogleMapDPDNOPT-SARFlash/no-flashRGB/NIR五个数据集上进行了系统实验。结果表明,SSHNet在多个数据集上均显著优于现有无监督方法。以SSHNet-IHN为例,其在五个数据集上的MACE分别为1.231.122.941.081.66

1 SSHNet与各类对比方法在各数据集上的实验结果

尤其在高难度OPT-SAR数据集上,SSHNet-IHN相比监督式方法MHNLocalTransMACE分别降低47.4%85.8%。同时,将SCPNet骨干嵌入SSHNet后得到的SSHNet-SCPNet也在全部数据集上优于原始SCPNet,说明SSHNet具有良好的框架通用性。

真实场景中多模态图像配准结果的可视化。(a)真实多模态场景;(b)UDIS-TIR数据集

此外,在真实场景实验中,SSHNet-IHN在真实多模态图像对和UDIS-TIR数据集上均表现出较好的配准能力。尽管模型仅在仿真单应性形变数据上完成训练,但在并不严格满足全局单应性假设的真实场景中仍能获得较为可靠的配准结果,表明其所学习到的多模态单应性估计能力具有一定的迁移性与泛化性,能够为真实场景提供有价值的初始对齐,并为后续多模态融合和高层视觉任务奠定良好基础。



4.总结

总体来看,SSHNet针对无监督跨模态单应估计中监督缺失、训练不稳定的问题,提出了“问题重构+分离优化”的新思路,并结合特征空间监督与蒸馏训练实现了精度、效率和泛化能力的综合提升。该方法不仅在多个跨模态数据集上取得了显著优于现有无监督方法的结果,在部分复杂场景下甚至超过了部分有监督方法,体现出较强的实用价值与推广潜力。

05

Enduring, Efficient and Robust Trajectory Prediction Attack in Autonomous Driving via Optimization-Driven Multi-Frame Perturbation Framework



作者:

余意1,韩玮祯2,吴黎兵1*,刘冰艺2*,王恩澍1,张壮壮3

单位:

1武汉大学

2武汉理工大学

3香港城市大学

邮箱:

yui1212@whu.edu.cn

wu@whu.edu.cn

wanges17@whu.edu.cn

hanweizhen@whut.edu.cn

byliu@whut.edu.cn

zhuangzhuang.zhang@cityu.edu.hk

论文:

https://doi.org/10.1109/CVPR52734.2025.01606

代码链接:

https://github.com/y1y5/OMP-ATTACK

发表会议:CVPR 2025 (Highlight)

*通讯作者



1.研究背景

随着自动驾驶技术的快速发展,轨迹预测作为其中关键的一环,直接影响到智能车辆对周围环境的理解和后续决策的准确性。然而,现有研究表明,轨迹预测模块同样面临着来自对抗性攻击的威胁。攻击者可以通过操控历史轨迹数据,使预测模型产生错误输出,从而诱导自动驾驶车辆做出危险操作。目前的主流攻击方法多为“单点攻击”,即在某一时刻注入扰动以影响预测结果。但这类方法在实际部署中存在明显短板:攻击持续时间短、易被时序滤波机制检测,且对攻击位置和物体属性高度敏感。因此,如何设计一种既持久、高效又鲁棒的轨迹预测攻击方法,成为当前自动驾驶安全研究中的一个重要课题。



2.方法介绍

1 OMP-Attack间接轨迹预测攻击的攻击场景图(左图无攻击、右图存在攻击)

针对上述挑战,本文提出了一种名为OMP-Attack(Optimization-driven Multi-frame Perturbation Framework)的优化驱动多帧扰动框架,通过物理世界中布置对抗物体的方式,实现对轨迹预测模块的间接攻击。该方法包括两个主要阶段:首先,在攻击阶段,通过多帧单点攻击策略,连续对多个历史帧施加扰动,形成具有持久影响的状态扰动序列,从而有效提升攻击的持续时间。其次,在对抗物体位置搜索阶段,设计了三类专门化的损失函数,分别从位置偏差、方向一致性和轨迹形态相似度三个方面评估扰动效果,并引入粒子群优化算法高效搜索对抗物体的最优布置位置。

此外,为增强攻击的鲁棒性,我们提出“精准攻击、模糊优化”策略:在攻击阶段精确建模物体属性,在优化阶段仅保留中心点信息,使攻击效果对物体尺寸、朝向及车辆偏移不敏感,显著提升实际部署中的稳定性。

2 OMP-Attack框架示意图



3.实验结果

本文在nuScenes数据集上对所提方法进行了系统评估,并与现有的SP-Attack等方法进行了对比。实验结果显示,OMP-Attack在多个指标上均表现优越:平均轨迹距离降低47%,规划响应误差提升100%,碰撞率提升52%

攻击性能对比结果

在攻击持久性方面,OMP-Attack在连续多个时间步中均能保持稳定的干扰效果,性能下降幅度远低于基线方法。

3 OMP-Attack(本方法)和SP-Attack多帧持续攻击可视化效果展示

在鲁棒性实验中,当对抗物体的直径、朝向发生变化,或目标车辆偏离攻击点时,OMP-Attack仍能维持较高的攻击效果,性能波动幅度小于25%。此外,该方法在白盒与黑盒设置下均表现出良好的攻击迁移能力,进一步验证了其在实际场景中的应用潜力。



4.总结

本文提出了一种面向自动驾驶轨迹预测模块的优化驱动多帧攻击框架OMP-Attack,通过多帧扰动生成、智能位置搜索与鲁棒性增强策略,系统性解决了现有方法在持久性、效率和鲁棒性方面的不足。实验结果表明,该方法在多种攻击场景下均能实现高效、持久的干扰效果,并对物体属性变化和目标偏移具有较强的适应能力。

编辑人:吴建龙、任文琦

专委会责任副主任:张勇东