【论文导读】2026年论文导读第十期

【论文导读】2026年论文导读第十期

CCF多媒体专委会 

2026616日 12:59 北京 



论文导读

2026年论文导读第十期(总第一百五十期)



 目 录

1

Interpreting    Object-level Foundation Models via Visual Precision Search

2

Tackling    Biased Evaluators in Dueling Bandits

3

Controlling    Thinking Speed in Reasoning Models

4

Partition-Then-Adapt:    Combating Prediction Bias for Reliable Multi-Modal Test-Time    Adaptation

5

Style    Evolving along Chain-of-Thought for Unknown-Domain Object    Detection

01

Interpreting Object-level Foundation Models via Visual Precision Search



作者:

陈若愚1,2,梁思源3,李京知1,2,7,刘势明4,李茂森5,黄震6,张华1,2*,操晓春8*

单位:

1中国科学院信息工程研究所

2中国科学院大学网络空间安全学院

3新加坡国立大学计算机学院

4华为技术有限公司RAMS实验室

5华为技术有限公司IAS BU

6国防科技大学

7云南师范大学民族教育信息化教育部重点实验室

8中山大学网络空间安全学院

邮箱:

cryexplorer@gmail.com

pandaliang521@gmail.com

lijingzhi@ustb.edu.cn

zhanghua@iie.ac.cn

caoxiaochun@mail.sysu.edu.cn

论文:

https://openaccess.thecvf.com/content/CVPR2025/html/Chen_Interpreting_Object-level_Foundation_Models_via_Visual_Precision_Search_CVPR_2025_paper.html

代码链接:

https://github.com/RuoyuChen10/VPS

发表会议:CVPR 2025 (Highlight)

*通讯作者



1. 研究背景

AI决策的可靠性与安全性是其实际部署的核心挑战。当前智能体广泛依赖复杂的机器学习模型进行决策,但由于模型缺乏透明性,其决策过程往往难以被理解与验证,尤其在关键场景中,错误决策可能带来严重后果。因此,提升模型的可解释性成为迫切需求。

目前已有的解释方法,如 Shapley ValueIntegrated GradientsAttentionGradient(如 Grad-CAM)以及 Perturbation 等,虽然在小规模模型中取得了较好的解释效果,但在面对多模态任务或大规模模型时,均存在不同程度的局限性,难以直接扩展或适用。因此,发展一种在大模型与小模型中均具有良好适应性的高效可解释归因方法具有重要意义。

理解图像中的物体信息,如目标检测,是计算机视觉领域中的一个关键且持续的挑战,具有广泛的应用意义,包括自动驾驶等多个领域。目前,已有方法用于解释目标检测模型,例如来自Adobe公司的基于Perturbation机理的D-RISE方法,以及来自香港城市大学的基于GradientODAM方法。它们都适用于传统的单阶段以及双阶段目标检测器决策的解释,如图1所示。

传统目标检测器种类以及部分可解释方法

随着多模态预训练技术的发展,物体级基础模型(如 Grounding DINOFlorence-2)在视觉定位与目标检测等任务中得到广泛应用。然而,解释此类模型的决策机制变得日益复杂。一方面,模型参数规模不断扩大,另一方面模态数量的增加及其早期融合机制导致模态间交互更加复杂,从而使现有可解释归因方法面临显著挑战:(1)基于梯度的归因方法因视觉与文本的深度融合,难以提供精确的定位信息;(2)基于扰动的方法生成的显著性图中噪声较多,限制了其在细粒度解释任务中的表现,如图2所示。

为应对上述问题,我们提出了一种新的基于搜索的机理,视觉精度搜索(Visual Precision SearchVPS)方法,旨在通过更少的区域生成高精度的归因图。

现有多模态物体级基础模型架构和解释方法



2. 方法介绍

问题建模:

我们的目标是用尽可能少的区域实现更强的解释,因此我们将归因问题建模为基于子模子集选择的搜索问题。具体而言可以将输入稀疏化为有限的子区域集合,并选择其中一个子集,以达到最大化可解释的目的。为了评估子区域的可解释性,定义集合函数F(·)来判断给定区域是否是模型决策的关键因素。因此,目标是:

其中k表示子区域的最大数量。因此,问题的关键在于设计集合函数F并优化公式1

提出方法:

我们提出了一种用于解释物体级模型的视觉精度搜索方法,如图3所示。首先,需要对输入区域进行稀疏化处理。我们应用 SLICO 超像素分割算法将输入图像划分为m个子区域,即

。为了解决式中的一个NP-难问题,我们采用子模优化。接下来,我们设计一个集合函数来评估可解释性分数,并对物体级任务中可解释区域的重要性进行排序。

提出的基于视觉精确搜索归因算法

线索分数:可解释性的一个关键方面是使物体级基础模型能够在使用更少区域的情况下准确定位和识别物体。我们定义了线索分数为:

协作分数:部分区域可能具有显著的组合效应,即仅在与多个特定子区域联合时,才能对模型决策产生有效影响。为识别此类高度依赖交互的关键区域,我们引入了协同分数,用于衡量子区域在决策过程中的协同贡献:

子模方程:上述分数被结合起来构建一个子模函数F(·),如下所示:

显著图生成:使用上述子模函数,应用贪心搜索算法对V中的所有子区域进行排序,得到一个有序子集S。此外,对子区域进行评分是必要的,以便更好地解释每个子区域的重要性。我们通过边际效应评估两个子区域之间的显著差异。提出的视觉精度搜索算法的详细计算过程在算法1中进行了概述。我们也在论文中对方法的其适用性和理论边界进行了理论分析。



3. 实验结果

忠实度分析:

我们在多个物体级任务中验证了所提出的方法,使用 Grounding DINO 进行决策解释。表 展示了不同数据集上的可解释性结果,显示出我们方法的优越性能。在 MS COCO 的目标检测任务中,我们在 InsertionDeletion 和平均最高分上分别超越 D-RISE 方法 23.7%6.7% 和 10.6%。在 RefCOCO 的指代表达理解任务中,分别提升 20.1%22.1% 和 4.4%。在 LVIS V1 的零样本目标检测任务中,我们在相应指标上分别提升 31.6%4.2% 和 15.9%,达到了 SOTA 水平,进一步验证了提出方法极强的泛化能力与通用性。如图 所示,ODAM的显著性图呈现弥散状,D-RISE的图则较为嘈杂,而我们的方法则清晰地突出显示了重要的子区域,捕捉到边缘和类别特征,增强了解释性。

1 GroundingDINO模型上归因的忠实性分析

不同归因方法解释GroundingDINO的可视化

解释模型错误:

在已知正确答案的前提下,我们的方法在解释物体级基础模型产生错误预测的原因方面,展现出其他现有方法所不具备的能力。我们在论文中定量的展示了我们的方法大幅度超越基线方法,以下我们展示可视化效果。

解释REC失败案例,图 展示了模型错误的解释,其中青色高亮区域表示由于视觉输入干扰导致的决策错误,这使得基础模型偏离了正确的轨迹。

解释导致模型视觉定位错误的原因

解释检测中分类错误:目标检测任务中常见错误是准确定位物体但分类错误,图 显示了物体周围的背景干扰了模型的决策,热力图中的青色区域突出显示了导致模型误分类的区域。通过改善模型并细化前景与背景之间的上下文关系,可能成为一个有前景的方向。

解释导致模型类别预测错误的原因

未检测错误解释:目标检测任务另一个常见的错误是对物体的置信度较低从而导致没有检测到物体。低置信度物体可能由模型的特征表示和干扰性输入因素共同导致。图 展示了我们方法对漏检样本的解释,揭示了错误可能源自难以区分相似物体(例如第一行的熊)和环境因素对检测的影响(例如第二行的软木板)。这些洞察揭示了当前模型的局限性,并为改进提供了方向。

解释导致模型未检测到物体的原因



4.总结

我们提出了一种专门针对物体级基础模型的可解释归因方法,称为视觉精确搜索方法(Visual Precision Search),该方法引入了一种新的子模机制,结合了线索得分(clue score)和协作得分(collaboration score)。该方法通过搜索尽可能少的区域,增强了可解释性。通过在 RefCOCOMS COCO 和 LVIS上的实验,我们的方法在各种评估指标上提升了Grounding DINO 和 Florence-2 的物体级任务可解释性,超过了现有的最先进方法。此外,我们的方法有效地解释了视觉定位和物体检测任务中的失败情况。未来,我们将考虑将该可解释机理应用于实际任务,例如模型训练时提升模型决策的合理性;在模型推理时监控模型决策从而进行安全防护,提高模型的可靠性;或用可解释发现关键缺陷,以最小的代价修复模型。

02

Tackling Biased Evaluators in Dueling Bandits



作者:

唐茗1,周宇轩1,黄超2*

单位:

1南方科技大学

2蒙特克莱尔州立大学

邮箱:

tangm3@sustech.edu.cn

zhouyx8@mail.sustech.edu.cn

huangch@montclair.edu

论文:

https://neurips.cc/virtual/2025/loc/san-diego/poster/117829

发表会议:NeurIPS

*通讯作者



1.研究背景

决斗老虎机(Dueling Bandits)是一种拓展的多臂老虎机(Multi-Armed Bandits)在线学习框架。在每一轮决策中,智能体在多个选项中选择一对选项进行“决斗”,评估者将反馈这对选项中的相对较好的选项,算法的核心目标是通过平衡探索未知选项与利用已知反馈信息之间的权衡,最大化长期累积收益。与多臂老虎机相比,决斗老虎机可以有效应对选项难以量化评估的问题,比如,对于人类用户而言,为大语言模型的输出结果给出明确的量化分数是困难的,而比较两个输出的相对好坏是容易的。

然而,现有研究通常假设评估者提供的反馈是无偏的。当评估者是人类时,这样的假设通常不成立,因为人类可能具有不同的背景与个体偏好,也可能存在随意反馈或刻意谎报的情况。本文系统性地研究了存在评估者偏差的决斗老虎机问题,旨在设计能够主动感知并校正这种偏差的算法,最大化长期累积收益。



2.方法介绍

评估者偏差已知的情况:本文采用了基于上界置信(Upper Confidence Bound)的算法框架,根据反馈,估计每个选项的收益与置信区间,智能体每轮选择这两项之和最大的选项。在该框架下,设计的核心转变为了如何修正有偏反馈,使得收益估计更加准确。本文提出了基于优化的求解方案,构建以收益估计为变量的优化问题,最小化基于该估计的反馈观测与实际反馈观测的差异。本文证明了该估计无偏,且推导得出相应的估计置信区间,基于此,理论证得该算法具有亚线形特性,即随着轮次增长,算法的平均收益趋近于最优的平均收益。

评估者偏差未知的情况:基于上述框架,此处的设计核心是对收益与评估偏差的估计。构建以收益估计与评估偏差为变量的优化问题,最小化基于估计的反馈观测与实际观测的差异,从而获得收益与偏差估计。该优化问题是非凸的,本文设计了基于块坐标下降(Block Coordinate Descent)的算法完成求解。该算法被证明能达到与偏差已知情况下相同量级的长期平均收益,且其误差有界。

上述收益与偏差估计方案可以被融合至现有其他决斗老虎机框架,使其可以应对反馈偏见问题。



3.实验结果

本文比较了三类方法:基线方法,RCRUCBDTMBTWUCB;本文提出的方法,BS-UNBS-K;将本文提出的估计方法拓展至现有框架,RC-BRUCB-BDT-B。实验结果显示,本文提出的方法BS-UNBS-K与基于本文提出的估计方法的现有框架拓展DT-B可以实现更低的遗憾,可以理解为更高的长期收益,这一优势在以下场景更加明显:选项差异(Arm Heter.)越小,即选项性能越难区分;偏见聚集度(Bias Concentr.)越小,即偏见越分散,修正难度越高。

不同选项异质性与偏见聚集度下的算法性能

算法的收敛情况



4.总结

本文探索了决斗老虎机在线算法下的反馈偏见问题,并提出了具有理论性能保证的算法,来实现偏见的估计与修正,最终可以在反馈偏见存在下达到更高的长期收益。

03

Controlling Thinking Speed in Reasoning Models



作者:

林政楷1,付志航2*,陈泽2,陈超2,谢亮3,王闻箫4*,蔡登1,王征2,叶杰平2

单位:

1浙江大学CAD&CG国家重点实验室

2阿里云智能集团

3浙江工业大学

4浙江大学软件学院

邮箱:

zhihang.fzh@alibaba-inc.com

wenxiaowang@zju.edu.cn

论文:

https://arxiv.org/abs/2507.03704

代码链接:

https://github.com/D2I-ai/thinking-speed-control

发表会议:NeurIPS 2025 Spotlight

*通讯作者



1.研究背景

近年来,大语言模型逐渐演化出两类不同的“思维范式”:一类是类似直觉反应的快速推理(System 1),另一类是通过长链推理进行反复验证的慢思考(System 2)。前者高效但能力有限,后者性能强但代价昂贵。因此,一个核心问题浮现:能否在同一个模型内部,动态调节“思考速度”,实现效率与准确率的平衡?

本文的关键洞察是:LRM本身已经具备了快/慢两种思维能力,关键在于如何“调度”它们。



2.方法介绍

本文方法围绕两个核心问题展开:

  (1)如何控制思考速度?

  (2)何时调整思考速度?

2.1 思考速度控制

本文首先发现了一个有趣现象:不同长度的推理往往对应不同的“开头词”(如“To” vs “Okay”),暗示模型内部存在快/慢思维的隐式开关。

/慢思考风格可由不同的开头词触发

在此基础上,论文提出基于表示工程(Representation Engineering)的方法:

   1.构造快思考 慢思考样本对;

   2.在每个样本上提取LRM隐藏层的表示差异;

  3.通过PCA得到一个“思维方向向量”(steering vector)

在推理时,可通过如下方式干预模型:

  ⚫加上该向量 → 更快、更简洁推理

  ⚫减去该向量 → 更慢、更深入推理

基于表征工程的模型思考速度控制框架

2.2自适应速度调节

仅有“全局加速/减速”还不够理想,因为真实推理过程是动态变化的。为此,本文提出了一种动态难度感知机制。即通过比较模型的早期层与最终层的token预测分布差异(JSD),从而估计每个token的推理难度:

  ⚫差异大 → 语义复杂 → 高难度

  ⚫差异小 → 简单推理

而动态控制策略即基于该难度判断。对于简单部分进行加速处理,困难部分进行减速处理,从而类比人类解题过程中的“简单部分一带而过,关键步骤反复推敲”的思维方式。实现效率与性能的兼顾。



3.实验结果

本文在多个推理基准上(MATH-500AIMEGPQALiveCodeBench)进行了验证,核心结论包括:

3.1. 控制带来的 scaling effect

  ⚫推理越慢(更长链) → 准确率提升

  ⚫推理越快 → token显著减少但性能仍可接受

且相比于基于prompt或原模型性能的baseline相比:使用思考速度控制的加速模式显著更优(最高+11%),且减速模式可超过原模型性能。

不同思考速度下推理模型的性能表现

3.2. 自适应策略的效果

在多种LRM以及推理基准测试上使用动态控制算法后,模型近乎无损地取得了平均准确率提升+1.3%,且推理token开销-8.6%的效果。

动态推理速度控制算法下模型的准确率与推理开销



4.总结

本文从一个非常直观却长期被忽视的角度切入:推理并不是“要不要多想”,而是“该在什么时候多想”。作者将大模型的推理过程重新理解为一个可连续调节的“思考速度”过程,并通过表示层的向量控制,实现了对快思考与慢思考的统一调度。这一思路跳出了传统依赖prompt或训练数据的范式,直接在模型内部机制上进行干预,展示了representation-level control在推理优化中的潜力。更重要的是,通过引入基于难度的动态调节策略,模型开始具备类似人类的“资源分配能力”,即在简单问题上快速略过,在关键步骤上投入更多计算。这种“按需思考”的范式,实际上指向了一个更广阔的方向:未来的大模型不仅要更强,还需要更“聪明地使用算力”,而推理过程的自适应控制,可能正是迈向这一目标的重要一步。

04

Partition-Then-Adapt: Combating Prediction Bias for Reliable Multi-Modal Test-Time Adaptation



作者:

王国威1,吕凡2,丁长兴1*

单位:

1华南理工大学

2中国科学院自动化研究所

邮箱:

eegw.wang@mail.scut.edu.cn

fan.lyu@cripac.ia.ac.cn

chxding@ scut.edu.cn

论文:

https://openreview.net/forum?id=T6RkYsuoMW

代码链接:

https://github.com/MPI-Lab/PTA

发表会议:NeurIPS 2025

*通讯作者



1.研究背景

测试时自适应(Test-Time Adaptation, TTA)通过在推理阶段使用无标签在线数据更新模型参数,以应对测试数据分布偏移带来的模型性能退化难题。近年来,TTA 被进一步扩展至多模态场景(Multi-modal Test-Time Adaptation, MM-TTA),应用于多模态动作识别与事件分类等任务。然而,现有 MM-TTA 方法主要针对单模态偏移设定,当面对真实场景中的多模态并发偏移时,模型预测会产生严重的伪标签噪声。现有TTA方法因无法有效甄别伪标签的可靠性,极易在模型参数更新过程中产生误差累积,进而引发模型崩溃。

1 (a) 在干净(无偏移)、单模态以及多模态域偏移条件下融合特征的t-SNE 可视化。(b) 在上述不同条件下,模型预测的类别分布。(c) 将模型预测按熵值分组后,对比不同组别的准确率



2.方法介绍

为应对多模态并发偏移带来的模型预测偏差,本文提出了 Partition-Then-Adapt(PTA)框架。该框架由两个核心方法构成:划分与去偏重加权(Partition and Debiased Reweighting, PDR)和多模态注意力引导对齐(Multi-modal Attention-Guided Alignment, AGA)

2 PTA 框架概览。PTA 首先将在线数据划分为两个子集,并综合预测偏差与置信度为样本分配权重。随后,结合加权熵损失与多模态注意力引导对齐,对预训练模型进行自适应更新

划分与去偏重加权通过量化批次内标签分布以校准多模态并发偏移引发的预测偏差,为模型更新提供可靠梯度。该方法首先计算各样本预测标签频率与批次均值的比率,将测试数据划分为“可靠”与“不可靠”子集。随后,通过基于分位数的方法(见原文算法1)联合评估样本的偏差与置信度,为各样本分配权重。结合加权熵损失,该方法通过分配正负权重,分别对可靠与不可靠样本执行熵最小化和最大化。此优化机制在提取有效特征的同时平滑了异常预测,有效抑制了模型退化。

多模态注意力引导对齐防止模型在自适应时丢失高语义价值的多模态线索。其原因在于,对不可靠样本施加的熵最大化易导致其注意力图退化为无意义的均匀分布,从而严重削弱多模态特征的判别性。为此,该方法以可靠样本的注意力分布为参考基准,通过最大均值差异正则化,引导不可靠样本的注意力分布向可靠样本注意力分布对齐,从而有效缓解了噪声信号对模型自适应的干扰。



3.实验结果

本文在包含多模态域偏移的基准数据集上进行了广泛的实验验证。结果表明,PTA能有效缓解预测偏差,提升模型在多模态并发偏移情况下的性能。

与当前的基线方法相比,PTA 在性能上取得了显著的优势:在 Kinetics50-MC 数据集上,准确率超越现有MM-TTA方法 6.1%;在 VGGSound-MC 数据集上,准确率较现有方法提升了 5.8%



4.总结

面对多模态并发偏移挑战,TTA算法需要同步量化样本的预测偏差与置信度。为此,本文提出 PTA 框架:其中 PDR 通过分配正负权重执行加权熵优化以阻断误差累积;AGA 基于最大均值差异对齐注意力分布以关注高语义价值的多模态线索。最终,我们的PTA方法有效抑制了模型退化,显著提升了模型在多模态并发偏移场景下的推理稳定性。

05

Style Evolving along Chain-of-Thought for Unknown-Domain Object Detection



作者:

张子豪1,吴阿明2,韩亚洪1*

单位:

1天津大学智能与计算学部

2合肥工业大学计算机科学与信息工程学院

邮箱:

zhangzihao2490@tju.edu.cn

amwu@hfut.edu.cn

yahong@tju.edu.cn

论文:

https://github.com/2490o/SE-COT

发表会议:CVPR 2025

*通讯作者



1.研究背景

目标检测模型在真实开放环境中常常面临未知域泛化问题:模型只在单一源域上训练,却需要直接适应从未见过的复杂目标域,例如夜晚、雨天、雾天以及艺术化图像等场景。已有单域泛化目标检测方法通常借助视觉-语言模型,通过文本提示模拟目标域风格,从而提升模型泛化能力。然而,真实场景中的域偏移往往由天气、时间、光照和成像风格等多种因素共同叠加形成。传统单步提示方法难以充分刻画这类复杂组合风格,导致模型在雨夜、雾天等极端场景下泛化能力受限。

基于思维链的风格演化方法



2.方法介绍

针对上述问题,本文提出了Style Evolving along Chain-of-Thought,简称 SE-CoT。该方法将思维链的思想引入风格建模过程,使风格描述从简单到复杂、从局部到整体逐步演化。具体而言,方法首先从天气、时间、风格、动作和细节等词表中采样基础词汇,再利用大语言模型组合生成短语,并进一步扩展为完整场景描述。随后,借助 CLIP 文本编码器提取逐级细化的文本特征,并与源域视觉特征对齐,学习风格迁移参数,从而在训练阶段持续模拟多样化未知目标域风格。为避免风格迁移破坏类别语义信息,本文进一步设计了风格解耦模块和类别特异原型聚类模块:前者将浅层特征分解为风格特征与内容特征,仅对风格特征执行演化;后者增强内容特征中的类别语义信息,使检测器能够更稳定地完成目标定位与分类。

2 SE-COT整体架构



3.实验结果

本文在两类具有挑战性的泛化基准上验证了方法有效性。首先,在多天气驾驶场景中,模型仅使用白天晴朗图像训练,并直接测试于晴朗夜晚、黄昏雨天、夜晚雨天和白天雾天等未知目标域。实验结果表明,SE-CoT 在多个恶劣天气场景中取得了优于现有单域泛化目标检测方法的性能。其次,在 Reality-to-Art 泛化基准上,模型从真实图像域泛化到 ComicWatercolor 和 Clipart 等艺术化目标域,同样获得了领先结果。定性可视化结果进一步表明,本文方法在低能见度、强风格偏移等复杂场景中能够减少漏检,更准确地识别车辆、行人等关键目标。

实验结果



4.总结

本文提出的 SE-CoT 从“单步风格模拟”转向“思维链引导的风格演化”,使模型能够在训练阶段接触更加丰富、细粒度且具有组合特性的风格分布,从而显著提升未知域目标检测能力。该方法不仅为单域泛化目标检测提供了一种新的视觉-语言建模思路,也表明基于思维链引导的风格演化可以有效服务于视觉任务中的复杂风格建模与域泛化问题。

编辑人:吴建龙、任文琦

专委会责任副主任:张勇东