【论文导读】2026年论文导读第四期

【论文导读】2026年论文导读第四期

CCF多媒体专委会 

202633日 16:48 北京 



论文导读

2026年论文导读第四期(总第一百四十四期)



 目 录

1

Uni-MuMER:    Unified Multi-Task Fine-Tuning of Vision-Language Model for    Handwritten Mathematical Expression Recognition

2

EF-3DGS:    Event-Aided Free-Trajectory 3D Gaussian Splatting

3

ARM:    Adaptive Reasoning Model

4

Towards    Interpretable and Efficient Attention: Compressing All by    Contracting a Few

5

Think    or Not? Exploring Thinking Efficiency in Large Reasoning Models    via an Information-Theoretic Lens

01

Uni-MuMER: Unified Multi-Task Fine-Tuning of Vision-Language Model for Handwritten Mathematical Expression Recognition



作者:

李彧1†,姜金1†,朱建华1,彭帅1,魏宝乐1,周宇轩1,高良才1*

单位:

1北京大学王选计算机研究所

邮箱:

liyu@stu.pku.edu.cn

jiangjin@stu.pku.edu.cn

zhujianhuapku@pku.edu.cn

pengshuaipku@pku.edu.cn

weibaole@stu.pku.edu.cn

sherco@pku.edu.cn

glc@pku.edu.cn

论文:

https://arxiv.org/pdf/2505.23566

代码链接:

https://github.com/BFlameSwift/Uni-MuMER

发表会议:NeurIPS 2025 Spotlight

*通讯作者

共同第一作者



1. 研究背景

手写数学表达式识别(HMER)作为科学文档数字化与信息检索的关键环节,是OCR领域公认的难题。与传统文字识别不同,HMER的核心难题在于识别表达式的二维空间结构关系,如上下标、分式、根式的复杂嵌套,以及手写风格的多样性。

现有研究大多围绕专门设计的网络结构展开,如树解码器与空间关系注意力机制等,但这种方法的改进零散且难以通用扩展,泛化能力有限。另一方面,预训练的视觉-语言模型(VLM)具备强大的跨任务泛化潜力,为统一范式的识别框架提供了可能性。



2. 方法介绍

1 Uni-MuMER方法总览图

本文提出 Uni-MuMER:在不改动架构的前提下,对开源 VLM进行全参数、多任务统一微调,把 HMER 的关键能力以“数据驱动任务”注入通用模型。框架将四类指令式任务融为一体:基础的端到端 LaTeX 生成(Vanilla HMER),面向二维排版推理的树感知链式思维(Tree-CoT,先输出 AST 序列化再输出 LaTeX),面向易混淆符号的错误驱动学习(EDL,先标注 <error_start>/<error_end> 再给出替换/插入/删除的纠错日志),以及增强长表达式一致性的符号计数(SC,先统计各符号出现次数再生成表达式)。三项辅助任务分别对应“结构理解—符号辨析—全局一致性”,并可在统一训练中形成互补增益。

2 Tree-CoT构造与序列化过程



3. 实验结果

实验结果显示,Uni-MuMER 在公开基准 CROHME 和大规模数据集 HME100K 上均取得了显著超越既有方法的性能。其中在CROHME 2014/2016/2019的平均表达式识别准确率达79.74%,比过往最佳的专有模型提高约20%,也比大型模型 Gemini2.5-flash 的零样本精度高出近24%

1 CROHME 数据集上的性能比较

随着训练数据规模逐步增加且手写风格更加多样化,如图三所示,Uni-MuMER在所有评估集上的性能持续提升,表现出卓越的数据多样性泛化能力。对比实验表2进一步表明,扩大数据规模反而会损害传统专用模型的性能,而Uni-MUMER 则显著受益于多样化数据训练。

增量训练数据规模的影响

对比CoMER模型,增量训练数据规模的影响



4.总结

总体来看,Uni-MUMER构建了一种通用、高效且可扩展的HMER识别新范式:无需专用架构设计便可实现卓越的泛化性能和高效推理(推理速度约为传统模型8倍),且已实现模型、数据与代码的完全开源,助力领域进一步发展。

02

EF-3DGS: Event-Aided Free-Trajectory 3D Gaussian Splatting



作者:

廖柏皓1,翟伟1*,万增余1,程致新1,杨文飞1,曹洋1,张天柱1,查正军1

单位:

1中国科学技术大学

邮箱:

liaobh@mail.ustc.edu.cn

wzhai056@ustc.edu.cn

wanzengy@mail.ustc.edu.cn

chengzhixin@mail.ustc.edu.cn

yangwf@ustc.edu.cn

forrest@ustc.edu.cn

tzzhang@ustc.edu.cn

zhazj@ustc.edu.cn

论文:

https://openreview.net/pdf?id=shFhW4zqd6

代码链接:

https://lbh666.github.io/ef-3dgs/

发表会议:NeurIPS 2025 Spotlight

*通讯作者



1.研究背景

近年来,神经辐射场(NeRF)3D高斯泼溅(3DGS)在新视点合成任务上取得了显著进展。虽然这些方法在给定精确位姿图像集的情况下表现优异,但在处理手持拍摄的“自由轨迹”视频时仍面临巨大挑战,而这类场景在VR/AR等领域具有广泛应用。

为了解决自由轨迹重建问题,现有工作通常借鉴SLAM的优化范式或引入深度、光流等几何先验。然而,在高速运动(或低帧率)场景下,这些方法的渲染质量和位姿估计精度会急剧下降。这种性能衰退主要归因于两个因素:首先,高速运动导致观测视角稀疏,使得场景重建成为一个欠约束问题,容易收敛到平凡解;其次,相邻帧之间巨大的位移破坏了传统方法所依赖的连续运动假设,使得光流等先验信息变得不可靠,进一步加剧了位姿与场景联合优化的难度。

事件相机作为一种生物启发式传感器,能够异步记录像素级的亮度变化,具有极高的时间分辨率和无运动模糊特性,天然适合捕捉高速运动信息以弥补帧间缺失。然而,将事件相机优势无缝集成到3DGS中并非易事:一方面,3DGS渲染的是绝对像素亮度,而事件相机记录的是差分亮度变化,直接结合容易导致优化问题病态或对噪声敏感;另一方面,事件流本质上编码了连续的运动轨迹,而基于帧的方法是离散的,两者在数据形式上存在鸿沟。针对上述挑战,本文提出了EF-3DGS框架,旨在通过挖掘事件流中的运动和亮度线索,实现鲁棒的高速场景自由轨迹重建。



2.方法介绍

EF-3DGS的核心思想是利用连续的事件流来辅助离散的视频帧,通过联合优化相机位姿和3D高斯属性来重建场景。我们的框架主要包含三个关键部分,分别解决了稀疏视角监督不足、运动估计困难以及颜色信息缺失的问题。

首先,为了利用事件数据的高时间分辨率特性,我们引入了事件生成模型(Event Generation Model, EGM)。通过将两个视频帧之间的时间间隔划分为多个子区间,并利用事件流积分生成潜在的亮度图像,我们构建了事件驱动的渲染损失。这一机制使得原本稀疏的视频帧之间建立了连续的监督信号,有效缓解了高速运动导致观测视角不足的问题,为3DGS提供了更密集的约束。

其次,针对自由轨迹下的位姿估计难题,我们提出了线性事件生成模型(LEGM)与对比度最大化(CMax)相结合的优化策略。我们利用3DGS渲染的深度图和相对相机位姿推导出光流,将事件反向投影(Warp)到参考时刻。通过最大化扭曲后事件图像(IWE)的清晰度,我们能够校准相机的相对运动。同时,LEGM建立了运动场与亮度梯度之间的联系,利用扭曲事件图像在梯度域上约束3DGS的几何结构,从而显著提升了位姿估计的准确性。

最后,由于事件相机仅记录亮度变化而缺乏颜色信息,直接优化可能导致场景颜色失真。为此,我们设计了光度集束调整(Photometric Bundle Adjustment, PBA)项,通过将邻近视频帧重投影到当前视角来约束颜色一致性。此外,我们采用了一种两阶段的Fixed-GS训练策略:第一阶段联合优化所有参数以恢复几何结构,第二阶段固定几何属性仅优化球谐系数以恢复纹理颜色。这种分离优化的策略有效地解决了跨视角的颜色一致性问题。

1 EF-3DGS方法概览。利用连续事件流辅助离散视频帧,在高速场景下实现联合位姿优化与3DGS重建



3.实验结果

我们在公开的Tanks and Temples数据集以及本文收集的真实世界数据集RealEv-DAVIS上进行了广泛的实验。为了模拟高速场景,我们对数据集进行了不同程度的时间降采样(6 FPS1 FPS),制造了极具挑战性的大位移观测条件。

1 Tanks and Temples数据集上的定量评估结果

定量实验结果表明,在极具挑战性的1 FPS设置下,EF-3DGS相比于目前最先进的无位姿重建方法(CF-3DGS, LocalRF)展现出了显著优势。我们的方法在渲染质量(PSNR)上提升了高达3dB,同时将绝对轨迹误差(ATE)降低了近40%。即使在大幅度减少帧率的情况下,我们的方法依然能保持较高的重建精度,而传统方法则出现了严重的性能下降。

在定性对比中,EF-3DGS重建的场景在几何结构和纹理细节上都更为清晰。相比之下,基线方法在高速运动区域往往会出现模糊、伪影或几何变形。此外,在人为引入初始位姿扰动的鲁棒性测试中,我们的方法也表现出了极强的抗干扰能力,证明了联合优化策略的有效性。

新视点合成的定性对比结果。EF-3DGS(本方法)在纹理细节和几何结构上均优于现有方法



4.总结

在这项工作中,我们提出了事件辅助的自由轨迹 EF-3DGS,这是一个将事件相机数据无缝集成到从随意捕捉的自由轨迹视频中重建 3DGS 任务的新型框架。我们的方法有效地利用了事件流中编码的高时间分辨率和运动信息来增强 3DGS 的优化过程,从而提高了渲染质量和相机位姿估计的准确性。通过引入事件生成模型和线性事件生成模型,我们弥补了 3DGS 中微分事件数据与绝对亮度渲染之间的差距。所提出的光度集束调整和 Fixed-GS 策略进一步确保了准确的色彩恢复和场景结构优化。在公共基准测试和真实世界数据集上的广泛实验验证了我们方法的有效性,证明了其在渲染质量和轨迹估计精度方面相比于最先进方法的显著改进。未来的工作将探索自适应参数调整策略,以增强该方法在各种重建任务中的通用性和易用性。

03

ARM: Adaptive Reasoning Model



作者:

伍思烨1,谢健2,张益恺1,陈艾利1,张凯2,苏煜2,肖仰华1*

单位:

1复旦大学

2俄亥俄州立大学

邮箱:

siyewu24@m.fudan.edu.cn

xie.1741@osu.edu

shawyh@fudan.edu.cn

论文:

https://openreview.net/forum?id=z9oeQrcNh9

代码链接:

https://github.com/TEAM-ARM/ARM

发表会议:NeurIPS 2025 (Spotlight)

*通讯作者



1.研究背景

近年来,大型推理模型(Large Reasoning Models, LRMs),如 OpenAI o1 和 DeepSeek-R1,在复杂推理任务上取得了显著进展。通过引入长链式思维(Long Chain-of-Thought, Long CoT),模型能够显式展开中间推理过程,从而有效提升整体推理准确率。然而,这种能力的提升也伴随着一个日益突出的副作用——过度思考(Overthinking):模型在面对难度较低的问题时,仍倾向于生成冗长的推理链,不仅造成不必要的计算与 Token 开销,还可能由于引入冗余推理步骤而干扰最终决策,甚至降低预测稳定性。



2.方法介绍

阶段一:SFT 学习多种推理形式

 作者首先通过监督微调(SFT)训练模型掌握多种推理形式,包括三种高效推理方式——直接回答(Direct Answer)、短链式思维(Short CoT) 和 代码推理(Code),以及一种用于复杂问题的 长链式思维(Long CoT)。该阶段的目标是让模型具备稳定生成不同推理格式的能力,而不涉及推理形式的选择策略。

阶段二:Ada-GRPO 学习推理形式选择

 在第二阶段,作者采用强化学习优化推理形式的选择。然而,传统 GRPO 容易使模型过度偏向准确率更高但开销更大的 Long CoT。为此,ARM 提出了 Ada-GRPO,通过两项机制进行改进:

 格式多样性放大奖励:对使用频率较低的推理形式放大奖励,鼓励探索;

 衰减机制:随着训练推进逐步减弱多样性奖励,保证最终准确率。

 借助 Ada-GRPO,模型能够在不同任务中自适应地选择合适的推理形式,在准确率与推理效率之间取得平衡。



3.实验结果

主要实验结果

实验结果表明,ARM 在多项推理评测任务(包括常识推理、数学推理和符号推理)上,相比基于 GRPO 的方法表现出更优的效率–性能权衡:在整体准确率与 GRPO 基本持平、部分任务上略有提升的同时,平均 Token 使用量减少约 30%,在简单任务上最高可节省 70% 的推理开销。

不同任务难度下的推理形式分布(Qwen2.5-7B

进一步的对比分析显示,不同训练策略呈现出明显差异:

 - SFT:模型虽掌握多种推理形式,但缺乏根据任务复杂度切换推理策略的能力;

 - GRPO:推理能力得到提升,但策略塌缩到频繁使用 Long CoT,导致 Token 消耗显著增加;

 - ARM(Ada-GRPO):能够根据任务难度自适应选择推理形式,在保持准确率的同时显著降低推理成本。

2 ARM-7B 在三种推理模式下的准确率(Acc.)与 Token 使用量(Tok.

此外,ARM 提供了三种推理模式以适配不同应用需求:

 (1)Adaptive Mode:自动选择推理形式(默认设置);

 (2)Instruction-Guided Mode:由用户显式指定推理形式,适用于已知最优推理策略的任务;

 (3)Consensus-Guided Mode:当多种高效推理形式给出不一致结果时,回退至 Long CoT 以保证可靠性。



4.总结

ARM 通过引入自适应的推理形式选择机制,并结合高效的 Ada-GRPO 训练策略,在不牺牲准确率的前提下显著提升了推理效率,有效减少冗余 Token 消耗,从而缓解了大型推理模型中的“过度思考”问题。同时,ARM提供了AdaptiveInstruction-Guided和 Consensus-Guided三种推理模式,能够灵活适配不同应用需求,在性能、效率与可控性之间实现良好平衡。

04

Towards Interpretable and Efficient Attention: Compressing All by Contracting a Few



作者:

闻其帅1,黄致远1,李春光1*

单位:

1北京邮电大学

邮箱:

wqs@bupt.edu.cn

huangzhiyuan@bupt.edu.cn

lichunguang@bupt.edu.cn

论文:

https://arxiv.org/abs/2509.16875

代码链接:

https://github.com/QishuaiWen/CBSA

发表会议:NeurIPS 2025

*通讯作者



1.研究背景

注意力机制已在多个领域取得了显著的经验性成功,但其背后的优化目标仍不明确。此外,自注意力的二次复杂度也变得越来越难以承受。尽管可解释性与效率本是两个相互促进的追求,已有工作却通常将二者分开进行研究。这使得高效注意力机制的设计在很大程度上仍依赖启发式方法,同时也令对注意力机制的解读和解释缺乏足够的指导意义。



2.方法介绍

本文受“压缩即智能”启发,提出下列将表征分布向多个低维子空间压缩的优化目标:

其中,最大化的目标为在全空间扩张表征分布(对应上式第一项),而在K个子空间中压缩一组少量的代表性令牌的分布(对应上式第二项),并通过上式中的约束项实现:对少量代表性令牌的压缩可以导致输入令牌也随之压缩。

通过展开该目标的优化过程,本文推导出如下计算公式:

其中,该公式主要由“收缩”和“广播”两项组成,收缩项实际恰好对应了表征编码率的梯度,而广播项实现了将少量代表性令牌上的收缩梯度广播给所有的输入令牌。经过工程化近似后,该“收缩-广播”注意力机制(Contract-and-Broadcast Self-Attention, CBSA)的计算流程如图1所示。此外,图一也展示了:随着代表性令牌的数目和结构变化,CBSA将推导出其他注意力机制。

1 CBSA的概述



3.实验结果

1 CBSA在图像分类数据集上与其他方法对比

2 CBSA在语义分割数据集上的性能以及对参数扰动的鲁棒性

3 CBSA通过微调预训练模型的性能和效率对比



4.总结

本文提出了一个用于推导注意力机制的优化目标,并以此统一对可解释性与效率的研究。通过将该目标的梯度优化步骤展开,本文推导出一种本质上可解释且高效的注意力机制,称为收缩-广播自注意力(CBSA)。本文发现,通过改变代表性令牌的数量与结构,CBSA能够涵盖softmax注意力、线性注意力以及通道注意力等多种注意力机制,从而揭示了它们之间的根本联系。我们在视觉任务上进行了大量实验,验证了CBSA的有效性。本工作建立的初步框架为以一种本质可解释的方式探索现有注意力机制的统一公式以及新的注意力机制提供了一个很有前景的研究方向。

05

Think or Not? Exploring Thinking Efficiency in Large Reasoning Models via an Information-Theoretic Lens



作者:

雍希贤1,周骁1*,张莹莹2,李锦林1,郑冶枫3,吴贤2*

单位:

1中国人民大学

2腾讯天衍实验室

3中国人民大学西湖大学

邮箱:

xixianyong@ruc.edu.cn

xiaozhou@ruc.edu.cn

ninzhang@tencent.com

jinlin2021@ruc.edu.cn

yefengzheng@westlake.com.cn

kevinxwu@tencent.com

论文:

https://arxiv.org/abs/2505.18237

代码链接:

https://github.com/chicosirius/think-or-not

发表会议:NeurIPS 2025

*通讯作者



1.研究背景

随着大推理模型(LRMs)OpenAI o1DeepSeek-R1QwQ-32B的出现,模型通过增加测试时计算量,即生成极长的思维链(CoT)来提升多步推理性能,已成为当下的主流范式。然而,这种“深度思考”往往伴随着冗长的输出,导致计算复杂度呈二次方增长,这不仅违背了人类推理中的“认知经济”原则,也大幅增加了实际应用中的部署成本。研究发现,盲目延长推理链并不总能带来准确率的持续提升,当推理长度超过一定容量时,冗余的信息位反而会诱发语义漂移和错误累积。因此,如何定量评估推理过程中的语义效率,并优化计算资源的动态分配,成为目前大推理模型研究中的核心挑战。



2.方法介绍

本研究通过信息论的视角重新审视了推理效率,并提出了一套定量评估与优化框架。首先,研究者将模型的推理过程视为一个由离散语义单元组成的序列,并提出了两个关键指标。其一,在整体回答层面,引入了“信息偏差”(InfoBias)指标,用于衡量模型生成的推理路径与理想正确轨迹之间的对齐程度,揭示长链条推理中可能存在的语义偏差。其二,在步骤层面,引入了“信息增益”(InfoGain)指标,用以量化每一个推理步对减少答案空间不确定性的贡献,反映推理过程中的有效信息流动。基于这些发现,研究提出了一种自适应思考(Adaptive Think)策略。该策略不再盲目完成全部推理,而是在推理的每个阶段实时监测模型内部的置信度,即通过计算答案空间的熵值(不确定性度量)来判断当前的思考深度。当模型展现出足够的信心且答案空间的不确定性降至预设阈值以下时,系统会自动触发停机机制,截断后续冗余的推理步骤并直接输出最终答案,从而实现推理深度的动态调节。

四种思考方式的示意图



3.实验结果

实验在QwQ-32BDeepSeek-R1-Distill等多个主流推理模型上展开,涵盖了包括数学竞赛、逻辑推理及常识问答在内的六项基准测试。结果显示,长推理链在处理错误答案时往往伴随着更高的信息偏差和更明显的语义冗余。采用自适应思考策略后,QwQ-32B在保持甚至略微提升平均准确率(提高1.10%)的情况下,实现了50.80%的大幅Token节省。在GSM8KAIME2025等数学任务中,Token使用量甚至减少了约58%68%。此外,研究发现大推理模型在面对知识密集型任务,例如常识问答时,往往具备较强的初始直觉,这使得自适应策略能够更早地终止推理过程,在不损失精度的前提下极大优化了推理成本。

2 GSM8K数据集上,不同模型的平均推理长度与每个token信息偏差关系

在两个数学推理基准上的性能与效率对比

在另外四个非数学推理基准上的性能与效率对比



4.总结

该论文定量揭示了当前推理模型中存在的效率困境,证明了推理深度并非越长越好。通过引入信息论指标,研究成功捕捉到了推理过程中的语义冗余和偏差,并证明了过度的计算投入往往面临边际效应递减的问题。论文提出的自适应思考策略作为一种轻量级的即插即用方法,能够根据任务复杂度动态分配推理资源,在准确性与成本之间取得了优异的平衡。这不仅为大模型的高效部署提供了实用方案,也为未来从模型架构设计层面实现更深度的推理优化提供了理论指导。

编辑人:吴建龙、任文琦

专委会责任副主任:张勇东