【论文导读】2026年论文导读第五期

【论文导读】2026年论文导读第五期

CCF多媒体专委会 

2026325日 22:15 北京 



论文导读

2026年论文导读第五期(总第一百四十五期)



 目 录

1

Conditional    Representation Learning for Customized Tasks

2

Understanding    Parametric and Contextual Knowledge Reconciliation within Large    Language Models

3

Fine-grained    List-wise Alignment for Generative Medication Recommendation

4

Revisiting    Generative Infrared and Visible Image Fusion Based on Human    Cognitive Laws

5

Uncertain    Knowledge Graph Completion via Semi-Supervised Confidence    Distribution Learning

01

Conditional Representation Learning for Customized Tasks



作者:

刘泓麟1,孙超2,胡鹏1,李云帆1*,彭玺1*

单位:

1四川大学

2中国科学院

邮箱:

tristanliuhl@gmail.com

sunchao@aircas.ac.cn

penghu.ml@gmail.com

yunfanli.gm@gmail.com

pengx.gm@gmail.com

论文:

https://doi.org/10.48550/arXiv.2510.04564

代码链接:

https://github.com/XLearning-SCU/2025-NeurIPS-CRL

发表会议:NeurIPS 2025 (Spotlight)

*通讯作者



1. 研究背景

表征学习旨在从原始数据中提取有效特征,以适用于分类、检索等各类下游任务。由于大部分数据集最显著的特征往往是“形状”或者“类别”,因此传统的表征学习方法也通常是基于该准则得到对应的表征。然而在现实应用中,时常会需要关注数据集其他层面的信息。如图1所示,研究人员在研究某种动物时,会接触到大量数据,不仅仅需要关注“大象”这个“物种”信息,还需要了解其“数量”和“环境”等信息,以进行更全面的分析。

此外,在各大电商平台,用户通常会根据不同的准则来搜索商品,因此平台也需要获取商品在多个准则下的信息。比如,对一件服装商品,需要获取其“类型”、“颜色”、“材质”、“穿搭场合”等,而传统的表征学习主要获取到的是“服装类型”这个层面的信息。

图1 传统表征学习(上)与条件表征学习(下)的比较

由此可见,只能学到通用表征的传统表征学习方法,难以满足复杂多变的现实需求。因此,探索如何构建适配不同准则的表征,对于推动相关研究和现实应用具有重要意义。



2. 方法介绍

为了以最小的成本得到适配指定准则的表征,论文提出了一种即插即用的条件表征学习方法。论文提出的方法无需训练,即可将通用表征转换为指定准则下表现力更强的条件表征。

图2 所提出的条件表征学习(CRL)的总体框架

如图2所示,给定准则(例如“颜色”),CRL首先让大语言模型LLM生成该准则相关的描述文本(例如“红色”,“蓝色”和“绿色”等)。随后,CRL将由VLM得到的通用图片表征,投影到由描述文本张成的空间中,得到该准则下的条件表征。该表征在指定的准则下具有更强的表现力,能有效应用到下游定制化任务。

上述做法的合理性在于,表征空间对应的表征是由其基底决定的。如图3所示,红黄蓝三原色可按一定比例组成任意颜色,x、y、z单位向量可张成三维空间中的任意向量。事实上,将基的概念进行推广,任何准则空间都可以由一组基张成。只要找到这组基,就可以通过投影操作,将原本的表征转换为在该准则下表现力更强的表征。而上述做法从本质上讲,就是通过大模型直接生成了指定准则对应的描述文本,来作为基的近似。这是一种十分简单的方式,但十分有效。

图3 不同准则空间中的基:(a) 颜色空间;(b) 三维向量空间



3. 实验结果

分类和检索任务是衡量表征学习性能的两个经典下游任务。论文在分类任务和检索任务上进行了充分的实验验证,部分实验结果如下:

表1 所提出的CRL在聚类任务上的性能

表2 所提出的CRL在服装检索任务上的性能

从上述结果中可以看出,CRL可以作为一个即插即用的模块,与现有多模态方法相结合,在不同准则下,其得到的条件表征在下游任务中都取得了比原表征更加优异的表现,性能甚至超过了对应领域的专用方法。更多实验可参见论文。



4.总结

传统表征学习方法倾向于提取捕获最显著语义特征的通用表征,而忽略了其他维度有意义的信息,这使得它们在侧重非主导语义的定制化任务中表现不佳。为了突破这一局限,我们提出了条件表征学习(CRL),通过“基变换”的过程,将通用表征转化为指定准则下表现力更强的条件表征,以更好地应用于各种下游任务。这种方法较为朴素,还存在着相当大的优化和探索空间,但已经能够取得非常不错的效果。我们希望以这篇文章为契机,让更多人能够关注到这一前景广阔但亟待开发的领域,共同推动表征学习走向更加灵活与可解释的新阶段。

02

Understanding Parametric and Contextual Knowledge Reconciliation within Large Language Models



作者:

Jun Zhao1,4, Yongzhuo Yang1, Xiang Hu4, Jingqi Tong1, Yi Lu1, Wei Wu4*, Tao Gui1,3, Qi Zhang1,2*, Xuanjing Huang1,2

单位:

1复旦大学计算与智能创新学院
2上海智能视觉计算协同创新中心
3上海创智学院
4蚂蚁集团

邮箱:

zhaoj19@fudan.edu.cn
wuwei19850318@gmail.com
qz@fudan.edu.cn

论文:

https://openreview.net/forum?id=76cFMRgEzQ

发表会议:NeurIPS 2025 (Spotlight)

*通讯作者



1.研究背景

大语言模型(LLM)在大规模预训练后,会在模型参数中隐式存储大量“参数化知识”(Parametric Knowledge),这使其具备强大的通用问答与推理能力。然而,参数化知识也存在两类天然局限:其一是覆盖性不足,预训练语料难以涵盖企业私有知识或垂直领域知识;其二是时效性不足,随着现实世界变化,模型内部知识可能逐渐过时。为弥补上述缺陷,检索增强生成(Retrieval-Augmented Generation, RAG)通过外部检索文档向模型注入“上下文知识”(Contextual Knowledge),从而提升回答的实时性与可控性。但在真实应用中,一个关键挑战是:当外部检索文档与模型参数中的既有知识发生冲突时,模型究竟会相信谁?已有研究发现,模型往往会表现出对原有信念的“固执”,或者受上下文表述质量、模型先验强度等因素影响而摇摆。然而,这些工作多停留在输出行为层面,对于模型内部如何在层间传播、融合并最终形成答案的机制仍缺乏可解释的刻画。为此,本文聚焦于一个核心问题:当参数化知识与上下文知识混合输入时,LLM 在内部是如何路由、竞争并调和不同来源知识的?



2.方法介绍

本文提出一种用于追踪知识在 Transformer 内部传播路径的机制分析框架,将知识的前向传播过程抽象为实体流(Entity Flow),并以此观察模型在处理混合来源知识时的内部动态。作者首先从"残差流(Residual Stream)"视角重写 Transformer 的计算形式,将每一层输出表示为注意力子层更新与MLP子层更新对残差的累积写入,从而能分别分析注意力与MLP对知识形成的贡献。直观而言,注意力机制负责在token间路由信息,而MLP子层则被视为访问参数化知识的重要通道。

图1 知识冲突示意图(Parametric vs. Contextual)

在此基础上,本文设计了实体感知探针(Entity-aware Probe)来解决传统线性探针无法对“临时指定实体”进行探测的问题。具体做法是在输入末尾附加结构化标记“[START] 实体 [END]”,并仅在输入嵌入层引入一个小规模 rank-8 的 LoRA 更新,使探针能够在不修改基座模型参数的前提下,对任意实体进行“相关性判别”(判断该实体是否与问题答案相关)。随后,作者将探针部署在每一层的三个关键位置进行追踪:注意力更新、MLP 更新、以及层输出,从而刻画实体信息如何在不同模块中生成、传播与累积。

图2 实体感知探针(Entity-aware Probing)框架



3.实验结果

论文首先通过归因任务验证实体感知探针的有效性:在 HotpotQA、TriviaQA 与 SQuAD 等数据上,探针方法能够较准确地识别包含证据的段落/句子,并且在将基座模型随机初始化后,探针性能显著崩塌,说明探针捕获的模式主要来源于 LLM 内部的知识加工机制,而非探针自身的参数记忆能力。

表1 通过归因任务评估实体感知探针有效性的实验结果

进一步地,作者构造了基于 HotpotQA 的知识冲突场景:将原始事实实体替换为虚构反事实实体,形成“上下文知识(反事实)”与“参数化知识(事实)”的对抗输入,并用 PRAUC 指标量化不同层/不同注意力头中两类知识的“信息强度”。实验发现:(1)上下文知识与参数化知识由不同注意力头负责路由,二者的高强度头集合几乎不重合,体现出明显的功能分工;(2)上下文知识往往在较早层通过注意力迅速显现,而参数化知识则更像碎片化信号,需要经由多层 MLP 与残差累积逐步增强;(3)在混合上下文中,模型呈现出“同类竞争、异类并行”的特征:来自上下文的事实与反事实信息会相互竞争,但上下文知识与参数化知识之间并不存在直接的注意力层面零和竞争。

图3 注意力头信息强度可视化

图4 注意力子层、前馈子层与Transformer层信息强度变化趋势

此外,作者还通过对关键注意力头进行置零干预,提供了因果证据:去除“上下文头”会降低模型输出上下文答案的比例并增强对参数化知识的依赖;去除“记忆头”则相反,进一步验证了两类注意力头在知识调和中的不同角色。总体而言,冲突信息并不会被彻底擦除,而是长期以残差信号形式共存;当多来源知识一致时,其强度会在残差流中逐步叠加并最终主导输出。

表2 注意力头的因果干预实验



4.总结

本文从机制可解释性角度系统研究了 RAG 场景下大语言模型对“参数化知识”与“上下文知识”的冲突调和过程,提出实体感知探针框架,将知识传播刻画为可追踪的实体流,并在注意力、MLP 与层输出三个层面进行动态分析。实验揭示了三条关键规律:注意力头专门化带来的并行路由、上下文与参数化知识在传播速度与累积方式上的非对称性、以及冲突共存与一致叠加的“叠加式调和”机制。这些发现不仅为理解 RAG 内部工作原理提供了更细粒度的证据,也为未来设计更可靠、更可控的检索增强模型与上下文注入策略提供了理论依据。

03

Fine-grained List-wise Alignment for Generative Medication Recommendation



作者:

范晨晓1,高崇铭1*,石文焘1,龚雅馨1,赵子豪1,冯福利1*

单位:

1中国科学技术大学

邮箱:

simonfan@mail.ustc.edu.cn

chongminggao@ustc.edu.cn

shiwentao123@mail.ustc.edu.cn

gyx2022@mail.ustc.edu.cn

zzh1998@mail.ustc.edu.cn

fulifeng93@gmail.com

论文:

https://openreview.net/pdf?id=Quo3XadYcZ

代码链接:

https://github.com/cxfann/Flame

发表会议:NeurIPS 2025 (Spotlight)

*通讯作者



1.研究背景

准确且安全的药物推荐对于辅助临床决策至关重要,尤其是在处理多并发症的复杂病例时。然而,现有的推荐系统大多采用“逐点预测”范式,不仅忽略了药物间的协同效应,更难以规避潜在的药物相互作用风险。

随着大语言模型(LLM)的兴起,利用其强大的语义能力处理复杂病历成为可能。然而,将LLM的生成能力与严格的医疗安全标准对齐面临着巨大挑战。现有的强化学习对齐方法(如GRPO)通常采用“基于结果(Outcome-based)”的奖励机制,即等待整个列表生成结束后才给予一个总分。这种粗粒度的反馈导致了严重的信用分配(Credit Assignment)难题:当模型生成了一组得分较低的处方时,它难以辨别究竟是哪一个具体药物导致了安全性违规或疗效下降。为了解决这一技术痛点,本研究提出将药物推荐重构为列表级(List-wise)序列决策问题,并设计了细粒度的逐步对齐策略,从而实现对生成过程的精准控制。



2.方法介绍

针对上述挑战,我们提出了 FLAME(Fine-grained List-wise Alignment for generative Medication recommendation)框架。该框架包含两个核心技术创新:

  (1)Step-wise GRPO:为了解决传统 GRPO 信用分配模糊的问题,我们将处方生成过程分解为一系列离散的决策步,每一步对应一个药物的添加或移除操作。通过引入基于势能函数的奖励塑造(Potential-based Reward Shaping)机制,模型不仅能获得最终的处方评分,还能在生成的每一步收到关于准确性和安全性的即时细粒度反馈。这种密集的奖励信号极大地提升了模型在复杂约束下的学习效率和策略稳定性。

图1 标准GRPO与Step-wise GRPO的对比。Step-wise GRPO利用势能函数将结果奖励分配到生成的每一步,实现了细粒度的信用分配

  (2)两阶段生成与多源知识融合:FLAME 采用了“药物级初筛”到“列表级精修”的两阶段推荐流程。首先利用分类器筛选候选药物,随后由列表策略模型(List-wise Policy)执行添加或移除操作以优化处方。此外,为了弥补LLM在处理结构化数据上的短板,我们设计了混合表示机制,将ICD诊断编码、手术编码等结构化知识通过协同编码器映射到LLM的语义空间,与临床文本进行深度融合。

图2 FLAME框架概览:包含药物级初筛与基于指令微调的列表级精修两个阶段



3.实验结果

我们在 MIMIC-III、MIMIC-IV 和 eICU 三个主流公开数据集上进行了广泛实验。结果显示:

综合性能领先:FLAME 在 Jaccard 和 F1 分数上均显著优于现有的 SOTA 方法。

表1 各模型在 MIMIC-III 数据集上的推荐准确性指标对比

安全可控:FLAME 能够通过调整安全惩罚系数,灵活地在准确率和 DDI 率之间取得最佳平衡,展现出优越的可控性。

泛化性强:在跨时间(MIMIC-IV)和跨机构(eICU)的测试中,FLAME 表现出极强的鲁棒性,能够有效适应不同临床环境的数据分布差异。

图3 模型的综合性能分析。(a) 安全性与准确性的权衡曲线;(b) 跨时间泛化能力;(c) 跨机构泛化能力

逐步对齐机制的有效性:消融实验表明,相比于基于结果反馈的标准 GRPO,引入 Step-wise GRPO 后模型能够获得更密集的奖励信号。训练曲线显示,Step-wise 机制显著加速了收敛过程并提升了训练稳定性,从实证角度验证了解决信用分配问题的必要性。

图4 Step-wise GRPO 与标准 GRPO 的训练过程对比



4.总结

本工作提出了一种基于大语言模型的细粒度列表级对齐框架 FLAME。通过创新的 Step-wise GRPO,我们有效解决了传统强化学习对齐中存在的信用分配难题,实现了对药物生成过程的精细化控制。结合多源医疗知识融合,FLAME 在保证处方准确性的同时显著降低了用药风险。该工作为构建高可靠、可解释的临床决策支持系统提供了新的技术范式。

04

Revisiting Generative Infrared and Visible Image Fusion Based on Human Cognitive Laws



作者:

郭林1,罗晓清1*,谢威1,张战成2,李辉1,王锐1,冯振华1,宋晓宁1

单位:

1江南大学

2苏州科技大学

邮箱:

lin_guo1229@163.com

xqluo@jiangnan.edu.cn

xiaoxie346@gmail.com

cimszhang@163.com

lihui.cv@jiangnan.edu.cn

cs_wr@jiangnan.edu.cn

fengzhenhua@jiangnan.edu.cn

x.song@jiangnan.edu.cn

论文:

https://openreview.net/forum?id=wvcYIEaD5X

代码链接:

https://github.com/lxq-jnu/HCLFuse

发表会议:NeurIPS 2025 Spotlight

*通讯作者



1.研究背景

红外与可见光图像融合旨在同时保留热目标显著性与自然纹理细节,广泛应用于智能驾驶、目标感知与复杂环境视觉增强。但现有生成式融合方法仍存在三类问题:一是对模态信息的选择缺乏可解释性,二是生成能力不足,难以兼顾结构与细节,三是过度依赖数据分布,在噪声、退化或场景变化下鲁棒性有限。



2.方法介绍

HCLFuse将数据驱动的生成模型与受理论约束的概率建模相结合,在认知启发下实现对跨模态信息的有效提炼与一致性生成。具体而言,HCLFuse首先围绕无监督融合中的信息映射与量化机制,设计了多尺度掩码调控的变分瓶颈编码器。该编码器通过后验概率建模、信息分解与多尺度约束,对红外与可见光图像中的低层模态信息进行压缩、筛选与重组,从而提取更加准确、紧凑且具有判别性的结构表征。与直接依赖特征叠加或经验性权重分配的方式不同,该过程更强调对关键信息的选择性保留,有助于提升融合表示的结构一致性与模态可解释性。在此基础上,方法进一步将扩散模型的概率生成能力与物理规律相结合,构建时变物理引导机制。该机制并非仅将扩散过程作为通用生成器使用,而是将物理先验以动态调控的方式融入不同生成阶段,使模型在逐步恢复和重建融合图像的过程中,更好地感知数据的内在结构属性与跨模态对应关系。通过这种方式,模型不仅能够增强对高保真结构细节的生成能力,还能够降低对训练数据质量和分布完备性的过度依赖,从而提升复杂场景下融合结果的稳定性与鲁棒性。

图1 HCLFuse 的整体架构以及扩散过程中的特征演变



3.实验结果

在 MSRS、TNO、FMB 和 MFNet 四个公开数据集上,本文与 17 种代表性方法进行了系统比较,并基于 12 项评价指标对融合性能进行了全面评估。实验结果表明,HCLFuse 在定性视觉效果与定量性能方面均表现出较强优势,尤其在纹理清晰度、结构保真性和信息丰富度等方面取得了领先结果。同时,在下游语义分割任务中,HCLFuse 生成的融合图像能够更有效地保留细粒度结构与语义信息,从而显著提升分割精度。

图2 高斯曲率对比可视比

图3不同融合方法的融合结果可视化对比

表1 MSRS数据集上不同融合方法的融合性能定量评价结果

图4不同融合方法的分割结果可视化对比

表2不同融合方法的语义分割性能定量评价结果



4.总结

总体而言,HCLFuse 的核心在于通过认知启发的信息选择机制强化低层表示建模,并结合物理约束下的扩散生成机制提升融合结果的结构保持能力与语义一致性,从而在生成框架下实现红外与可见光信息的协同融合,为生成式图像融合研究提供了一条兼具理论支撑与方法创新的技术路径。

05

Uncertain Knowledge Graph Completion via Semi-Supervised Confidence Distribution Learning



作者:

吴天星1,2*,朱曙曈1,王靖婷1,徐宁1,2*,漆桂林1,2,王昊奋3

单位:

1东南大学计算机科学与工程学院

2新一代人工智能技术与交叉应用教育部重点实验室(东南大学)

3同济大学设计创意学院

邮箱:

tianxingwu@seu.edu.cn

shutong_zhu@seu.edu.cn

xning@seu.edu.cn

论文:

https://arxiv.org/abs/2510.16601

代码链接:

https://github.com/seucoin/unKR/tree/main/unKR_ssCDL

发表会议:NeurIPS 2025

*通讯作者



1.研究背景

不确定性知识图谱(UKGs)将每个三元组与一个置信度分数相关联,以提供更精确的知识表示。近年来,由于现实世界的UKGs存在不完备的问题,UKG补全受到了越来越多的关注。UKG补全旨在补全缺失的三元组和置信度,当前的研究通过学习UKG的嵌入来实现UKG补全。然而,现有的方法在学习过程中忽略了一个事实,即大多数UKGs的三元组置信度分布极度不平衡,在这种不平衡的数据上学习,会导致基于嵌入的模型无法拟合相对低置信度的样本,从而降低用于UKG补全的生成嵌入的质量。为了解决上述问题,本文提出了ssCDL,这是一种半监督置信度分布学习方法,用于UKG补全。



2.方法介绍

图1(a)展示了ssCDL的整体框架,该方法包含两个关键模块:基于置信度分布的关系学习器(CDL-RL)和伪置信度分布生成器(PCDG)。我们首先将标记数据中的所有三元组置信度转化为置信度分布。CDL-RL 同时使用标记数据和由PCDG生成的伪标记数据来学习UKG的嵌入。PCDG为未标记的数据生成高质量的伪置信度标记,而CDL-RL以迭代的方式利用这些伪标记数据并进一步提高其性能。CDL-RL与PCDG具有相同的结构(如图1(b)所示),但是训练过程不同。CDL-RL通过最小化标记数据和伪标记数据在置信度预测和链接预测上的损失来进行优化,而PCDG评估CDL-RL在利用由PCDG生成的伪标记数据后的性能,并将该性能作为元学习目标。PCDG由CDL-RL利用标记数据进行元优化。ssCDL通过迭代训练CDL-RL和PCDG进行元自训练,从而完成学习。

图1 (a) ssCDL的方法概览;(b) CDL-RL 和 PCDG 的框架



3.实验结果

我们在NL27k和CN15k这两个广泛使用的UKG数据集上进行实验。我们将ssCDL 与基线模型进行了比较,如表1所示,在置信度预测任务中,ssCDL在MSE和MAE上均优于所有的基线模型,与在NL27k上表现最佳的基线模型相比,ssCDL的MSE和MAE分别降低了52.6%和17.6%。与在CN15k上表现最佳的基线模型相比,ssCDL的MSE和MAE分别降低了63.8%和53.2%,这表明ssCDL能够有效捕捉UKGs中的语义、结构以及置信度信息,从而实现更准确的三元组置信度预测。表1还展示了链接预测的对比结果,ssCDL在Hits@1和WMRR上表现最佳,这表明ssCDL能够为不同的查询预测更准确的尾实体。相比于置信度预测,ssCDL在链接预测上相较于基线模型没有取得十分显著的提升,这是因为我们设计的置信度分布学习和元自训练是用于优化置信度预测以获得更好的UKG嵌入,而链接预测除了最小化排序损失外,仅受益于这些嵌入,这种相对间接的优化可能导致ssCDL对链接预测的提升不如置信度预测显著。不过,ssCDL在链接预测上仍然优于所有基线模型,这表明ssCDL的训练是一个有效的多任务学习过程。

表1 ssCDL与基线模型在NL27k和CN15k数据集上进行置信度预测(CP)与链接预测(LP)的对比结果



4.总结

本工作提出了一种用于UKG补全的半监督置信度分布学习方法ssCDL。ssCDL由CDL-RL和PCDG组成,通过元自训练进行迭代训练。这种半监督学习框架以及三元组置信度分布的引入,有助于解决在用于UKG补全的UKG嵌入学习中三元组置信度分布极不平衡的问题。实验结果表明,与最先进的基线模型相比,ssCDL在现实世界的UKG数据集上表现最佳。

编辑人:吴建龙、任文琦

专委会责任副主任:张勇东