【论文导读】2026年论文导读第十一期

【论文导读】2026年论文导读第十一期

CCF多媒体专委会 

202678日 08:00 北京 



论文导读

2026年论文导读第十一期(总第一百五十一期)



 目 录

1

DyFo:    A Training-Free Dynamic Focus Visual Search for Enhancing LMMs in    Fine-Grained Visual Understanding

2

LATEXBLEND:    Scaling Multi-concept Customized Generation with Latent Textual    Blending

3

FreeCloth:    Free-form Generation Enhances Challenging Clothed Human Modeling

4

Streaming    Drag-Oriented Interactive Video Manipulation: Drag Anything,    Anytime!

5

RF-Agent:    Automated Reward Function Design via Language Agent Tree Search

01

DyFo: A Training-Free Dynamic Focus Visual Search for Enhancing LMMs in Fine-Grained Visual Understanding



作者:

李耕1,徐婧林2,赵韫禛3,彭宇新1*

单位:

1北京大学

2北京科技大学

3腾讯计算机系统有限公司

邮箱:

ligeng@stu.pku.edu.cn

xujinglinlove@gmail.com

yunzhenzhao@tencent.com

pengyuxin@pku.edu.cn

论文:

https://doi.org/10.1109/CVPR52734.2025.00850

代码链接:

https://github.com/PKU-ICST-MIPL/DyFo_CVPR2025

实验室网站:

https://mipl.pku.edu.cn

实验室公众号:

MIPLatPKU

发表会议:CVPR 2025 (Highlight/亮点论文)

*通讯作者



1. 研究背景

人类在复杂环境中能够通过“视觉搜索”迅速过滤无关视觉信息并聚焦于任务相关区域。然而,当前的大多态大模型(LMMs)在处理细粒度视觉理解任务时仍面临挑战:固定分辨率模型容易丢失小目标细节,而动态分辨率模型在适应高分辨率时引入大量无关背景噪声干扰,导致严重的“幻觉”现象。受人类认知机制启发,本文提出了 DyFo(Dynamic Focus),一种无需训练的动态聚焦视觉搜索方法。DyFo 通过 LMM 与视觉专家的双向交互,模拟人类视线的动态调整过程,在不增加训练成本的前提下,提升模型对复杂场景细粒度感知能力。



2. 方法介绍

1 DyFo 方法框架图

如图1所示,DyFo方法主要由两个模块组成:

焦点调节器 (Focus Adjuster): 该模块实现了 LMM 与视觉专家(如 Lang-SAM)之间的双向循环协作。LMM 根据当前焦点生成文本引导,视觉专家则据此精准放大或缩小图像子区域,协作实现“语义聚焦(Semantic Focus)”或“语义扩散(Semantic Scatter)”的动作调整。

焦点树搜索 (Focus Tree Search):该模块将视觉搜索建模为一个树搜索问题。利用 MCTS 算法在“探索”与“利用”之间取得平衡,寻找最优的观察路径。为了确保搜索的可靠性,研究团队设计了一种基于共识的奖励机制:只有当 LMM 的预测结果与视觉专家的定位保持一致时,才会根据有效面积占比给予奖励,从而过滤无关噪声。在搜索完成后,DyFo方法采用多粒度投票策略,综合搜索树中不同层级和路径的预测信息,最终输出最稳健的答案。这种“即插即用”的设计使其能够适配各种固定或动态分辨率的 LMM



3. 实验结果

研究团队在 V* Bench(评估细粒度视觉理解)和POPE(评估视觉幻觉)两个代表性基准上进行评估,涵盖了 LLaVA-1.5 和 Qwen2-VL 等主流模型。

细粒度视觉理解任务上的定量测试

视觉幻觉数据上的定量测试

在 V* Bench 高分辨率基准上,DyFo方法使得Qwen2-VL模型的平均正确率提升了 8.90%,使得LLaVA-1.5平均正确率提升了 10.48%

在 POPE 9种采样设置下,DyFo方法稳定提升了多种模型的准确率和 F1 分数。实验表明,通过过滤无关干扰,该方法能有效降低 LMM 在复杂场景中“指鹿为马”的概率。

2 DyFo方法与多模态大模型基线的定性结果对比



4.总结

DyFo方法为增强 LMM 的精细化视觉感知提供了一条高效的技术路径。它证明了:提升大模型的视觉能力并不一定需要无止境地增加分辨率或训练数据,通过引入模拟人类认知的“动态聚焦”机制,模型可以在现有表征基础上通过“更聪明地观察”来突破性能瓶颈。该研究对视觉助手、自动驾驶及精密工业检测等需要极高细节感知能力的具身智能场景具有一定的理论和应用价值。

02

LATEXBLEND: Scaling Multi-concept Customized Generation with Latent Textual Blending



作者:

金健1,于振波1,沈阳1,付振勇1*,杨健1*

单位:

1南京理工大学

邮箱:

jinj@njust.edu.cn

zhenboyu@njust.edu.cn

shenyang98@njust.edu.cn

z.fu@njust.edu.cn

csjyang@njust.edu.cn

论文:

https://openaccess.thecvf.com/content/CVPR2025/html/Jin_LaTexBlend_Scaling_Multi-concept_Customized_Generation_with_Latent_Textual_Blending_CVPR_2025_paper.html

代码链接:

https://github.com/jinjianRick/latexblend

发表会议:CVPR 2025 (Highlight)

*通讯作者



1.研究背景

定制化文本到图像生成技术(Customized T2I generation)能根据文本提示生成有关于用户指定的视觉概念(如特定的宠物或物体)的图像。虽然单概念定制已取得显著进展,但随着创作需求向多概念场景演进,现有方法面临严峻挑战:一是计算效率低下,联合训练或数据增强会导致微调开销随概念数量呈指数级增长;二是生成质量劣化,多概念组合常导致模型偏离预训练的正常去噪路径,产生“去噪偏差”,引发概念遗漏、特征混淆及布局失真等问题。因此,如何在保持低计算开销的同时,实现高保真、布局合理的大规模多概念定制生成,已成为当前该领域亟待突破的技术瓶颈。

多概念定制化生成中的质量退化与去噪偏移



2.方法介绍

本文的核心贡献在于发现了文生图模型中的潜在文本空间(Latent Textual Space),该空间位于文本编码器与线性投影层之间,展现出在多概念定制化生成中高效且高质量扩展的优良特性。基于这一发现,本文提出了多概念可扩展定制化生成框架 LATEXBLENDLATEXBLEND的核心方案是基于潜在文本空间进行单概念表示与多概念融合。在单概念微调阶段,LATEXBLEND 将每个概念独立训练并存储在“概念银行”中。为了获得紧凑且位置无关的特征表示,本文引入了一个辅助的基础文本编码流。通过在微调中将概念相关标识符特征与基础文本特征进行解耦,迫使特定概念的信息集中在紧凑的潜文本向量中。在多概念融合推理阶段,模型直接从概念银行中检索出所需的多个潜文本特征,并通过特征替换将其无缝融合到目标提示词的潜特征序列中。为解决多主体生成中常见的特征混淆问题,文章提出了融合引导机制。该机制通过优化交叉注意力图,确保每个标识符与其对应类别词的空间重叠最大化,同时最小化不同主体间的空间重叠。

2 LATEXBLEND 总体框架示意图



3.实验结果

实验结果表明,LATEXBLEND 在多概念定制生成任务中展现了卓越的性能,其在生成质量与计算效率上均优于现有基线。定量分析上,该方法在文本对齐度以及 概念保真度指标的综合性能上优于前沿基线,证明其能更精准地还原对象特征并遵循提示词语义。定性实验中,LATEXBLEND 生成的图像布局和谐且主体间无干扰,有效解决了概念遗漏和特征混淆问题。在效率方面,其微调成本随概念数仅呈线性增长,且推理阶段无需额外计算开销,展现了极强的扩展性。

3 LATEXBLEND 与其他方法在生成质量(左)与微调效率(右)上的定性对比结果

4 LATEXBLEND 与其他方法的定性对比结果



4.总结

LATEXBLEND 通过在潜在文本空间进行概念表示与融合,实现了高效、高保真的多概念定制生成。该框架有效减轻了多主体生成中的去噪偏差,在保持极佳布局一致性与主体保真度的同时,显著降低了计算开销。

03

FreeCloth: Free-form Generation Enhances Challenging Clothed Human Modeling



作者:

叶航1,马霄璇1*,兹海1,朱文韬1,王亦洲1,2,3,4*

单位:

1北京大学前沿计算研究中心

2北京大学人工智能研究院

3视觉技术国家工程研究中心

4北京大学通用人工智能全国重点实验室

邮箱:

yehang@pku.edu.cn

maxiaoxuan@pku.edu.cn

cihai@pku.edu.cn

wtzhu@pku.edu.cn

yizhou.wang@pku.edu.cn

论文:

https://arxiv.org/abs/2411.19942

代码链接:

https://github.com/AlvinYH/FreeCloth

项目主页:

https://alvinyh.github.io/FreeCloth/

视频介绍:

https://www.youtube.com/watch?v=4dyM1hjTBdQ

发表会议:CVPR 2025 Highlight

*通讯作者



1.研究背景

数字角色动画生成(Digital Avatar Animation)VR/AR、影视动画、游戏创作和数字人等场景中具有广泛应用。传统流程依赖线性混合蒙皮(LBS)驱动人体与衣物形变。但对于长裙等拓扑复杂、远离骨骼的宽松衣物,LBS的线性凸组合假设难以成立,易导致撕裂、穿模及褶皱失真。现有数据驱动方法多将衣物视作人体表面的“延伸”,对宽松服装的建模仍存在明显瓶颈。

1 FreeCloth框架示意图



2.方法介绍

针对上述问题,本文提出基于点云的混合式人体衣物建模框架FreeCloth。核心思想是摒弃单一LBS机制,依据衣物与骨骼运动的耦合度采用差异化策略。FreeCloth将点云划分为三部分:(1)未覆盖体表区域(头、手等):直接保留原始点云;(2)LBS形变区域(贴身衣物):采用“线性LBS+非线性残差”建模,保留结构先验;(3)自由生成区域(宽松衣物):远离骨骼、受LBS约束弱,由生成网络根据姿态直接预测点云几何,并结合碰撞约束与姿态增强减少穿模。该框架兼顾了贴身区的稳定性与宽松区的拓扑灵活性,大幅提升了复杂衣物的表达能力。

2 FreeCloth整体框架。方法将人体区域划分为未覆盖、LBS形变和自由生成三部分,并采用对应建模策略



3.实验结果

本文在覆盖多款式裙装的ReSynth合成数据集上进行评估。定量实验(基于多视角法线图的MSEFID指标)表明,FreeCloth显著优于POPSkiRT等现有方法,并在用户研究中获63.4%偏好率。定性结果显示,现有方法在宽松裙装上易出现撕裂、闭合缺陷或不自然褶皱;而FreeCloth能在宽松区域生成高保真自然细节,并保持点云分布均匀。尤其在极具挑战的长裙样本中优势更为显著。

1 FreeCloth与现有方法在ReSynth数据集上的定量结果

3 FreeCloth和现有方法的定性对比结果

4 FreeCloth和现有方法的宽松衣物生成效果对比



4.总结

本文提出FreeCloth——一种基于点云的混合式人体衣物建模框架,通过结合LBS形变与自由生成技术,实现对不同服装区域的针对性建模。该框架有效解决了现有方法在宽松衣物建模中存在的“撕裂”伪影、点云密度不均等问题,具有更强的拓扑灵活性,能生成逼真的高质量褶皱细节。在包含不同长度、松紧度及款式的宽松衣物测试中,FreeCloth均展现出卓越的表征性能。我们相信,这种混合建模范式将为该领域的研究提供新的思路。

04

Streaming Drag-Oriented Interactive Video Manipulation: Drag Anything, Anytime!



作者:

周君宝1,周源1*,赵克森1,徐青山2,朱贝尔2,洪日昌3,张含望1

单位:

1南洋理工大学

2中国科学技术大学

3合肥工业大学

邮箱:

JUNBAO001@e.ntu.edu.sg

yuan.zhou@ntu.edu.sg

KESEN002@e.ntu.edu.sg

qingshan.xu@ustc.edu.cn

beier.zhu@ustc.edu.cn

hongrc.hfut@gmail.com

hanwang.zhang@ntu.edu.sg

论文:

https://arxiv.org/abs/2510.03550

代码链接:

https://github.com/junbao-zhou/DragStream

发表会议:ICLR 2026

*通讯作者



1.研究背景

近年来,视频扩散模型(VDMs)在生成写实流畅的视频内容上取得了突破性进展,自回归架构的 VDMs 更是推动流式视频生成成为行业主流,让用户能够实时观看视频生成过程。但与此同时,现有技术在交互式控制能力上存在明显短板:用户无法在视频流式生成的过程中,对不满意的画面进行实时、细粒度的修改,只能等待整段视频生成后重新调整提示词并重新生成,创作效率极低。

拖拽式操作凭借直观易用、控制精细的特点,已成为图像编辑领域的核心交互方式,也被视为视频交互式控制的最优方向。然而现有拖拽视频方案存在三大核心局限:一是功能碎片化,多数方法仅支持单帧编辑或固定轨迹动画,无法同时覆盖编辑与动画场景,也难以支持 2D/3D 旋转、自由变形等丰富操作;二是无法适配流式生成范式,现有方案多针对双向 VDMs 设计,不能在自回归 VDMs 的流式生成过程中实时介入;三是成本与效果难以平衡,基于微调的方案需要耗费数百甚至上千小时的 H100 GPU 算力,而免训练方案则极易出现拖拽失效、画面伪影、物体属性错乱等问题。

更关键的是,直接将拖拽操作应用于流式场景会面临两个无法回避的技术难题:一是拖拽带来的扰动会在隐空间持续累积,引发严重的隐分布漂移,最终中断拖拽过程;二是流式生成依赖的上下文帧会严重干扰拖拽效果,导致模型生成重复部件、画面失真等不自然内容。针对上述问题,本文提出了流式拖拽导向交互式视频操控(REVEL)全新任务,并设计了免训练的 DragStream 方法予以解决。



2.方法介绍

本文提出的 DragStream 是一种完全免训练的解决方案,可无缝集成到任意现有自回归视频扩散模型中,无需修改模型主干。其核心通过两大创新模块,针对性解决流式拖拽编辑中的隐分布漂移与上下文干扰两大难题。

图 1 DragStream 整体技术管线示意图。完整呈现了从用户输入拖拽指令,到隐编码迭代优化,再到 ADSR 分布校正、SFSO 空频选择性优化,最终输出修改后视频帧的全流程

(1)自适应分布自校正(ADSR)策略

拖拽操作会让视频帧的隐编码均值、方差出现剧烈波动,导致隐嵌入严重偏离模型学习到的原始分布,最终造成拖拽过程中断、物体颜色或类别发生非预期变化。

ADSR 策略的核心思路是利用相邻帧的稳定统计信息约束当前帧的隐分布:在每一轮隐优化迭代后,记录当前帧前序若干相邻帧隐嵌入的均值和标准差,用这些稳定的统计值对当前帧的隐编码进行分布校正。这一简单高效的设计能够持续抑制拖拽带来的分布漂移,保证拖拽过程稳定进行,同时避免物体属性出现异常变化。

图 隐分布漂移挑战与 ADSR 效果对比。第一行展示了拖拽操作后隐编码均值、方差、极值的剧烈波动;无 ADSR 策略时,隐分布严重漂移,拖拽过程中断,物体属性出现异常;加入 ADSR 后,分布漂移被有效抑制,拖拽过程稳定,画面内容保持正常

(2)空频选择性优化(SFSO)机制

上下文帧是流式视频生成的基础,但过往帧的视觉线索极易误导模型,在拖拽区域周边生成重复部件、伪影等异常内容。SFSO 机制从频域和空域两个维度实现选择性优化,在充分利用上下文信息的同时,有效缓解其带来的干扰。

可切换频域选择(SFS)策略:高频信息易引入伪影,低频信息则缺乏细粒度细节。本文在模型自注意力模块中引入可切换的巴特沃斯滤波器,在每一轮优化迭代中随机选择不同的截止频率对特征进行滤波,平衡高低频信息的传播,既保留画面细节,又避免高频噪声主导拖拽过程。

临界驱动空域选择(CSS)策略:通过高斯滤波图对梯度反向传播进行空间约束,让梯度权重随与拖拽区域中心的距离增加而衰减,使优化过程始终聚焦在拖拽核心区域,避免梯度泄露到背景和非编辑区域,减少画面失真。

上下文干扰挑战与 SFSO 效果对比图。对比无 SFSO 时上下文干扰导致的重复部件、画面伪影,以及加入 SFSO 后拖拽效果精准、画面自然流畅的结果



3.实验结果

由于 REVEL 是本文提出的全新任务,暂无专门针对该任务的对比方法。本文将现有主流免训练拖拽视频方法 DragVideo 和 SG-I2V 适配到 REVEL 任务中进行对比,并构建了包含 204 段不同场景、不同拖拽轨迹的视频基准数据集,从可视化效果、量化指标、运行效率和复杂场景泛化性四个维度进行全面验证。

(1)可视化效果对比

在平移、变形、2D 旋转、3D 旋转等各类拖拽场景中,DragStream 均能实现精准的拖拽效果,完美保留物体的外观和结构,几乎没有视觉失真、伪影和拖拽失败的情况。而对比方法普遍存在拖拽失效、物体结构错乱、画面畸变严重等问题。

4 DragStream 与 DragVideoSG-I2V 的可视化结果对比图。展示不同拖拽操作下,本文方法相比基线方法在拖拽精准度和画面质量上的显著优势

(2)量化指标对比

本文采用 ObjMC(运动保真度)、DAI(拖拽编辑质量)、FVD(视频整体质量)、FID(画面保真度)四大通用指标进行量化评估。结果显示,DragStream 在所有指标上均全面领先对比方法:更低的 ObjMC 和 DAI 得分证明拖拽物体能精准跟随用户指定轨迹,编辑区域与用户目标高度匹配;更低的 FVD 和 FID 得分证明其生成的视频和画面质量远超现有方案。

量化指标对比柱状图。直观呈现本文方法在 ObjMCDAIFVDFID 四大指标上对基线方法的全面领先



4.总结

本文首次定义了流式拖拽导向交互式视频操控(REVEL)这一全新任务,统一了拖拽式视频操控的标准范式,打破了过往视频生成 “生成 不满意 重生成” 的低效循环。

针对 REVEL 任务的核心技术挑战,本文提出的免训练 DragStream 方法,通过自适应分布自校正策略和空频选择性优化机制,从根源上解决了隐分布漂移和上下文干扰两大行业难题,实现了视频生成过程中 “任意时刻、任意内容” 的拖拽式编辑。该方法具备即插即用、适配性强、效率高等优势,大幅降低了技术落地门槛,为消费级交互式视频生成工具的发展奠定了坚实基础。

05

RF-Agent: Automated Reward Function Design via Language Agent Tree Search



作者:

高宁1,章修惠1,蒋星宇1,游牧康1,张默涵1,邓岳1*

单位:

1北京航空航天大学

邮箱:

gaoning_ai@buaa.edu.cn

zhangxiuhui@buaa.edu.cn

jxy33zrhd@buaa.edu.cn

youmukang@gmail.com

zmh666@buaa.edu.cn

ydeng@buaa.edu.cn

论文:

https://arxiv.org/abs/2602.23876

代码链接:

https://github.com/deng-ai-lab/RF-Agent

发表会议:NeurIPS 2025

*通讯作者



1.研究背景

奖励函数设计是强化学习(Reinforcement Learning, RL)中的核心挑战之一,直接影响策略的训练效率与最终性能。在控制任务(如机器人运动控制、灵巧手操作等)中,手工设计密集奖励函数不仅需要大量领域专业知识,且往往难以达到最优效果。近年来,研究者开始利用大语言模型(LLMs)强大的世界知识和代码生成能力来自动设计可解释的密集奖励函数,以替代繁琐的人工工程。然而,现有方法(EurekaRevolve)主要依赖贪心或进化算法来迭代生成和优化奖励函数,存在两方面关键不足:一是历史信息利用不充分,仅保留局部反馈而忽视了从低性能到高性能奖励函数的潜在优化路径;二是搜索策略难以有效平衡探索与利用,导致在复杂控制任务中性能提升有限,如图1所示。

问题定义与研究现状对比



2.方法介绍

针对上述挑战,本文提出RF-Agent框架,将奖励函数设计过程重新建模为序贯决策问题,并引入蒙特卡洛树搜索(Monte Carlo Tree Search, MCTS)来管理整个优化过程(如图2所示)。RF-Agent的核心思想是将大语言模型视为语言智能体,利用其多阶段上下文推理能力,充分挖掘历史反馈信息,从而高效搜索高性能奖励函数。

2 RF-Agent方法框架图

具体而言,RF-Agent采用树结构表示奖励函数的完整优化历史,每个节点对应一个奖励函数及其训练反馈状态。基于经典MCTS框架,RF-Agent的搜索过程包含四个阶段:(1)选择阶段——设计改进的UCT公式,融合环境评估分数和LLM自验证(Self-Verify)分数,有效平衡探索与利用;(2)扩展阶段——定义五种基于LLM的启发式动作类型:变异(Mutation)从局部修改奖励函数结构或参数,交叉(CrossOver)融合精英节点的高性能奖励组件,路径推理(Path Reasoning)沿树路径总结优化经验,差异化思考(Different Thought)从不同路径获取灵感以避免过早收敛;(3)模拟阶段——使用生成的奖励函数训练策略并获取环境反馈;(4)回溯阶段——更新节点价值和访问计数。此外,RF-Agent还提出思维对齐(Thought Alignment)机制,在模拟阶段根据实际可执行的奖励函数代码重新生成设计思路,确保设计意图与代码实现的一致性,有效缓解LLM幻觉问题。



3.实验结果

本文在IsaacGymBi-DexHands两个主流低级控制仿真平台上进行了大规模实验验证,涵盖8种控制智能体和17个多样化任务,包括运动控制任务(如Ant奔跑、Humanoid行走、四旋翼悬停等)和复杂灵巧操作任务(如双手翻杯SwingCup、开门DoorCloseOutward、堆积木BlockStack等)。实验结果表明(如图3、图4所示),RF-Agent在绝大多数任务上显著优于现有LLM-based奖励函数设计方法EurekaRevolve,且在多数任务上超越了人类专家手工设计的奖励函数。此外,RF-Agent生成的奖励函数具有更高的训练效率,能够引导策略更快收敛到更高的成功率。

3 RF-Agent在复杂灵巧操作任务上的效果

4 RF-Agent的奖励函数进化效率更高



4.总结

RF-Agent通过将奖励函数设计建模为语言智能体的序贯决策问题,结合蒙特卡洛树搜索的系统化搜索策略和多种启发式动作设计,有效提升了LLM在复杂低级控制任务中自动设计奖励函数的搜索效率和生成质量,为自动化奖励工程提供了新的研究范式。

编辑人:吴建龙、任文琦

专委会责任副主任:张勇东