【论文导读】2026年论文导读第九期
【论文导读】2026年论文导读第九期
2026年5月26日 12:59 河北
论文导读
2026年论文导读第九期(总第一百四十九期)
目 录
|
1 |
ImViD: Immersive Volumetric Videos for Enhanced VR Engagement |
|
2 |
SURGEON: Memory-Adaptive Fully Test-Time Adaptation via Dynamic Activation Sparsity |
|
3 |
Learning 4D Panoptic Scene Graph Generation from Rich 2D Visual Scene |
|
4 |
Augmented Deep Contexts for Spatially Embedded Video Coding |
|
5 |
LLMDet: Learning Strong Open-Vocabulary Object Detectors under the Supervision of Large Language Models |
01
ImViD: Immersive Volumetric Videos for Enhanced VR Engagement
作者:
杨正贤1†,潘实1†,王胜琦1†,王昊翔1,李琳2,李冠君3,温正棋1,林波荣1,陶建华1,于涛1*
单位:
1清华大学
2咪咕北京研究院
3中国科学院自动化研究所
邮箱:
zx-yang23@mails.tsinghua.edu.cn
shengqi-21@mails.tsinghua.edu.cn
ytrock@tsinghua.edu.cn
论文:
https://openaccess.thecvf.com/content/CVPR2025/papers/Yang_ImViD_Immersive_Volumetric_Videos_for_Enhanced_VR_Engagement_CVPR_2025_paper.pdf
代码链接:
https://github.com/Metaverse-AI-Lab-THU/ImViD
拓展工作:
Realizing Immersive Volumetric Video: A Multimodal Framework for 6-DoF VR Engagement(https://arxiv.org/abs/2604.09473)
发表会议:CVPR 2025 Highlight
*通讯作者
共同第一作者
1. 研究背景
沉浸式体积视频被认为是连接真实场景采集与六自由度(6-DoF)VR/AR 交互的重要媒体形态。与传统二维视频、固定机位动态数据或局部主体重建不同,该方向需要同时支持全场景覆盖、大空间自由漫游、视听同步反馈和高质量长时长动态内容。然而,现有公开数据集普遍存在视角覆盖不足、采集空间受限、音频缺失或时长较短等问题,难以支撑面向真实应用的系统研究。针对这一缺口,ImViD 提出了首个面向沉浸式体积视频的数据集与构建方案。
图1 ImViD 数据集覆盖 7 个室内外真实场景,并同时提供同步多视角视频与音频数据
2. 方法介绍
作者从采集端重新设计了沉浸式内容生产流程,构建了由 39 台 GoPro 组成的可移动半球形采集装置,在接近人眼高度的位置同步采集 5K、60FPS 的多视角视频与音频,并结合静态环境采集、动态场景定点采集和移动采集两种策略,实现对前景、背景及交互空间的更完整覆盖。ImViD 共包含 7 个室内外场景、16 段序列,总时长约38分46秒。
图2 可移动多相机采集装置及定点/移动两种动态场景采集策略
在数据采集之外,论文进一步建立了“采集-预处理-动态光场重建-声场建模-VR交互”的管线,并据此验证 STG++ 等方法在复杂真实场景中的表现。围绕 ImViD,作者在后续拓展工作《Realizing Immersive Volumetric Video: A Multimodal Framework for 6-DoF VR Engagement》中,将这一思路全面扩展为一套基于时空高斯表示的动态光场重建框架,融合了光流引导的稀疏初始化、联合相机时间标定以及多项时空监督机制,实现了对剧烈、复杂动态场景的鲁棒且高精度建模。
图3 ImViD 沉浸式体积视频管线:采集、预处理、动态光场重建、声场建模与VR交互
3. 实验结果
论文在 7 个室内外真实场景、16 段序列上系统评测了多种动态新视角合成方法。结果表明,基于 STG 改进的 STG++ 在 Opera、Laboratory 和 Puppy 等代表场景上的 PSNR、SSIM、LPIPS 以及跨相机颜色一致性方面整体优于 4DGS、4DRotor 和原始 STG,表现出更稳定的时序连续性。同时,主观听觉评测显示,61.90% 的参与者认为空间感知效果达到“优秀”,90.46% 的参与者认为整体沉浸感良好,说明该数据集也能支撑面向 VR 的多模态体验验证。
图4 在 Opera、Laboratory 和 Puppy 等代表场景上,STG++ 在重建质量与时序稳定性上优于现有基线方法
4.总结
ImViD 构建了沉浸式体积视频从数据定义、采集搭建到多模态重建框架设计与验证的完整流程,为未来多媒体领域的发展提供了数据和技术支撑。
最新的拓展工作则进一步实现了达国际领先水平的多视角动态光场高保真重建算法,有望推进面向真实世界的更高质量数字内容的生产制作。作者目前已公开论文、项目主页、数据集与预处理代码。
02
SURGEON: Memory-Adaptive Fully Test-Time Adaptation via Dynamic Activation Sparsity
作者:
马可1,2,唐家祺3,郭斌1*,党凡4,刘思聪1,朱追2,方程1,陈颖聪3,於志文1,5,刘云浩2*
单位:
1西北工业大学
2清华大学
3香港科技大学
4北京交通大学
5哈尔滨工程大学
邮箱:
nwpumarco@gmail.com
guob@nwpu.edu.cn
yunhao@tsinghua.edu.cn
论文:
https://arxiv.org/abs/2503.20354
代码链接:
https://github.com/kadmkbl/SURGEON
发表会议:CVPR 2025 Highlight
*通讯作者
1.研究背景
随着AI与物联网技术的加速融合,越来越多的深度模型被部署于移动设备上。然而在真实应用环境中,这些模型常常遭遇如光照变化、天气干扰等数据分布偏移问题,导致推理性能大幅下降。测试时域自适应(Test-time Adaptation,TTA)可在无标签下在线适应模型,但现有方法存在两大问题:一是多数依赖反向传播,内存消耗大,不利于在资源受限设备上落地;二是现有优化策略依赖特定结构(如BN层)或需访问源域训练数据,导致通用性受限。进一步基于实验验证发现,中间激活(Activations)是TTA反向传播的主要内存瓶颈(见图1),且模型各层对适应精度与内存开销的贡献存在差异。
图1 不同模型在反向传播中的内存开销
2.方法介绍
基于上述问题和发现,研究团队提出了一种无需依赖特定结构和源域训练数据的内存高效TTA方法——SURGEON。其核心是动态激活稀疏策略(见图2),按差异性裁剪各层中间激活,在保持适应精度的前提下显著降低内存占用,适用于资源受限的移动设备。
图2 动态激活稀疏对不同层采取不同且变化的裁剪率
而要为不同层合理分配裁剪率,关键是如何评估每层的重要性。SURGEON引入了两个指标:梯度重要性衡量该层对模型预测结果的影响,梯度越大的层对模型调整的贡献越大,适应价值也越高;激活内存重要性衡量该层中间激活占用的内存大小,反映其资源消耗程度。SURGEON将这两个指标结合,转化为每层的动态裁剪率:对梯度大的层倾向分配更小的裁剪率,让它们参与更多参数更新以提升精度;对激活内存占用大的层倾向分配更高的裁剪率,以有效压缩内存开销。
基于上述层裁剪率计算,SURGEON的测试时域自适应过程分为三个阶段:首先,通过前向-反向预评估计算每层的梯度重要性与激活内存重要性,得出当前批次的激活裁剪率;然后,在前向传播中按裁剪率对各层中间激活进行裁剪并缓存;最后,在反向传播中基于裁剪后的激活计算权重梯度,完成参数更新。
3.实验结果
研究团队在图像分类(CIFAR-to-CIFAR-C)与语义分割(Cityscapes-to-ACDC)两大任务上进行了实验评估,涵盖了CNN与Transformer的不同架构。实验结果表明,SURGEON可与可插拔的测试时域自适应策略(如基于置信度的样本选择Certainty-based Sample Selection和一致性正则化Consistency Regularization)兼容,并在精度(Mean)与内存开销(Cache Size)之间实现了最优平衡。此外,SURGEON无需访问源域训练数据,便可在多种架构与任务中展现出优异性能。其用于层级重要性评估的额外计算过程也被验证为计算开销可接受。
表1 在CIFAR-to-CIFAR-C任务上的对比评估(“Original”表示该方法是否依赖源域训练数据)
表2 在Cityscapes-to-ACDC任务上的对比评估
4.总结
本文提出了一种名为SURGEON的方法,旨在解决测试时域自适应过程中的高内存开销问题,同时在不依赖特定网络结构和不修改原始训练流程的前提下,保持可比甚至更优的适应精度。
SURGEON的核心在于提出了一种新颖的动态激活稀疏策略,该策略能够基于数据分布特性,以按层自适应的稀疏比例对中间激活进行裁剪,从而精确调控各层在适应过程中的内存消耗与权重更新。该研究旨在推动深度模型在资源受限设备中的稳健部署,适应不断变化的真实环境。
03
Learning 4D Panoptic Scene Graph Generation from Rich 2D Visual Scene
作者:
吴胜琼1,费豪1*,杨靖康2,李祥泰2,李俊成3,张含望2,蔡达成1
单位:
1新加坡国立大学
2南洋理工大学
3浙江大学
邮箱:
swu@u.nus.edu
haofei37@nus.edu.sg
jingkang001@ntu.edu.sg
xiangtai94@gmail.com
junchengli@zju.edu.cn
hanwangzhang@ntu.edu.sg
dcscts@nus.edu.sg
论文:
https://openaccess.thecvf.com/content/CVPR2025/papers/Wu_Learning_4D_Panoptic_Scene_Graph_Generation_from_Rich_2D_Visual_CVPR_2025_paper.pdf
代码链接:
https://sqwu.top/PSG-4D-LLM/
发表会议:CVPR 2025 (Highlight)
*通讯作者
1.研究背景
场景图(Scene Graph, SG)作为一种强大的结构化场景表示形式,能够以三元组的形式描述图像中物体及其语义关系。近年来,SG生成任务在视觉理解和下游应用中取得了重要进展。从静态图像到视频,再到3D场景,SG的维度不断扩展。然而,真实世界是动态的三维时空环境,现有方法仍难以满足实际需求。
4D全景场景图(4D-PSG)是一种新兴的表示形式,能够同时建模场景的空间维度和时间维度,实现动态高层次的视觉感知。尽管已有研究开辟了4D-PSG方向,但面临三个关键挑战:(1)数据稀缺问题严重,4D-PSG基准数据集规模有限,仅有约1.7%的2D-SG数据量;(2)词汇量受限问题,目前方法仅支持预定义的约50个物体类别和40个关系类别,无法处理开放词汇场景;(3)流水线架构问题,先分割后关系判断的级联方式会引入误差传播。
本文首次提出利用丰富的2D视觉场景标注来增强4D场景学习的方法,通过2D到4D的视觉场景迁移学习框架,有效缓解数据稀缺问题。
图1 (a) 4D场景图示意图,(b)场景图数据集统计比较,(c)2D场景迁移学习的动机示意图
2.方法介绍
(1)4D大型语言模型(4D-LLM):构建了集成3D mask解码器的4D-LLM,实现端到端的4D-PSG生成。利用ImageBind作为4D场景编码器感知RGB-D输入,通过MLP投影层将特征映射到语言空间供LLM(LLaMA2)理解。mask解码器采用SAM2实现物体分割。
图2 4D-LLM 模型框架与 2D→4D 场景迁移机制
(2)链式场景图推理机制:受思维链启发,设计了分阶段的链式推理方法,引导LLM逐步细化物体和关系标签。推理分为四个阶段:①物体描述与分类;②语义关系识别;③精确关系描述;④时序跨度确定。这种方法充分利用LLM的开放词汇泛化能力,有效解决词汇量受限问题。
(3)2D到4D视觉场景迁移学习(D²→⁴-VST):设计了时空维度的跨维度迁移机制,包括三个子过程:①2D到深度迁移(Depth Estimator);②RGB时序迁移(RGB Temporal Estimator);③深度时序迁移(Depth Temporal Estimator)。通过四步训练流程,将丰富的2D场景知识迁移到4D场景,有效补偿数据稀缺问题。
图3 4D- 2D→4D 场景迁移学习机制
3.实验结果
实验在PSG4D-GTA和PSG4D-HOI两个基准数据集上进行,结果表明本文方法在所有指标上均大幅超越基线模型:
(1)端到端生成优势:在PSG4D-GTA上,R@50达到20.24,mR@50达到10.78,相比基线PSG4DFormer分别提升13.07和6.93个百分点。
表1 4D场景图生成测试数据集的定量评测
(2)2D迁移学习有效性:移除2D到4D场景迁移学习后,性能显著下降,验证了该模块的必要性。在PSG4D-HOI上,使用VG数据增强后R@50达到19.68,mR@50达到10.23。
表2 模型设计机制消融实验分析
(3)链式推理效果:消融实验表明链式推理在每个阶段都带来性能提升,尤其在物体分类和关系识别阶段效果显著。
表3 细粒度消融实验分析
(4)开放词汇能力:在seen和unseen类别上均表现出色,unseen物体识别准确率达45.24%,大幅领先基线方法。
表4 模型开放词汇识别分析
4.总结
本文提出了一个创新的4D-PSG生成框架,主要贡献包括:(1)基于4D-LLM的端到端4D-PSG生成模型;(2)链式场景图推理机制,有效解决开放词汇问题;(3)2D到4D视觉场景迁移学习框架,有效缓解数据稀缺;(4)在基准数据集上取得显著性能提升,验证了方法的有效性。
04
Augmented Deep Contexts for Spatially Embedded Video Coding
作者:
卞逸凡1,唐传波1,李礼1,刘东1*
单位:
1中国科学技术大学,脑启发智能感知与认知教育部重点实验室,合肥 230027
邮箱:
togelbian@gmail.com
cbtang@mail.ustc.edu.cn
lil1@ustc.edu.cn
dongeliu@ustc.edu.cn
论文:
https://openaccess.thecvf.com/content/CVPR2025/papers/Bian_Augmented_Deep_Contexts_for_Spatially_Embedded_Video_Coding_CVPR_2025_paper.pdf
代码链接:
https://github.com/EsakaK/SEVC
发表会议:CVPR 2025 (Highlight)
*通讯作者
1.研究背景
神经视频编解码器(NVC)的核心在于利用丰富的参考信息生成准确的特征域预测,从而节省比特率。现有的大多数NVC仅依赖时域参考信息(如前一帧的解码特征)来生成深度上下文和潜在先验。然而,这种“仅时域参考”的机制在处理大运动或新出现物体时面临显著挑战:一方面,运动估计误差导致时域上下文质量下降;另一方面,仅依赖有限的时域参考难以描述新出现的物体。因此,如何引入更丰富的参考信息(尤其是空域参考)来增强上下文和潜在先验的表达能力,成为提升视频压缩性能的关键问题。为此,论文提出SEVC(Spatially Embedded Video Codec),通过嵌入低分辨率视频的空域参考信息,实现大运动与新物体场景下的稳定高效编码。
图1 SEVC与普通时域参考编码流程对比示意图(下图为SEVC编码流程)
2.方法介绍
SEVC的整体思路可以概括为“先压缩低分辨率视频,再将其作为空域参考来辅助全分辨率视频的编码”。具体如图2所示,输入视频首先被下采样四倍,得到一个低分辨率版本。这个低分辨率视频被一个基础的编码器单独压缩,从而产生三种空域参考信息:低分辨率的运动矢量、空间特征以及空间潜在表示。随后,这些空域参考信息与时域参考信息一起,被用于全分辨率帧的编码过程。
图2 SEVC编码框架示意图
为了更充分地利用空域参考,SEVC设计了三个关键组件:
第一,运动与特征协同增强模块(MFCA)。这个模块采用自下而上的多阶段渐进式增强结构,利用时间特征逐步对低分辨率的运动矢量和空间特征进行细化。细化后的运动矢量能够更准确地对齐时间特征,从而生成混合了空间和时间信息的深度上下文。
图3 MFCA增强过程示意图(上)MFCA增强效果可视化(下)
第二,空间引导的潜在先验增强。传统的NVC仅将前一帧的潜在表示作为先验,但往往存在对齐偏差。SEVC换了一种思路:以低分辨率视频的空间潜在表示为查询,通过Transformer中的交叉注意力机制对多个历史时间潜在表示(前三帧)进行对齐和融合,从而生成一个更加准确、信息更丰富的潜在先验以估计更准确的分布参数。
第三,联合时空优化策略。通过端到端的联合训练,让模型学会自适应地分配比特给低分辨率基视频。这种策略使得SEVC能够根据帧的质量需求动态调整空域参考的比特分配,从而进一步提升整体的率失真表现。
3.实验结果
SEVC在多个主流测试集上进行了评估,包括UVG、MCL-JCV、HEVC Class B-E以及USTC-TD。实验数据表明,SEVC在各项指标上均超越了现有的神经视频编码方法。以帧内编码周期为-1,96帧的设置为例,当锚点为VTM-13.2时,SEVC相比此前最优的DCVC-DC方法,BD-Rate平均降低了11.9%(表1,图4)。
表1 基于PSNR的BD-Rate(%)比较。帧内编码周期=-1,帧数=96帧。锚点为VTM-13.2
图4 不同方法之间的率失真曲线比较
更值得关注的是,在表2中那些包含大运动或新出现物体的高难度序列上,SEVC的优势更加明显。例如,在USTC_BicycleDriving序列中,SEVC相比DCVC-DC的码率降幅达到了55.9%;在BasketballDrive序列中,降幅也达到了24.7%。
表2 基于PSNR的BD-Rate(%)比较。帧内编码周期=32,帧数=96帧。锚点为DCVC-HEM
从可视化结果来看(图5),SEVC增强后的运动矢量边缘更加清晰,对运动区域的刻画也更加精细。此外,在新出现的物体(如红色方框内的“雷神之锤”)附近,SEVC能够较好地捕捉其运动信息,而基线模型DCVC-DC则出现了明显的模糊和上下文缺失。
图5 DCVC-DC和SEVC中运动向量和深度上下文的可视化
4.总结
综上所述,SEVC通过引入低分辨率视频作为空域参考,有效缓解了神经视频编码器在大运动和新物体场景下的性能瓶颈。其核心贡献是:利用运动与特征协同增强模块生成混合时空上下文,借助空间引导的潜在先验增强提升先验信息的准确度,以及采用联合时空优化策略实现比特的自适应分配。实验结果表明,SEVC不仅在标准测试集上显著优于现有方法,在复杂场景下也展现出较强的鲁棒性。此外,SEVC还额外输出一个低分辨率比特流,支持快速预览解码,进一步增强了其实用价值。
05
LLMDet: Learning Strong Open-Vocabulary Object Detectors under the Supervision of Large Language Models
作者:
付盛豪1,杨琪泽2,莫琪杰1,严俊楷1,魏溪含2,孟静珂1,谢晓华1*,郑伟诗1*
单位:
1中山大学
2阿里巴巴通义实验室
邮箱:
fushh7@mail2.sysu.edu.cn
xiexiaoh6@mail.sysu.edu.cn
wszheng@ieee.org
论文:
https://openaccess.thecvf.com/content/CVPR2025/html/Fu_LLMDet_Learning_Strong_Open-Vocabulary_Object_Detectors_under_the_Supervision_of_CVPR_2025_paper.html
代码链接:
https://github.com/iSEE-Laboratory/LLMDet
发表会议:CVPR 2025
*通讯作者
1.研究背景
开放词汇目标检测旨在利用文本来检测任意的类别,因此需要细粒度的视觉-文本对齐,从而实现泛化能力。将基础的定位任务与其他语言任务相结合,可以利用语言知识丰富视觉特征,从而扩展视觉概念,实现更好的视觉-语言对齐。以往的研究主要集中在密集标注任务中,其中语言模型生成简短的描述性字幕或类别名称来描述感兴趣的单一区域。然而,这些方法忽视了单个物体的细节、物体间的关系以及前景和背景的更多信息,而这些信息可以通过一个详细的图像级别字幕来呈现。在本研究中,我们展示了区域级开放词汇物体检测器在大语言模型的监督下,也能够从长而详细的图像级字幕中获益。
2.方法介绍
图1 LLMDet多任务学习流程图
我们设计了一种新颖的联合训练框架。该框架利用目标检测模型定位出物体,并且利用大语言模型为每个物体生成区域描述,以及利用大语言模型为全图生成整体描述,这样的多任务学习能够促进视觉-语言对齐。因此该工作引入了两个代理任务:图像级字幕生成和区域级字幕生成。
在图像级字幕生成任务中,语言模型将来自检测器的特征图作为视觉输入,并输出对应的长格式详细字幕。按照训练多模态模型的常见做法,我们将LLM的输入数据组织成对话格式,包括系统消息、用户输入和答案。用户输入包含来自检测器的视觉特征和提示信息(例如:“请详细描述这张图像”),而答案则是图片级别的长字幕。LLM旨在根据用户输入生成答案,并通过标准的语言建模损失来监督。由于输出答案包含多种细节和图像的全面理解,这些视觉线索应当在视觉特征中被建模,以便LLM能够最小化训练损失并正确生成字幕。
然而,由于LLM在图像级字幕生成中处理的是整个特征图,因此很难将图像级字幕中的实体映射回图像中的特定区域。我们进一步引入了区域级字幕生成任务,以弥补这一点,该任务为LLM提供了一个先验条件来将区域与对应的词汇进行映射。在此任务中,我们从检测器中选择正样本物体查询,这些查询与标注中的真实框匹配,并使用LLM为它们生成相应的定位短语。由于单个物体查询中的视觉特征有限,我们在LLM中增加了一些交叉注意力层,用于从检测器的特征图中收集必要的信息。
3.实验结果
表1 在lvis测试基准上的实验结果
在LVIS数据集上,LLMDet在不同骨干网络下,比基线方法MM-GDINO显著提高了AP和APr,尤其是在使用Swin-L骨干网时,尽管训练数据较少,LLMDet仍表现出色,达到了51.1%的AP,证明了其强大的开放词汇能力和优越的性能。
编辑人:吴建龙、任文琦
专委会责任副主任:张勇东





























