【论文导读】2026年论文导读第七期
【论文导读】2026年论文导读第七期
2026年4月21日 15:00 北京
论文导读
2026年论文导读第七期(总第一百四十七期)
目 录
|
1 |
Vector Quantization in the Brain: Grid-like Codes in World Models |
|
2 |
Co-Reinforcement Learning for Unified Multimodal Understanding and Generation |
|
3 |
Advanced Sign Language Video Generation with Compressed and Quantized Multi-Condition Tokenization |
|
4 |
Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence |
|
5 |
Achilles' Heel of Mamba: Essential difficulties of the Mamba architecture demonstrated by synthetic data |
01
Vector Quantization in the Brain: Grid-like Codes in World Models
作者:
彭相源1†,董行思1*†,吴思1*
单位:
1北京大学
邮箱:
1900012762peng@pku.edu.cn
dxs19980605@pku.edu.cn
siwu@pku.edu.cn
论文:
https://github.com/cleaner247/GCQ
发表会议:NeurIPS 2025 Spotlight
*通讯作者
共同第一作者
1. 研究背景
在机器学习领域,矢量量化(VQ)方法通过将高维连续输入压缩为离散的标记化表征,有效构建了结构化的潜在空间。然而,传统的 VQ 方法通常依赖静态码本,在处理复杂的时空序列时存在局限。
与此同时,生物系统在处理来自多种感知和运动模态的高维连续输入时,展现出了一种高效的通用神经模式——网格状编码(Grid-like Codes)。网格细胞最初在内侧内嗅皮层被发现用于空间导航,其特征是具有周期性的bump-like神经活动模式。
受此启发,本文提出了一种全新的类脑矢量量化方法:网格状编码量化(Grid-like Code Quantization, GCQ)。GCQ 利用连续吸引子神经网络(CANN)来生成网格状的活动模式,其中每个稳定的吸引子状态就充当一个码字。
图1 连续吸引子神经网络通过内在动力学形成吸引子状态,并在动作驱动下移动,从而自然演化出网格状特征
2. 方法介绍
与使用静态码本的传统 VQ 方法不同,GCQ 引入了“动作条件码本(action-conditioned codebook)”。这使得模型不再仅仅量化孤立的观测结果,而是直接对“观测-动作”序列进行时空联合压缩 。GCQ 的整体架构遵循编码器-量化器-解码器设计,模型接收观测-动作序列后,利用动作序列构建动作条件码本。观测序列被编码器转化为潜在序列后,通过与动作条件码本进行序列模板匹配(template matching)完成量化,最后由解码器重建预测的观测序列。通过构建这样一个由动作驱动斑块移动的结构化潜在空间,GCQ 实际上建立了一张“认知地图” 。在真实环境中的动作可以直接映射为认知地图上的位置变化,反之亦然 。
图2 GCQ整体架构
由于建立了稳定的认知地图,GCQ 可以在给定初始序列后,直接在潜在空间中执行动作以预测未来的观测结果。同时规划过程被极大地简化,通过迭代生成动作、与环境交互并观察,不断缩小认知地图上当前状态与目标状态之间的距离,直到输出无操作动作抵达目标。
3. 实验结果
作为一种统一的时空压缩世界模型,GCQ 在多个数据集(包括 2DMaze、Google Street View和3DShapes)上进行了广泛的评估,并与传统的两阶段世界模型(如 VQ+UNet 和 VQ+Transformer)进行了对比。
随着模型参数量的增加,GCQ 在重建和预测任务上展现出良好的可扩展性,且预测质量显著优于 VQ+UNet。在长程预测中,传统 VQ 方法的性能会随着预测步数的增加而迅速下降,导致生成的图像变得模糊;而 GCQ 凭借稳定的潜在结构,能够维持高质量、清晰的预测画面。GCQ 的预测性能对其初始化的序列长度不敏感,展现出极强的鲁棒性。
图3 对比数据及生成效果展示
在目标规划实验中GCQ 能够精确计算出从起始点到目标终点的最佳行动轨迹。同时GCQ可以天然作为一个inverse model,给定一系列观测画面,GCQ 能够将其映射到认知地图上,并推断出相邻观测之间所采取的动作序列。
4.总结
GCQ 提出了一种受大脑启发的全新框架,将观测-动作序列压缩为离散且结构化的表征。该模型利用连续吸引子动力学生成网格状码字,并以动作条件的方式选择它们,从而同时捕获空间和时间依赖性。这种时空量化过程产生了结构化的潜在表征,可以作为智能体的“认知地图”,从而高效地支持长程预测、目标导向规划和逆向建模等复杂任务。
GCQ 还为神经科学提供了全新的理论视角:网格细胞的形成可能并非单纯通过网络优化得来,而是大脑利用了一组由CANN预设的活动模式作为“生物密码本”。通过后天的学习,大脑将外部的感官输入映射到这些内部预设的结构上。这一观点为理解大脑如何同时实现信息的压缩与语义组织提供了重要启示。
02
Co-Reinforcement Learning for Unified Multimodal Understanding and Generation
作者:
蒋静静1,2,司翀杰1,罗骏2,张含望2,马超1*
单位:
1上海交通大学
2南洋理工大学
邮箱:
jingjingjiang2017@gmail.com
chongjiesi@sjtu.edu.cn
junluo@ntu.edu.sg
hanwangzhang@ntu.edu.sg
chaoma@sjtu.edu.cn
论文:
https://arxiv.org/abs/2505.17534
代码链接:
https://github.com/mm-vl/ULM-R1
发表会议:NeurIPS 2025 Spotlight
*通讯作者
1.研究背景
DeepSeek-R1系列工作的成功表明,基于可验证奖励的强化学习(RLVR)是一种高效且稳定的大模型后训练方法。这种新范式使模型能够在不依赖大规模、高质量监督数据的情况下,快速习得高级能力并适配到特定场景。鉴于此特性,本文探索如何有效地将RLVR拓展到统一多模态大模型,以高效且同步地提升其视觉生成和多模态理解能力。然而,通过一系列关于RLVR学习策略的预实验却发现:对统一多模态大模型单一任务执行RLVR,可能会出现能力此消彼长的现象(如,生成能力提升而理解能力下降);而对模型理解和生成能力同时优化,则能有效缓解这种现象,说明跨任务奖励信号存在协同进化效应。据此,本文提出了一种协同强化学习框架(Co-Reinforcement Learning, CoRL),遵循“先奠基后专攻”的核心思路,通过两阶段的强化学习高效地提升模型的基础生成和理解能力,以及快速向特定场景的泛化能力。
2.方法介绍
如图1所示,CoRL由Unified RL和Refined RL两阶段强化学习构成。
Unified RL:第一阶段的强化学习致力于利用跨任务奖励信号之间的协同效应,实现模型不同能力之间的相互促进与协同提升。该阶段采用特定格式的训练数据(由真实图像、文本提示与QA对组成的三元组),基于多任务组合奖励函数,通过GRPO算法同步优化策略模型的理解与生成能力。组合奖励函数中,用于优化视觉生成任务的包括双边循环一致性奖励和图文匹配奖励:前者分别以LPIPS度量生成图像与真实图像之间的视觉一致性、以SPICE度量给定文本提示与生成图像caption之间的语义一致性,从视觉与语义两个维度对生成质量进行全面评估;后者则利用策略模型自身的内部表征,在token级别度量跨模态对齐程度。此外,组合奖励函数还引入准确性奖励与格式奖励,以优化策略模型的多模态理解能力。
Refined RL:第二阶段的强化学习采用面向目标场景或特定任务定制的训练数据与奖励函数,通过定向强化学习进一步提升策略模型在特定任务上的表现,且该阶段可灵活扩展至多种下游任务场景。例如,为提升策略模型在开放式推理任务中的表现,本文引入开放式CoT格式的训练数据,利用特定任务奖励(开放式QA的准确率奖励和格式奖励),通过GRPO算法对策略模型的深度推理能力进行专项优化。
图1 CoRL训练框图
3.实验结果
本文采用Janus-Pro-1B作为基线策略模型,经CoRL训练后所得的最终模型记为ULM-R1。随后,在多个视觉生成与多模态理解数据集上对ULM-R1进行定量与定性评测,以验证其有效性。
具体而言,表1和表2分别展示了ULM-R1在3个视觉生成数据集和9个多模态理解数据集上与已有统一多模态大模型的性能对比。表1的结果表明,ULM-R1较基线策略模型取得了显著的性能提升,验证了CoRL的有效性;与同等参数规模的模型相比,ULM-R1亦展现出明显的综合性能优势。表2的结果表明,ULM-R1在多模态理解任务上较其他统一多模态大模型具有明显优势。
此外,图2通过定性示例对比了基线策略模型与ULM-R1在视觉生成及多模态理解任务上的表现。在视觉生成方面,ULM-R1在多样化文本提示下生成的图像在图文对齐上表现更优,尤其在物体计数的准确性以及空间布局与元素组合关系的语义一致性上均得到显著改进。在多模态理解方面,ULM-R1展现出显著增强的理解能力,尤其在数学推理任务上的提升尤为突出。
表1 视觉生成数据上的定量评测
表2 多模态理解数据上的定量评测
图2 基线策略模型与ULM-R1在视觉生成及多模态理解任务上的定性结果对比
4.总结
本文研究如何有效利用RLVR提升统一多模态大模型的生成与理解能力。通过对强化学习策略的系统探索,我们发现模型不同能力之间存在协同效应,并基于此提出了协同强化学习框架CoRL。从更深层次来看,协同优化本质上赋予了模型一种重要的能力,类似于认知科学中的"元认知":相较于盲目追求单一、静态的监督信号,协同优化赋予模型根据上下文动态调配与平衡内部能力的机制,从而实现对静态模式匹配的超越。
03
Advanced Sign Language Video Generation with Compressed and Quantized Multi-Condition Tokenization
作者:
王聪1†,邓泽轩1†,蒋智威1*,殷亚凤1*,沈飞2,程紫峰1,葛士平1,甘世维1,顾庆1
单位:
1南京大学
2新加坡国立大学
邮箱:
cw@smail.nju.edu.cn
dengzx@smail.nju.edu.cn
jzw @nju.edu.cn
yafeng@nju.edu.cn
shenfei29@nus.edu.sg
chengzf@smail.nju.edu.cn
shipingge@smail.nju.edu.cn
sw@smail.nju.edu.cn
guq@nju.edu.cn
论文:
https://arxiv.org/abs/2506.15980
代码链接:
https://github.com/umnooob/signvip
发表会议:NeurIPS 2025 (Spotlight)
*通讯作者
共同第一作者
1.研究背景
手语视频生成(Sign Language Video Generation, SLVG)旨在根据口语文本直接生成与目标说话人身份一致的手语视频,在无障碍信息传播、教育辅助工具以及数字人交互等场景中具有重要应用价值。现有研究大多采用“口语文本-骨架条件-手语视频”的两阶段框架,将骨架序列作为连接翻译模型与视频生成模型的中间媒介。然而,骨架信息只能提供较为粗粒度的动作约束,难以充分刻画手部细节、面部表情以及上身姿态等关键信息。因此,生成的手语视频在动作自然度、画面表现力以及语义一致性等方面仍存在明显不足。
2.方法介绍
图1 SignViP方法框架图
为解决上述问题,本文提出SignViP。其核心思路是引入多个细粒度条件作为翻译模型与生成模型之间的中间媒介,从而提升手语视频生成质量。不同于直接预测高维且容易出错的多种细粒度条件,SignViP首先将细粒度人体姿态与3D手部信息编码为连续表示,再通过有限标量量化(Finite Scalar Quantization,FSQ)将其压缩为离散词元,构建一个紧凑的多条件词元空间。在此基础上,整个框架由三个关键模块组成:(1)手语视频扩散模型联合多条件编码器学习与视频动态相关的连续嵌入表示;(2)FSQ 自编码器对连续嵌入进行压缩与量化,并支持可逆重建;(3)多条件词元翻译器负责将口语文本翻译为对应的离散多条件词元。
3.实验结果
实验在RWTH-2014T与How2Sign两个公开手语数据集上进行。本文从手语语义保真度和视频质量两个层面进行评估。从结果表明,SignViP在视频回译准确性、姿态回译准确性、FID、CLIP-FID、FVD、ID相似度等多项指标上均达到现有最优水平。
表1 视频回译准确性对比
表2 姿态回译准确性对比
表3 视频生成质量对比
4.总结
本文提出了一种新颖的手语视频生成方法 SignViP。该方法通过引入多种细粒度条件,并采用离散词元量化与压缩的建模范式,以提升生成视频的保真度与表现力。整体框架由三个关键模块组成:(1)手语视频扩散模型,用于学习能够表征细粒度动作与外观细节的连续嵌入表示;(2)FSQ 自编码器,用于对连续嵌入进行压缩与量化,将其转化为紧凑的离散词元表示;(3)多条件词元翻译器,用于将口语文本翻译为对应的离散多条件控制词元。实验结果表明,SignViP 在视频生成质量、时序连贯性以及语义保真度等方面均取得了最先进的性能。
04
Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence
作者:
吴殿坤1†,刘芳甫1†,洪亦歆1,段岳圻1*
单位:
1清华大学
邮箱:
wdk21@mails.tsinghua.edu.cn
liuff23@mails.tsinghua.edu.cn
CindyHung101@gmail.com
duanyueqi@tsinghua.edu.cn
论文:
https://arxiv.org/abs/2505.23747
代码链接:
https://github.com/THU-SI/Spatial-MLLM
发表会议:NeurIPS 2025
*通讯作者
†共同第一作者
1.研究背景
近年来,多模态大语言模型(MLLM)在图像理解、视频问答与跨模态生成等任务上取得了显著进展,但其“空间智能”能力仍然相对薄弱。现有方法若想提升模型对三维空间关系的理解,通常依赖点云、深度图、相机参数等额外的 3D 或 2.5D 信息,这在真实场景中往往难以获得。相比之下,仅基于普通图像或单目视频进行空间理解与推理,更符合现实应用需求,但也更具挑战性。
这一问题的核心在于:视频中的单帧通常只提供局部观察,模型需要从不完整的 2D 线索中恢复场景布局、理解物体间的相对位置,并进一步完成路径规划、方位判断、距离估计等复杂推理。然而,现有视频 MLLM 的视觉编码器大多沿用 CLIP 风格的图文预训练范式,更擅长抽取语义信息,而对三维结构和几何关系的建模不足。因此,如何在不引入额外 3D 输入的前提下,显著提升 MLLM 的视觉空间理解与推理能力,是一个值得关注的重要问题。
2.方法介绍
针对上述问题,本文提出了 Spatial-MLLM,一个面向视觉空间智能增强的多模态大模型框架。该方法的关键思想是:在传统视频 MLLM 的语义表征之外,引入来自视觉几何基础模型的结构先验,使模型能够同时具备“看懂内容”和“理解空间”的能力。为此,作者设计了一个双编码器架构:其中,2D 编码器负责提取场景的语义特征,空间编码器则利用视觉几何模型的特征骨干提取隐式三维结构信息,随后通过连接模块将两类信息融合为统一的视觉 token,并输入大语言模型进行推理与回答。
图1 Spatial-MLLM总体架构示意
除模型结构外,本文还提出了一种空间感知的帧采样策略。在实际推理时,受显存和输入长度限制,模型往往无法处理视频中的全部帧。与均匀采样不同,Spatial-MLLM 会优先选择那些对空间覆盖更充分、几何信息更丰富的关键帧,从而在有限输入预算下尽可能保留场景结构。训练方面,作者构建了面向视觉空间理解与推理的数据集,并采用监督微调、冷启动推理格式对齐以及基于 GRPO 的强化学习训练流程,进一步提升模型长链条空间推理能力。
图2 空间感知的帧采样策略可视化
3.实验结果
论文在 VSI-Bench、ScanQA 和 SQA3D 等多个代表性基准上对方法进行了系统评测。实验结果表明,Spatial-MLLM 在视觉空间理解与推理任务上取得了当前最优表现。尤其是在 VSI-Bench 上,该方法显著优于 GPT-4o、Gemini-1.5 Pro 以及多种开源视频大模型。值得注意的是,Spatial-MLLM 仅使用较少的视频输入帧,就实现了比部分更大规模模型更好的表现,说明其在空间信息建模与利用方面更加高效。
在 ScanQA 和 SQA3D 两个经典 3D 问答基准上,Spatial-MLLM 也显著超过了所有仅以视频为输入的对比方法,并优于多种任务专用模型。虽然个别依赖点云或深度图的模型在部分指标上仍具优势,但 Spatial-MLLM 在不使用任何额外 3D/2.5D 输入的条件下,已经展现出极强的竞争力。消融实验进一步验证了双编码器设计、空间感知帧采样策略以及强化学习训练流程的有效性,表明本文方法的性能提升并非来自单一模块,而是源于结构设计、数据构建与训练策略的协同作用。
4.总结
总体来看,Spatial-MLLM 为“仅基于 2D 视觉输入实现空间智能增强”提供了一条具有代表性的技术路线。该工作证明,即使不依赖点云、深度图等额外三维信息,多模态大语言模型仍然可以通过引入几何先验、优化关键帧选择和强化长链推理训练,获得显著更强的空间理解与推理能力。本文对视觉空间智能、多模态推理以及具身智能等方向都具有较强的启发意义,也为未来构建更通用、更高效的空间感知大模型提供了新的思路。
05
Achilles' Heel of Mamba: Essential difficulties of the Mamba architecture demonstrated by synthetic data
作者:
陈天一1†,林鹏潇1†,王志伟1,许志钦1*
单位:
1上海交通大学
邮箱:
xuzhiqin@sjtu.edu.cn
论文:
https://neurips.cc/virtual/2025/loc/san-diego/poster/119917
发表会议:NeurIPS 2025
*通讯作者
共同第一作者
1.研究背景
状态空间模型(SSM)已成为注意力机制的极具潜力的替代方案,其中 Mamba 架构在处理长序列时展现出优异性能,且具备线性复杂度。然而,Mamba 与 Transformer 架构的核心差异仍未被完全阐释。
为更深入理解大规模模型的行为规律、指导有价值的架构改进,探究二者差异的内在成因至关重要。鉴于自然语言任务固有的复杂性,本研究采用简单却精心构造的合成数据展开研究。
实验发现,Mamba 的非线性卷积会引入非对称偏置,显著降低其对对称关系的识别能力。通过复合函数任务与逆序序列匹配任务,我们论证了Mamba 对非对称的偏好,即在复合任务中偏好对称解,且难以完成逆序序列匹配任务。
我们通过实验发现Mamba的非对称偏好并非源自SSM模块本身,而是源于其前置的非线性卷积 —— 该卷积会非对称地融合信息。这些结论为理解 Mamba 的特点提供了全新视角,并为未来序列模型的架构改进提供了启发。
2.方法介绍
本文的复合任务,如图1,有两种可能的解,一种是利用对称关系得到的对称解,另一种则是利用单任务直接复合而成的复合解,也称为非对称解。我们首先对比了Mamba和Transformer在复合任务上的偏好,如图2,发现Mamba几乎学不到对称解,只能学到非对称解。而Transformer则可以利用初始化大小控制学习对称解或是非对称解。
我们对Mamba进行了深入的实验发现,相较于Transformer只能利用注意力机制获取信息,Mamba则还可以利用非线性卷积获取信息。如图3,我们通过信息流剪枝与隐藏状态替换实验,验证了Mamba在复合任务下完全依赖非线性卷积获取信息而非SSM。进一步,我们展示了非线性卷积自身的非对称性,并通过全对称任务,消除非线性卷积的非对称性等实验,验证了Mamba难以处理对称任务,且其非对称偏好源于非线性卷积的非对称性。额外的,我们测试了加入与Mamba同样的非线性卷积的Transformer模型在复合任务上的表现,发现此时Transformer也只学习非对称解而完全不学习对称解,这进一步验证了非线性卷积引入了极强的非对称性。
针对Mamba自身的非对称偏好,我们设计了逆序序列匹配任务,如图4,该任务需要模型找到“1234”的逆序“4321”。由于非线性卷积将序列的信息进行非对称融合,使得Mamba难以完成该任务,而Transformer则能轻松完成。我们提出利用简单的残差连接绕过非线性卷积,配合位置编码使得Mamba能够绕开其原先不可避免的非对称性,使得其在逆序序列任务上表现大幅提升。
另外,我们也对逆序序列任务进行了自然语言的改造,使其成为一个适用于大语言模型的任务,并实际在大语言模型上进行了测试,测试结果与我们在小模型的结论相一致。
编辑人:吴建龙、任文琦
专委会责任副主任:张勇东























