在真实世界拍摄视频时,我们常会遇到这样的两难境地:光线不足时,自动曝光系统(Auto-Exposure, AE)会拉长曝光时间,导致画面变亮但也更容易产生严重的“运动模糊”;而在强光下快门速度极快,画面虽清晰但可能噪点较多。这种动态变化的曝光时间(Dynamically Varying Exposure)与物体运动相互耦合,形成了极为复杂的时空退化模式。
然而,现有的视频超分辨率(VSR)和去模糊(Deblurring)方法,大多假设曝光时间是固定且已知的,这在面对“忽明忽暗”、“快慢结合”的真实视频时,往往显得力不从心,容易产生伪影或使得画面抖动。
针对这一痛点,来自韩国科学技术院(KAIST)和中央大学的研究团队提出了FMA-Net++。这是一个全新的视频联合超分辨与去模糊(VSRDB)框架,它并没有把难题“扫进地毯”,而是选择显式地建模(Explicit Modeling)运动与动态曝光的耦合效应。通过设计全新的层级化网络结构和曝光感知模块,FMA-Net++不仅在恢复质量上刷新了SOTA,更实现了5倍以上的推理加速!

(a) 真实世界视频的定性比较。FMA-Net++在处理包含动态曝光变化的挑战性场景时,展现出卓越的清晰度。

论文标题:FMA-Net++: Motion- and Exposure-Aware Real-World Joint Video Super-Resolution and Deblurring
论文作者:Geunhyuk Youk, Jihyong Oh, Munchurl Kim等
作者机构:韩国科学技术院(KAIST);韩国中央大学(Chung-Ang University)
论文地址:https://arxiv.org/abs/2512.04390
项目主页:https://kaist-viclab.github.io/fmanetpp_site/

为了理解FMA-Net++的精妙之处,我们需要先回顾一下视频模糊的物理本质。



FMA-Net++的整体架构示意图。
1. 序列级并行架构:HRBP模块
为了克服传统“滑动窗口”方法视野受限和“循环神经网络”无法并行的缺点,作者设计了双向传播层级精炼 (Hierarchical Refinement with Bidirectional Propagation, HRBP) 模块。

(a) HRBP模块结构;(b) 多头注意力机制。
层级化视野扩充:HRBP不依赖串行处理,而是通过在不同层级间双向传播信息,让时域感受野像金字塔一样层层扩大。
全序列并行:这种设计使得处理长序列视频变得高效且易于并行化,彻底告别了RNN的“排队等待”。

为了在更贴近真实的环境下评估模型,作者构建了两个全新的基准数据集:
REDS-ME (Multi-Exposure):包含5种不同曝光时长的合成视频,用于模拟真实相机的快门变化。
REDS-RE (Random-Exposure):更加硬核,视频中的曝光时长会随时间随机(结构化)变化,模拟自动曝光过程。
性能全面领先
在REDS-ME和REDS-RE基准上,FMA-Net++均取得了SOTA成绩。

REDS4-ME数据集上的定量对比。FMA-Net++在性能(PSNR/SSIM)和时间一致性(tOF)上均拔得头筹。
特别值得一提的是,在最具挑战性的动态曝光数据集REDS-RE上,FMA-Net++的优势进一步扩大(见下表)。这有力证明了ETM模块在应对动态曝光时的鲁棒性。

在REDS-RE和GoPro数据集上的对比。FMA-Net++展现出极强的泛化能力。

定性结果
上图显示了包含严重运动模糊的合成基准(REDS4-ME-5:5和GoPro)的视觉比较,而图1(a)显示了用智能手机拍摄的具有挑战性的真实世界视频的结果。在合成和真实世界的数据上,FMA Net++始终如一地恢复更清晰的细节、更清晰的边缘和更易读的文本,减少伪影,实现最佳的感知质量(NIQE/MUSIQ)。
作者在现实世界的比较中省略了Ev DeblurVSR[18]等多模态方法,因为它们基本上不适用于缺乏所需事件数据的标准RGB视频。 这证明了所提出方法的强大实用性和通用性,尽管仅在合成数据上进行训练,但仅使用传统的RGB输入即可实现这些结果。
效率提升显著
得益于并行的HRBP架构,FMA-Net++在保持最高精度的同时,推理速度也极快。
相比具有相似复杂度的RVRT,FMA-Net++快了5.2倍。
相比前作FMA-Net,在精度大幅提升的同时,推理时间也缩短了数倍(从0.318s降至0.074s)。
真实世界泛化
除了跑分,FMA-Net++在真实手机拍摄的视频上也效果拔群。即使面对训练集中未见过的复杂纹理和连续曝光变化,它依然能恢复出锐利的边缘和清晰的文字。

图示展示了ETM引导的效果。正确的曝光引导(5:5)能预测出准确的发散状模糊核(Rendered),而错误的引导(5:1)则会导致核过于集中。
FMA-Net++的成功告诉我们,在深度学习时代,物理先验依然具有不可替代的价值。通过显式地将“曝光时间”这一物理量引入网络设计,模型仿佛拥有了理解相机成像机制的智慧。
这一工作不仅为视频超分和去模糊任务设立了新的标杆,其“解耦先验学习”和“动态条件调制”的思路,也为处理其他复杂的低层视觉任务(如视频去噪、去雨等)提供了参考。