FMA-Net++重磅发布:解耦“运动”与“曝光”,HRBP模块并行加速,真实世
我爱计算机视觉
2025年12月10日 11:13
收录于文集
共499篇

在真实世界拍摄视频时,我们常会遇到这样的两难境地:光线不足时,自动曝光系统(Auto-Exposure, AE)会拉长曝光时间,导致画面变亮但也更容易产生严重的“运动模糊”;而在强光下快门速度极快,画面虽清晰但可能噪点较多。这种动态变化的曝光时间(Dynamically Varying Exposure)与物体运动相互耦合,形成了极为复杂的时空退化模式。

然而,现有的视频超分辨率(VSR)和去模糊(Deblurring)方法,大多假设曝光时间是固定且已知的,这在面对“忽明忽暗”、“快慢结合”的真实视频时,往往显得力不从心,容易产生伪影或使得画面抖动。

针对这一痛点,来自韩国科学技术院(KAIST)和中央大学的研究团队提出了FMA-Net++。这是一个全新的视频联合超分辨与去模糊(VSRDB)框架,它并没有把难题“扫进地毯”,而是选择显式地建模(Explicit Modeling)运动与动态曝光的耦合效应。通过设计全新的层级化网络结构和曝光感知模块,FMA-Net++不仅在恢复质量上刷新了SOTA,更实现了5倍以上的推理加速!

(a) 真实世界视频的定性比较。FMA-Net++在处理包含动态曝光变化的挑战性场景时,展现出卓越的清晰度。

  • 论文标题:FMA-Net++: Motion- and Exposure-Aware Real-World Joint Video Super-Resolution and Deblurring

  • 论文作者:Geunhyuk Youk, Jihyong Oh, Munchurl Kim等

  • 作者机构:韩国科学技术院(KAIST);韩国中央大学(Chung-Ang University)

  • 论文地址:https://arxiv.org/abs/2512.04390

  • 项目主页:https://kaist-viclab.github.io/fmanetpp_site/

真实世界的“测不准”原理:曝光与运动的纠缠

为了理解FMA-Net++的精妙之处,我们需要先回顾一下视频模糊的物理本质。

FMA-Net++的核心武器库

FMA-Net++的整体架构示意图。

1. 序列级并行架构:HRBP模块

为了克服传统“滑动窗口”方法视野受限和“循环神经网络”无法并行的缺点,作者设计了双向传播层级精炼 (Hierarchical Refinement with Bidirectional Propagation, HRBP) 模块。

(a) HRBP模块结构;(b) 多头注意力机制。

  • 层级化视野扩充:HRBP不依赖串行处理,而是通过在不同层级间双向传播信息,让时域感受野像金字塔一样层层扩大。

  • 全序列并行:这种设计使得处理长序列视频变得高效且易于并行化,彻底告别了RNN的“排队等待”。

实验结果:速度与质量的双重碾压

为了在更贴近真实的环境下评估模型,作者构建了两个全新的基准数据集:

  • REDS-ME (Multi-Exposure):包含5种不同曝光时长的合成视频,用于模拟真实相机的快门变化。

  • REDS-RE (Random-Exposure):更加硬核,视频中的曝光时长会随时间随机(结构化)变化,模拟自动曝光过程。

性能全面领先

在REDS-ME和REDS-RE基准上,FMA-Net++均取得了SOTA成绩。

REDS4-ME数据集上的定量对比。FMA-Net++在性能(PSNR/SSIM)和时间一致性(tOF)上均拔得头筹。

特别值得一提的是,在最具挑战性的动态曝光数据集REDS-RE上,FMA-Net++的优势进一步扩大(见下表)。这有力证明了ETM模块在应对动态曝光时的鲁棒性。

在REDS-RE和GoPro数据集上的对比。FMA-Net++展现出极强的泛化能力。

定性结果

上图显示了包含严重运动模糊的合成基准(REDS4-ME-5:5和GoPro)的视觉比较,而图1(a)显示了用智能手机拍摄的具有挑战性的真实世界视频的结果。在合成和真实世界的数据上,FMA Net++始终如一地恢复更清晰的细节、更清晰的边缘和更易读的文本,减少伪影,实现最佳的感知质量(NIQE/MUSIQ)。

作者在现实世界的比较中省略了Ev DeblurVSR[18]等多模态方法,因为它们基本上不适用于缺乏所需事件数据的标准RGB视频。 这证明了所提出方法的强大实用性和通用性,尽管仅在合成数据上进行训练,但仅使用传统的RGB输入即可实现这些结果。

效率提升显著

得益于并行的HRBP架构,FMA-Net++在保持最高精度的同时,推理速度也极快。

  • 相比具有相似复杂度的RVRT,FMA-Net++快了5.2倍

  • 相比前作FMA-Net,在精度大幅提升的同时,推理时间也缩短了数倍(从0.318s降至0.074s)。

真实世界泛化

除了跑分,FMA-Net++在真实手机拍摄的视频上也效果拔群。即使面对训练集中未见过的复杂纹理和连续曝光变化,它依然能恢复出锐利的边缘和清晰的文字。

图示展示了ETM引导的效果。正确的曝光引导(5:5)能预测出准确的发散状模糊核(Rendered),而错误的引导(5:1)则会导致核过于集中。

写在最后

FMA-Net++的成功告诉我们,在深度学习时代,物理先验依然具有不可替代的价值。通过显式地将“曝光时间”这一物理量引入网络设计,模型仿佛拥有了理解相机成像机制的智慧。

这一工作不仅为视频超分和去模糊任务设立了新的标杆,其“解耦先验学习”和“动态条件调制”的思路,也为处理其他复杂的低层视觉任务(如视频去噪、去雨等)提供了参考。