☰
时域网络1-通过时域网络解决去噪问Temporal As a Plugin: Unsupervised Video Denoising with Pre-Trained Image Denoisers
2026/9/29 2:57:20 网站建设 项目流程

原文链接: Temporal As a Plugin: Unsupervised Video Denoising with Pre-Trained Image Denoisers

github地址: https://github.com/zfu006/TAP

TAP这个模块其实不仅仅可以用于去噪任务,任何多层像素级的任务其实都可以用:去噪、分割、增强等等,在我们实际工程应用中加入对齐模块后的网络无论是小目标还是细节都有增强的效果,这种结构比较适合高频振幅低的平台。

本文提出了一种新颖的无监督视频去噪框架,名为“Temporal As a Plugin”(TAP,即“时间即插件”),它将可调的时间模块集成到预训练的图像去噪器中。此外,引入了一种渐进式微调策略,利用生成的伪干净视频帧对每个时间模块进行优化,逐步提升网络去噪性能。与其他无监督视频去噪方法相比,我们的框架在 sRGB 和 raw 视频去噪数据集上均表现出更优越的性能。


1 引言

本文中,提出利用预训练的图像去噪器作为无监督视频去噪的初始空间先验。与依赖配对视频的有监督视频去噪器不同[11,38,47,59],图像去噪器可以使用大量的图像对进行充分训练,因为在现实场景中,获取静态图像对更为可行[1,7,34,36,48,51,57]。

为了补充预训练的空间去噪先验,我们提出了一种新颖的无监督视频去噪框架,名为“Temporal As a Plugin”(TAP)。具体而言,我们将可训练的时间模块插入到基于编码器-解码器的图像去噪器的跳跃连接中。每个时间模块使网络能够在已学习的空间信息基础上融入时间信息。受[45,53]启发,时间模块的排列遵循金字塔结构,使我们能够利用预训练网络的多尺度架构进行高效的特征对齐。基于构建的视频去噪器,我们提出了一种无监督微调策略,该策略仅使用含噪视频,从网络底层(深层)到顶层(浅层)逐步训练时间模块。该过程首先构建伪含噪-干净视频对,包括使用预训练图像去噪器对含噪帧进行初始去噪,然后基于已知的噪声模型模拟噪声。接着,我们通过生成的伪配对数据微调时间模块,同时保持空间层冻结,从学习底层深层特征的时间对齐开始,到优化顶层的细节结构。这种渐进策略有效防止了网络过拟合到初始伪标签中的伪影和过度平滑。我们在sRGB和raw视频基准上验证了方法的有效性。大量结果表明,与其他无监督方法相比,我们提出的框架实现了最先进的视频去噪性能。

总之,主要贡献如下:

  • 提出了TAP,一种无监督视频去噪框架,它利用预训练的图像去噪器进行视频去噪,而无需使用配对视频进行监督。
  • 引入了一种无监督微调策略,利用时间信息来补充网络的空间先验,逐步提升其去噪性能。
  • 方法在raw和sRGB视频去噪基准上均超越了当前无监督去噪器,证明了其卓越的有效性。

2 相关工作

2.1 深度图像去噪​

近年来,人们提出了众多图像去噪器,以有效地从含噪观测中重建干净图像[5,8,9,23,26,46,54,56]。DnCNN[56]是一种广泛使用的去噪器,它采用堆叠的卷积、批量归一化[33]和修正线性单元[14](ReLU)的普通块,以及全局残差连接[13]来实现高效去噪。结合了注意力机制与动态核的基于编码器-解码器的架构也被提出,以利用图像中的局部和非局部信息[5,9,26]。同时,一些网络采用了基于Transformer的架构[23,44,46,54],不仅在图像去噪上,而且在通用图像恢复任务中也取得了优异性能。此外,像NAFNet[8]这样的工作则致力于寻找简单而有效的图像恢复基本模块。

2.2 深度视频去噪​

有监督视频去噪。​ 与仅需要利用空间信息的图像去噪不同,视频去噪还受益于有效的时间对齐。一些有监督视频去噪器被设计用于从多帧中有效学习时间信息[3,4,12,21,22,24,30,32,42,43,45,52,53]。FastDVDNet[42]通过直接将连续的序列图像作为输入来学习时间信息。EDVR[45]和RViDeNet[53]通过金字塔对齐模块在特征级别实现时间对齐,该模块采用可变形卷积分层地将相邻特征与参考特征对齐。除了可变形卷积,其他方法如光流[3,4,21]、核预测网络[32]和时空偏移[20]也被用于实现时间对齐。

无监督视频去噪。​ 有监督视频去噪器的性能受限于含噪-干净视频对的稀缺性。为了绕过对大量配对视频的需求,一些研究引入了无监督视频去噪方法,仅使用含噪视频进行训练。其中,UDVD[38]提出了一种利用盲点网络[16,17]的无监督视频去噪器。RDRF[47]通过结合更密集的感受野设计和循环去噪策略改进了UDVD的架构。同时,MF2F[11]提出了一种基于Noise2Noise[19]的无监督训练方法,通过构建含噪对进行无监督去噪。VER2R[59]改进了Recorrupted-to-Recorrupted方案[35]用于无监督视频训练。Restored-from-Restore[18](RFR)没有专门在含噪视频上训练无监督视频去噪器,而是提出使用生成的伪干净视频将预训练的视频去噪器微调到目标视频。然而,由于缺少用于预训练的配对视频,对预训练视频去噪器的要求阻碍了其实用性。


3 方法论

在本节中,我们描述了提出的无监督视频去噪框架TAP。我们首先介绍从预训练图像去噪器提升而来的视频去噪器架构(第3.1节),然后介绍用于利用含噪帧间时间信息的无监督渐进微调策略(第3.2节)。

3.1 提升图像去噪器用于视频去噪​

将预训练的图像去噪器扩展为视频去噪器的挑战在于,在保留预训练图像去噪器已学习的空间信息的同时,使其能够利用多个含噪帧之间的时间信息。本文中,我们选择广泛使用的基于编码器-解码器的图像去噪器[9,23,46,54]作为基线。然后我们提出将时间模块集成到图像去噪器的编码器和解码器之间的每个跳跃连接中,强制网络在不同特征级别有效学习时间对齐。视频去噪器的整体架构和时间模块的细节将在以下小节中介绍。

整体流程。​ 图2展示了我们提出的视频去噪器的架构,它是从一个4级编码器-解码器图像去噪器扩展而来的。图像去噪器中编码器-解码器的每一级都包含几个残差块[13],用于提取每帧含噪帧的空间信息。

为了利用含噪帧间的时间信息,在时间模块[45,53]被集成在编码器每一级之间的跳跃连接处。除底层(第4级)外,从每帧含噪帧提取的特征经过编码器的残差块。在第4级,只有中心帧的特征被送入残差块。各级跳跃连接处的时间模块学习将相邻帧的深层的特征与中心帧的特征对齐。对齐后,特征被融合,并添加到由解码器恢复的同一级中心帧的重建特征上。所以除去下图黄色的时域模块"temporal module",其实就是个经典的nafnet网络,如果用到其他图像任务上,可以是其他的骨干网络。

时间模块。​ 我们分别在从级别1到级别3的跳跃连接中插入了三个时间模块。在每个级别,时间模块以深层特征作为输入,即每帧的深层特征的拼接,并输出融合特征。这里m表示含噪帧的时间索引,从-T//2到T//2。H W C是第l级的的高度、宽度和通道数。更具体地说,每个时间模块首先通过应用可变形卷积(DCN)[10]将相邻帧的深层特征与中心帧的深层特征对齐。给定第l级相邻帧和中心帧的深层特征,时间模块采用几个卷积层来学习偏移量:

其中是为深层特征学习到的偏移量,C是多个 3X3卷积层的堆叠,Concat 示沿通道维度的拼接操作。之后,通过 3x3 卷积将学习到的偏移量与从较低级别的时间模块传递来的偏移量进行细化:

这里我们将表示为细化后的偏移量,表示从级别l经 2倍双线性上采样得到的传递偏移量。然后我们应用DCN对齐相邻特征,并使用从较低级别传递来的特征对其进行细化。利用一个额外的卷积来融合这些对齐后的特征:

其中表示从级别 (l+1)传递来的对齐特征,表示融合后的特征,D表示DCN。注意,底层(级别3)的时间模块在对齐时不需要传递的偏移量和特征。至此,时间模块的输出推导如下:

其中 B是可调参数,与时间模块联合训练。我们将B初始化为0,表示网络在开始时忽略时间信息。因此,视频去噪器退化为预训练的图像去噪器。这种设计最大限度地利用了原始图像去噪器中已学习的空间信息,同时使网络能够学习时间信息。

3.2 无监督渐进微调​

给定一个在大量含噪-干净图像对上训练的图像去噪器,人们可以直接以逐帧方式将其应用于对含噪视频去噪[49,56]。这种方法在很大程度上忽略了视频数据的帧间时间相关性,导致结果不理想[49]。为了补充空间先验,利用含噪视频数据中的时间信息对于实现高效的视频去噪至关重要[41,49]。为此,我们进一步提出了一种无监督微调策略,以仅在收集的含噪视频上逐步训练插入的时间模块。

所提出的策略包括三个步骤,从级别3到级别1逐步微调模块。令 R0和 R1 分别表示图像去噪器和视频去噪器。表示预训练图像去噪器的参数,表示从编码器-解码器阶段的级别3到级别1的三个未训练时间模块的参数。例如,W1 对应于级别3的时间模块参数。对于每个插入的时间模块,我们构建含噪和伪干净视频对来微调可训练模块参数。微调策略的说明如图3所示。具体来说,给定一个含噪视频数据集 Y,预训练的图像去噪器首先逐帧处理含噪视频:

其中表示含噪帧Yt对应的去噪结果。然后我们构建伪含噪-干净视频对,其中是去噪后的视频,是通过向去噪视频添加来已知噪声模型的噪声而重新含噪的视频。我们在伪含噪-干净视频对上微调级别3的时间模块:


4 实验

4.1 实验设置​

数据集。​ 我们在两个去噪任务上验证了所提方法的有效性:合成高斯视频去噪和真实raw视频去噪。我们使用DAVIS[37]和Set8[42]进行合成高斯视频去噪,使用CRVD[53]进行真实raw视频去噪。DAVIS包含90个视频用于训练和验证,30个视频用于测试;Set8包含来自Derf测试媒体集的4个视频和用GoPro拍摄的4个视频,仅用于评估。CRVD提供室内和室外raw视频。室内集包括11个场景的配对含噪-干净视频(6个场景用于训练,5个场景用于测试),每个场景包含7个视频帧。室外集仅包含在复杂场景和真实运动下捕获的含噪视频,主要用于视觉比较。

实现细节。​ 我们分别针对合成高斯图像去噪数据集和真实raw图像去噪数据集训练图像去噪器。对于所有实验,我们使用基于编码器-解码器的模型,即NAFNet[8],作为基线图像去噪器。遵循之前的工作[54,55],我们使用BSD500[31]、DIV2K[2]、Flickr2K[25]和WED[28]的组合来训练高斯图像去噪器。含噪图像是通过向干净图像添加 $\sigma\in[10,55]$ 的加性白高斯噪声(AWGN)来合成的。为了训练raw图像去噪器,我们从SID[7]、SIDD[1]和CRVD训练集中选择干净图像。使用CRVD中提供的相机噪声模型参数,在这些干净图像上合成泊松-高斯噪声。注意,CRVD是一个视频数据集,我们将视频拆分为单独的图像进行训练。为了确保实验的公平性,CRVD训练集不用于微调插入的时间模块。对于我们的视频去噪器,输入时间帧数T对于高斯去噪设置为5,对于真实raw视频去噪设置为3。训练序列的块大小随机裁剪为 $160\times 160$,批大小为4。训练期间,raw视频被打包成RGBG序列。我们使用Adam优化器[15]和L1损失对网络进行微调。在每个微调步骤中,网络训练200K次迭代,学习率初始设置为1e-3,并通过余弦退火[27]逐渐降低到1e-5。该方法使用PyTorch实现,并在一块NVIDIA RTX A5000上运行。更详细的架构可在补充材料中找到。

4.2 与最先进方法的比较​

我们将提出的TAP与最先进的无监督视频去噪方法进行比较,即MF2F[11]、RFR[18]、UDVD[38]、RDRF[47]和ER2R[59]。无监督方法不依赖真实标签,可以直接在测试集上训练和评估,或者在训练集上训练后在测试集上评估。对于合成高斯去噪,MF2F、RFR和ER2R直接在Set8和DAVIS测试集上训练和评估,而UDVD和RDRF使用DAVIS训练集训练并在测试集上评估。为了区分这两种设置,我们将直接在测试集上训练的方法标记为‘T’,例如ER2R-T。我们为这两种设置分别训练了TAP和TAP-T。对于真实raw视频去噪,由于CRVD规模有限,所有无监督方法都在CRVD室内测试集和CRVD室外测试集上训练。竞争方法的实验结果要么直接引用自原论文,要么通过运行官方代码复现。如果代码不可用,我们省略了相应的结果。为了全面比较,还包括了传统和有监督的视频去噪方法,如VBM4D[29]、FastDVDNet[42]、PaCNet[43]、RViDeNet[53]和FloRNN[21]。此外,我们还报告了预训练图像去噪器在视频去噪上的性能,即NAFNet[8]。

合成高斯视频去噪实验。​ 表1展示了在DAVIS和Set8数据集上的定量视频去噪结果。显然,我们的方法大幅优于其他无监督方法。值得注意的是,与RDRF相比,TAP-T在Set8数据集上将PSNR从32.92 dB提高到33.95 dB,并且在PSNR上也优于有监督方法FloRNN[21]。这一改进部分归因于Set8数据集中相对平滑的运动,这有助于网络通过直接在测试集上微调来有效学习时间信息。同时,TAP在无监督去噪器中PSNR排名第二。与我们的预训练图像去噪器相比,TAP-T在DAVIS和Set8数据集上分别获得了1.24 dB和1.52 dB的提升,表明我们的网络有效地从含噪帧中学习了时间信息。TAP和TAP-T的结果都证明了我们提出的框架的有效性。图4展示了在DAVIS和Set8数据集上的视频去噪示例。无监督方法UDVD和RFR无法恢复精细细节,导致可见伪影。相比之下,我们的方法TAP和TAP-T有效地恢复了细节(在去噪图像中线条和纹理的清晰度上很明显),并取得了与有监督方法FloRNN相当的结果。更多视觉示例在补充材料中提供。

真实raw视频去噪实验。​ 我们在CRVD室内测试集和室外测试集上评估了我们的方法。表2显示了在CRVD室内测试集上的定量结果,我们的方法仍然优于其他无监督对应方法,并在PSNR上显示出与FloRNN相似的结果。然而,与合成高斯去噪数据集相比,在CRVD室内集上的改进不太显著,这可能是由于室内数据集规模有限和人为模拟的运动所致。我们进一步在具有真实运动和复杂场景的室外集上展示了我们的方法。图5展示了去噪结果的视觉质量。FloRNN倾向于产生过度平滑的结果,表明由于训练视频对有限且是模拟的,它难以处理未见过的场景。无监督去噪器UDVD无法有效抑制噪声。在这些方法中,我们的方法有效地消除了噪声,同时保留了精细细节。

4.3 渐进微调的可视化与分析​

通过结合时间信息,网络应该在几个微调步骤中逐步恢复细节。为了证明我们提出的渐进微调策略的有效性,我们分别在DAVIS、Set8和CRVD数据集上进行实验,并评估网络在每个步骤的去噪性能。图6展示了定量结果,说明了微调过程中去噪性能的持续提升。图7突出了每个步骤的质量提升,预训练去噪器(步骤0)产生过度平滑和伪影。随着训练的进行,网络逐渐恢复了详细的纹理,证明了该方法在逐步改善视觉质量方面的有效性。

4.4 消融研究​

微调所有参数还是微调时间模块。​ 为了避免对伪干净视频过拟合,我们建议在微调期间冻结预训练图像去噪器的参数。通过将此策略与在每个步骤遵循我们的渐进微调策略但微调所有参数的设置进行比较,评估了这一主张。表3案例1展示了微调所有参数与仅微调时间模块的定量比较。结果显示,当更新所有参数时,去噪性能下降,这可能是由于过拟合。因此,我们选择在微调期间冻结预训练层。

联合微调时间模块还是渐进微调。​ 我们探索了一种替代的微调策略,即同时训练所有模块。为了验证其相对于我们提出策略的有效性,我们冻结了预训练层的参数,并联合微调所有时间模块。为了公平比较,重复微调过程三次,类似于我们的方法。定量结果如表3案例2所示,在该配置下,第一步去噪性能有所提升。然而,在随后的微调步骤中,其性能下降。这种退化归因于网络对过度平滑结果的过拟合,以及联合训练所有时间模块导致的不稳定性,使得学习到的偏移量幅度很大。此外,与渐进微调策略相比,在每个步骤训练所有时间模块会导致较高的计算成本。

更多步骤的微调。​ 我们进一步探索了与原始策略相比,重复整个微调过程的有效性。在完成步骤3的微调后,我们使用伪对重复该过程。根据表3案例3,微调两次比一次略有改善。因此,我们在本研究中不重复整个微调过程。

时间相干性。​ 遵循之前的工作[20,39],我们创建了一个静态的12帧玩具数据集,噪声水平 $\sigma=30$。我们计算了相邻去噪帧的平均绝对误差,并可视化了其中两个去噪帧之间的残差图像之一,以评估时间相干性。表4和图8显示,我们的去噪器比无监督竞争者UDVD具有更好的时间相干性。此外,与我们的图像去噪基线NAFNet相比,TAP改善了时间相干性。


​

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询