RGB图像修复和视频修复技术分类

发布时间:2026/8/17 19:19:47
RGB图像修复和视频修复技术分类 1. 引言在拍摄、存储、传输和后期处理过程中图像中的部分信息可能因为传感器故障、数据丢失、划痕、污渍、水印或人为删除而缺失也可能被行人、车辆、手术器械等前景物体遮挡。这些损坏、缺失或需要移除的区域被统一表示为掩膜mask区域。图像修复image inpainting的目标是在有限可见信息的约束下对缺失内容进行合理重建从而恢复图像的视觉完整性如图1所示并减少信息缺失对识别、检测、测量和场景理解等后续任务的影响。图1. 图像修复效果随着计算机视觉技术及深度学习技术的快速发展与成熟应用图像修复已从简单的像素移植技术逐渐发展为重要视觉生成技术被广泛应用于老旧照片与文物影像修复、目标移除、图像编辑、隐私保护、医学影像处理、遥感影像补全、施工场景分析以及自动驾驶数据生成等领域。例如在移除道路上的车辆后模型不仅需要补全路面纹理还应保持车道线的连续性和道路结构的合理性。与单幅图像相比视频修复video inpainting要使修复内容在连续播放过程中保持外观稳定和运动连贯避免出现纹理闪烁、结构跳变、目标漂移以及前后帧内容不一致等问题。从一致性角度来看图像修复要考虑空间一致性 spatial consistency视频修复要同时考虑空间一致性和时间一致性temporal consistency。空间一致性指的是单张图像的被修复掩膜区域与周围已知背景区域在视觉结构和纹理上的融合程度。时间一致性指的是连续视频帧序列之间被修复区域在视频播放过程中随着时间推移的平滑、连贯、无剧烈突变。2. 图像修复技术2.1. 图像修复概念图像修复是值根据图像中仍然可见的内容以及模型所掌握的结构、纹理和语义先验对图像中缺失、损坏、被遮挡或被指定删除的区域进行推断与重建从而获得视觉完整、结构合理且语义连贯图像的计算机视觉技术。图像修复模型需要回答“缺失区域中应该出现什么”以及“如何使生成内容与原图自然衔接”两个基本问题。因此修复结果通常需要满足多个层面的要求在像素层面保持颜色和亮度连续在纹理层面恢复清晰且自然的局部细节在结构层面延续边缘、轮廓和几何关系在语义层面生成符合场景逻辑的物体或背景并尽可能保持未损坏区域不发生变化。随着生成式模型的发展图像修复任务边界进一步延伸到文本引导修复、形状引导对象生成、参考图像引导编辑和多模态对象插入等可控内容生成任务。在时间维度上图像修复又扩展为视频修复。由此可见现代图像修复既是一种图像恢复技术也是一种具有内容理解、视觉推理和条件生成能力的图像编辑技术。2.2. 分类依据与分类结果图像修复方法可分为传统方法和基于深度学习的现代方法。传统图像修复方法可分为扩散法、图像块法、稀疏法、扩散与图像块混合法、低秩法如图2所示。扩散法适合连接边缘和连续结构但对大面积纹理修复效果不佳。图像块法适合大面积纹理但容易出现断裂结构和异质纹理等接缝问题本身是一种图像拼接方法因此需要衔接接缝优化算法。扩散与图像块混合法指的是先用扩散法处理结构层再用图像块法合成纹理层。通过统一的目标函数进行优化包括扩散项、图块一致性项等。混合方法天然需要更多的计算资源且对超参数敏感。图2. 传统图像修复方法分类以深度学习网络为分类依据现代图像修复方法可分为基于CNN、基于GAN、基于Transformer、基于Diffusion model、基于混合与多分支网络的方法分类结果如图3所示。图3. 基于深度学习的图像修复技术分类2.3. 常用数据集有六个流行的和公开的数据集用于评估图像修复。这些数据集涵盖了各种类型的图像包括人脸CelebA和CelebAHQ、现实场景Places2、街道场景Paris、纹理DTD和对象识别ImageNet。数据集的详细信息如表1所示。表1. 图像修复常用数据集及数据量数据集数据类型数据量CelebA人脸图像202599张包含10177个身份CelebA-HQ高质量人脸图像30000张分辨率1024x1024Places2室内、室外自然场景超过1000万张Paris StreetView巴黎街景、建筑立面15000张DTD自然纹理图像5640张包含47类纹理ImageNet以物体为中心的自然图像143万张包含1000个类别2.4. 常用评价指标图像修复评价指标可分为像素感知指标如L1误差、PSNR、SSIM和视觉感知指标如FID、LPIPS各指标的详细信息如表2所示。表2. 图像修复常用评价指标。“↑”表示数值越大越好“↓”表示数值越小越好指标名称衡量内容评价方向L1 误差/MAE修复图像与真实图像对应像素之间绝对差值的平均值↓L2 误差/MSE修复像素与真实像素差值平方的平均值↓PSNR衡量修复图像与真实图像之间的像素保真程度↑SSIM从亮度、对比度和局部结构三个方面比较修复图像与真实图像↑FID比较修复结果与真实图像在Inception特征空间中的整体分布差异↓LPIPS利用深度网络特征衡量修复图像与真实图像之间的感知距离↓2.5. 当前主流使用方法传统方法不依赖大规模训练数据在修复划痕、窄裂缝、小面积缺损和规则重复纹理时具有较好的稳定性与可解释性。然而传统方法缺少对物体类别、空间关系和整体场景的高层语义理解不能根据上下文生成原图中不存在的新内容。当掩膜面积较大、形状不规则或覆盖人脸、建筑等关键结构时容易出现纹理重复、错误拼接、轮廓断裂和语义不合理等问题。现代方法经历了卷积神经网络、生成对抗网络、注意力与Transformer以及扩散模型几个阶段的进化各类方法各有优缺点。不过从修复质量来说注意力与Transformer、扩散模型两类方法更优。然而扩散模型迭代采样轮次较多、推理速度较慢、生成内容不确定性较大。因此在追求开放式生成和可控编辑的场景中扩散模型占据主流而在实时处理、固定领域和资源受限的应用中CNN–Transformer混合模型仍具有明显的实用优势。现代图像修复方法的基本步骤是掩膜区域与其他区域相似度计算 - 其他区域信息传播与融合 - 掩膜区域信息生成 - 未破坏图像的监督和约束。基于扩散模型的图像修复方法不遵循上述基本流程。3. 视频修复技术3.1. 视频修复概念视频修复是指根据视频中未受损区域的空间内容以及不同帧之间的时间信息对被遮挡、删除或缺失的时空区域进行内容重建从而生成空间结构合理、纹理自然且时间变化连续的视频序列。与图像修复只处理单幅图像不同视频修复面对的是由连续帧组成的时空数据其处理对象不仅是二维图像中的空间缺损而且是随时间变化的三维时空缺损区域。视频修复包括“已有内容传播”和“未知内容生成”两个相互补充的过程。当被遮挡的背景或物体在其他帧中曾经出现时模型可以利用光流、特征对应、运动轨迹或时空注意力将其他帧中的可见内容传播到当前缺损区域当目标内容在所有参考帧中均不可见时模型则需要依靠从训练数据中学习到的图像结构、纹理和语义先验生成符合当前场景的新内容。相比之下在盲视频修复中需要先识别掩膜区域再进行前述两个流程。3.2. 分类依据与分类结果传统视频修复方法可分为时空扩散方法、时空图像块方法、运动与轨迹引导方法等如图4所示。现代视频修复方法可分为CNN与循环生成方法、光流引导方法、注意力与Transformer方法、扩散模型方法等如图5所示。图4. 传统视频修复方法分类图5. 现代基于深度学习的视频修复方法分类3.3. 常用数据集视频修复从完整视频中人工生成静态、移动、自由形状或目标形状的掩膜再以原始视频作为真值进行训练和评价。其中YouTube-VOS和DAVIS是目前最常用的通用基准。相关数据集信息如表3所示。表3. 视频修复常用数据集及数据量数据集名称数据量YouTube-VOS4453个视频DAVIS 201650个视频DAVIS 2017150个视频FVI15000个视频3.4. 常用评价指标视频修复评价指标与图像修复评估指标基本一致可参考表2。3.5. 当前主流使用方法传统视频修复方法具有传统图像修复方法的一切缺点同时逐视频搜索和迭代优化进一步增加了计算开销。现代方法中融合光流引导传播与时空Transformer的混合方法是最主流、最成熟的技术路线。该混合方法兼顾了光流方法的真实纹理保留能力和Transformer的全局语义建模能力能够有效处理大面积掩膜、复杂运动和长距离信息依赖同时提高空间细节与时间一致性。对于基于扩散模型的视频修复方法而言其更适合大面积内容生成和创意视频编辑。在常规的恢复原始背景和补全掩膜区域方面光流与Transformer混合方法更具实用性。视频修复的基本步骤是视频帧对齐 - 信息像素、特征传播与融合 - 内容生成。参考文献[1] Xiang H, Zou Q, Nawaz M A, et al. Deep learning for image inpainting: A survey[J]. Pattern Recognition, 2023, 134: 109046.[2] Qin Z, Zeng Q, Zong Y, et al. Image inpainting based on deep learning: A review[J]. Displays, 2021, 69: 102028.[3] Elharrouss O, Damseh R, Belkacem A N, et al. Transformer-based image and video inpainting: current challenges and future directions: O. Elharrouss et al[J]. Artificial Intelligence Review, 2025, 58(4): 124.[4] Guillemot C, Le Meur O. Image inpainting: Overview and recent advances[J]. IEEE signal processing magazine, 2013, 31(1): 127-144.[5] Zhang X, Zhai D, Li T, et al. Image inpainting based on deep learning: A review[J]. Information Fusion, 2023, 90: 74-94.[6] Huang Y, Huang J, Liu Y, et al. Diffusion model-based image editing: A survey[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2025, 47(6): 4409-4437.[7] Quan W, Chen J, Liu Y, et al. Deep learning-based image and video inpainting: A survey[J]. International Journal of Computer Vision, 2024, 132(7): 2367-2400.