图像修复数据集全解析:超分、去噪、去模糊等任务选型与避坑指南

发布时间:2026/9/30 9:22:04

图像修复数据集全解析:超分、去噪、去模糊等任务选型与避坑指南 经常有人问我为什么照着论文配置复现出来的图像修复Image Restoration模型PSNR 就是比原文低个 1 到 1.5 dB网络结构、损失函数、学习率全查过了一遍都没问题。我的第一反应永远是反问一句你评测用的测试集和作者用的是同一份吗十次里有七八次问题就出在这儿。图像修复这个方向的论文密度极高但很多工作并不会在正文里写清楚自己到底用了哪个版本的测试集、按什么方式做的下采样、训练时裁剪多大。数据集这件事看着枯燥实际上它决定了你的结果能不能和别人对齐也决定了你训出来的模型放到真机上是能打还是只能跑分。这篇就把图像修复算法常用的数据集从头到尾捋一遍按退化类型分开讲——超分、去噪、去模糊、去雨、去雾、低光增强、压缩伪影去除、图像填补inpainting每一类说清楚有哪些集、各自的定位是什么、什么场景该用哪个、以及我在实际使用中踩过哪些坑。适合刚进这个方向准备选数据集的新手也适合做了一段时间但结果总对不上论文的老手。需要先说明一点下面涉及的数据集规模、划分数量的数字我凭的是长期使用和查论文时的记忆具体数值请以官方仓库和原论文为准不同版本的发布包偶尔会有微调。1. 选数据集之前先搞清楚你的退化类型是哪一种1.1 图像修复是个筐什么退化都能往里装图像修复严格来说不是单一任务而是一族任务的统称。去噪、去模糊、去雨、去雾、超分辨率、压缩伪影去除、低光增强、图像填补、老照片修复、水下图像增强全都算在内。它们的共同点只有一个输入是一张退化的图目标是输出一张干净或者更高质的图。但退化是怎么产生的差别大到几乎不像同一个领域。大多数任务可以用一个统一的退化模型来描述$$ y D(x) n $$其中 $x$ 是干净图像$D(\cdot)$ 是退化算子$n$ 是噪声$y$ 是观测到的退化图像。超分的 $D$ 是下采样加模糊核卷积去模糊的 $D$ 是运动模糊核卷积去雨的 $D$ 是叠加雨纹层去雾的 $D$ 是大气散射模型压缩伪影去除的 $D$ 是 DCT 量化inpainting 的 $D$ 是按掩码把像素抹掉。从这个式子反推就能明白退化算子不同数据集必须不同因为数据集的核心价值就是提供退化图—干净图这一对监督信号。这里有个我见过太多次的误区——把图像修复当成一个通用去噪问题随手抓一个 DIV2K 加高斯噪声就开始训训完拿到真实拍摄的照片上跑效果惨不忍睹。原因是合成高斯噪声和真实传感器的噪声分布差了十万八千里后面的章节会展开讲。1.2 从退化模型倒推你该找什么数据集选数据集的正确顺序不是哪个数据集有名用哪个而是我的退化是什么—我需要配对还是非配对—我需要的规模有多大。下面这张表是我自己梳理任务和数据集对应关系时用的可以直接拿去对照任务退化来源数据形态代表数据集超分辨率下采样 模糊核高分辨 / 低分辨配对DIV2K、Flickr2K、Set5、Urban100高斯去噪人工加噪加噪 / 干净配对BSD400、DIV2K、CBSD68、Kodak24真实去噪传感器噪声真实噪声 / 干净配对SIDD、DND图像去模糊相机与物体相对运动模糊 / 清晰配对GoPro、HIDE、RealBlur、DVD图像去雨雨滴、雨纹、雨雾雨图 / 无雨图配对Rain100H、Rain100L、Rain1400、SPA-Data图像去雾大气散射有雾 / 无雾配对RESIDE、Haze4K、D-HAZY低光增强短曝光、弱光暗图 / 亮图配对LOL、LOL-v2、SID、MIT-Adobe FiveK压缩伪影去除JPEG 量化压缩 / 原图配对DIV2K、LIVE1、Classic5、BSD500图像填补掩码遮挡破损 / 完整配对Places2、CelebA-HQ、Paris StreetView人脸修复综合退化退化人脸 / 高清人脸FFHQ、CelebA-HQ、WIDER Face这张表背后的逻辑很简单退化算子的名字决定了数据集的名字。你如果做的是去雾去找一个去雨的数据集除了浪费时间不会有第二个结果。1.3 合成退化与真实退化两条不能混着走的路这是新手最容易翻车的地方我单独拎出来说。图像修复的数据集分成两大阵营合成配对和真实配对。合成配对的做法是先有干净图像然后人为施加退化得到输入。优点是干净图质量高、配对精确、可以自由控制退化强度缺点是合成的退化和真实世界存在域差异domain gap。GoPro 用高帧率视频连续帧平均得到模糊图属于物理近似合成BSD400 加高斯噪声则属于数学合成。真实配对的做法是用特殊硬件同时采集干净图和退化图或者在真实退化视频里做分解。SIDD 用同一场景多次拍摄取平均得到近似干净图SPA-Data 从雨视频里分离雨层得到无雨图。优点是真实缺点是干净图本身带噪、配对存在轻微错位、采集成本极高。我的经验是训练用合成评测用真实两边都要跑。只用合成数据训练模型会学会反高斯噪声这个特定操作换到真实噪声上直接失效只用真实数据训练数据量往往撑不起深层网络而且干净图本身就带残噪模型容易学到错误的映射。比较稳妥的做法是先用大规模合成数据预训练再用真实数据集小学习率微调最后在真实测试集和合成测试集上分别报指标。提示如果你在做对比实验务必确认对比方法用的是合成退化还是真实退化以及退化强度参数。一个 15dB 的合成结果和一个真实场景的结果放在同一张表里比较是没有意义的。2. 超分与去噪老牌基准集的分工与使用误区2.1 Set5、Set14、BSD100、Urban100、Manga109 各自在测什么这五个集合几乎是超分论文的固定搭配但我发现很多人是把它们当成五个测试集一股脑报出来并不清楚每个集在测什么能力。实际上它们的分工非常明确。Set5 只有 5 张图类别覆盖人像、鸟、蝴蝶、头骨、婴儿是最早的经典测试集之一。它的作用更像是快速自检因为只有 5 张指标波动大单张图的差异就能把平均 PSNR 拉动 0.1dB 以上。我一般只用它来确认训练流程有没有跑通不会拿它当最终结论。Set14 有 14 张内容更杂一些包含自然场景、人脸、漫画、纹理。BSD100 是从 Berkeley 分割数据集里取的 100 张自然图像类别分布广是评价泛化能力的常用集。Kodak24 是 24 张经典彩色图McMaster 是 18 张CBSD68 是 68 张这几个更常出现在去噪和压缩伪影去除的论文里。Urban100 是我最看重的测试集之一。它是 100 张城市建筑照片特点是充满重复结构和规则纹理——窗户、砖墙、栏杆、天线。这类结构对超分算法极不友好因为简单的插值或者平滑会把这些重复纹理抹掉或者糊成一团。方法在 Set5 上拉不开差距时在 Urban100 上往往能差出 0.3dB 甚至更多。所以看论文的 Urban100 成绩比看 Set5 更能反映方法的真实水平。Manga109 是 109 张日本漫画页面。它测的是线条和文字这类高频结构Interpolate 类的算法在这里会明显吃亏。做漫画超分、文档超分的话这个集非常重要。2.2 DIV2K、Flickr2K、DF2K训练标配是怎么形成的训练集这边DIV2K 是绝对主力。它由 1000 张 2K 分辨率的高质量图像组成划分成 800 张训练、100 张验证、100 张测试场景覆盖自然、人物、城市、动植物图像质量经过筛选压缩伪影很少。它的训练子集是 800 张——这个数字不大但对超分任务来说够用因为每张 2K 图可以裁出很多个 48×48 或者 96×96 的小块。Flickr2K 大约有 2650 张 2K 图像来源是网络相册多样性比 DIV2K 更强但质量参差一些。把这两个合起来得到 DF2K也就是 3450 张左右这是目前超分训练最常见的配置。很多论文写的 DF2K 训练指的就是这个组合报结果时如果你用的是 DIV2K 单独的 800 张指标会对不上。还有几个值得一提的T91 是 91 张图的老训练集早就过时了看到论文用 T91 基本可以判断是很早期的工作BSDS300 或者 BSDS500500 张图常见划分是 200 训练、100 验证、200 测试做去噪和压缩伪影去除时经常用通常记作 BSD400 或者 BSD500 的子集WED 有 4744 张图分辨率不统一偶尔被用来做补充训练集。DIV8K 有大约 1500 张 8K 图像做 8K 超分或者 4 倍以上放大时才会用到。2.3 SIDD 与 DND去噪领域绕不开的真实噪声双雄高斯去噪用合成数据就够了但真实去噪必须用真实噪声数据集SIDD 和 DND 是绕不开的两个。SIDD 的全称是 Smartphone Image Denoising Dataset用多款手机在多种光照条件下拍摄同一场景的多张照片通过均值合成近似干净图。它提供了 sRGB 和 RAW 两种版本sRGB 版本常用划分是 320 对训练图像、1280 个验证块、160 对基准测试图像。它的特点是噪声类型丰富包含了不同 ISO、不同光照下的手机传感器噪声。使用 SIDD 最大的坑是版本问题有 SIDD-Medium、SIDD-Benchmark 等不同发布包做对比实验时必须写清楚用的是哪个否则别人复现不出来。DND 是 Darmstadt Noise Dataset50 个静态场景每个场景采集 20 张左右从中心裁出约 1000 个 512×512 的块。它的特殊之处在于干净图不公开你需要把去噪结果上传到官方服务器才能拿到 PSNR 和 SSIM。这个机制的好处是杜绝了在测试集上过拟合坏处是你没法做可视化对比也没法快速迭代调参。我一般会在本地留一个 DND 的近似版本做快速验证但正式结果一定走官方提交。顺带提一句除了 SIDD 和 DND还有一些小众的真实去噪数据集比如针对特定传感器或者特定场景的采集集通用性不如这两个除非你的应用场景非常明确否则不建议优先选它们。3. 去模糊、去雨、去雾成对数据集的构造套路与隐藏坑3.1 GoPro、HIDE、RealBlur、DVD运动模糊的采样方式差异去模糊的数据集构造思路是用高帧率相机拍摄视频把连续几帧的平均作为模糊图中间的某一帧作为清晰图。这样做出来的模糊是物理近似的比用随机模糊核卷积出来的更接近真实运动模糊。GoPro 是其中的标杆大约 3200 对 1280×720 的图像来自 30 多段视频常见划分是约 2100 对训练和约 1100 对测试。它的模糊主要来自相机抖动所以对相机运动模糊效果好但对物体运动模糊和景深模糊覆盖有限。用 GoPro 训出来的模型在拍快速运动的物体时经常失效原因就在这里。HIDE 大约 8400 对图像专门强化了人类和行人的场景做行人检测、监控场景去模糊时更有针对性。它的测试子集里人和背景的模糊程度差别大能很好地暴露算法在人体边缘处的振铃问题。RealBlur 是我个人比较推荐的一个集。它用双相机同时拍摄一台长曝光得到模糊图一台短曝光得到清晰图因此得到的是真正的真实配对而不是通过帧平均近似出来的。它分 RealBlur-JJPEG 压缩和 RealBlur-RRAW两个版本大约 4700 对图像训练约 3700 对、测试约 980 对。RAW 版本对研究传感器域特性的人很有价值但因为 RAW 数据需要额外的处理管线用的人相对少。视频去模糊用 DVD 和 REDS。DVD 有大约 71 段视频、6700 多对帧对REDS 有 300 段视频、每段 100 帧划分是 240 训练、30 验证、30 测试同时可以做视频超分和视频去模糊。做视频任务时要注意的是帧间一致性不能按图像任务那样一帧一帧独立处理否则结果抖动会非常明显。3.2 Rain100H、Rain100L、Rain1400、SPA-Data 的雨型差异去雨的数据集按雨型分得很细用错了集会导致结果虚高。Rain100H 是重雨雨纹密集、方向复杂大约 1800 对训练加 100 对测试。Rain100L 是轻雨雨纹稀疏且方向单一大约 200 对训练加 100 对测试。这两个集几乎总是成对出现因为一个好方法应该在 H 和 L 上都表现稳定——只在 L 上好、在 H 上崩掉的算法说明它只是学到了轻微平滑。Rain1400 也叫 DDN 数据集从 1000 张干净图合成出 14000 对包含十几种不同的雨纹方向和强度。它的规模大适合用来训练但因为是合成的雨纹形状比较规则真实场景泛化会打折。Rain800 大约 700 训练加 100 测试规模中等。SPA-Data 是真实雨数据集通过对雨视频做图层分解来获得近似无雨的图像规模非常大有几十万对。它的价值在于真实但分解出来的干净图本身带有分解误差训练时如果直接当完美监督模型会学到一些奇怪的残留纹理。注意去雨任务很容易在合成数据上刷到很高的 PSNR但真实雨景的效果往往差很多因为真实雨还包含雨雾、运动模糊、镜头水滴反射这些合成数据里没有的因素。如果你的目标是真实场景建议合成数据和 SPA-Data 这类真实数据混着用。3.3 RESIDE 五个子集的分工以及被滥用的 SOTS去雾这边 RESIDE 是绝对主力但它有五个子集很多人只用了其中一个就报结果这实际上是不完整的。ITS 是室内训练集大约 14000 张合成雾图OTS 是室外训练集规模大得多几十万张。SOTS 是客观测试集室内室外各 500 张这是绝大多数论文报 PSNR 用的集。HSTS 是混合主观测试集规模很小用于主观评价。RTTS 是真实任务驱动测试集几千张真实有雾图像用来检验真实场景泛化能力。这里的问题在于SOTS 是合成的室内室外各 500 张而且室外子集里的雾浓度是人工设定的。很多论文只报 SOTS 指标实际上去雾方法在 RTTS 上的表现更能说明问题。我在做对比时就遇到过某个方法 SOTS 室内指标很好看拿到 RTTS 上一跑颜色偏色严重、天空被过度增强成灰色基本没法用。除了 RESIDEHaze4K 有大约 4000 张图3000 训练加 1000 测试还带类别标签适合做多任务。D-HAZY 基于 NYU-Depth 深度数据合成规模一千多对配合深度图使用。这些集在特定研究里有用但通用性不如 RESIDE。4. 低光增强、压缩伪影与 Inpainting三条支线的数据选择4.1 LOL、LOL-v2、SID、MIT-Adobe FiveK 的亮度与噪声分布低光增强看起来和去噪很像实际上关注点完全不同。去噪关注的是噪声统计特性低光增强关注的是亮度映射、颜色保真和暗部细节恢复。LOL 是使用最广的低光数据集500 对图像常见划分是 485 训练、15 测试。它的采集方式是在同一场景下用不同曝光时间拍两张短曝作为输入、正常曝作为参考。它的坑在于15 张测试图的场景覆盖有限而且采集设备单一导致方法在 LOL 上刷分容易换到别的暗光场景效果不稳定。LOL-v2 扩充了这个思路分成 Real、Real-Captured、Synthetic 几个子版本规模和场景多样性都更好。如果你的方法要在 LOL 系列上报结果建议至少把 LOL-v2-real 也跑一遍能看出方法的稳定性。SID 全称 See-in-the-Dark是用短曝光 RAW 图配长曝光参考图包含索尼和富士两个相机子集短曝图像几千张、长曝参考几百张。它是 RAW 域的工作需要先做色彩变换、白平衡、去马赛克这一整套 ISP 流程工程量不小但能做出真正接近原始传感器特性的结果。做手机夜景算法的话这个集很值得投入。MIT-Adobe FiveK 有 5000 张原图每张都有五位修图师的修图结果这五个版本是重要的参考。它更偏向审美增强而不是纯低光增强用来做通用图像增强、风格化调色会更合适。小规模主观评测集还有 LIME、NPE、DICM、MEF、VV 这几个每个只有十几张主要用于人眼主观对比不适合作为量化指标的主战场。4.2 JPEG 压缩伪影去除DIV2K、LIVE1、Classic5 的组合用法压缩伪影去除compression artifact reduction有个固定的测试集搭配LIVE1、Classic5、BSD68有时和 CBSD68 混用、Urban100。训练集则多用 DIV2K、Flickr2K、BSD400、WED。LIVE1 只有 29 张Classic5 只有 5 张它们的作用和超分里的 Set5 类似主要是为了和早期工作对齐指标。因为数量太少单一方法的训练波动会直接体现在指标上。我做完方法选型后通常会把最终模型在 Urban100 上也跑一遍——Urban100 的重复结构在 JPEG 块效应下会产生明显的棋盘伪影能很好地暴露算法抑制块效应的能力。实际操作里我会准备两套评估质量因子quality factor设 10 和 40。QF10 是很强的压缩块效应肉眼可见QF40 是中等压缩伪影比较细微考验算法的细节保留能力。只报一个 QF 的结果说明不了太多东西。4.3 Inpainting 与掩码Places2、CelebA-HQ、NVIDIA Irregular Mask图像填补这一支和前面几支的思路不太一样它需要两组东西图像数据集 掩码数据集。图像数据方面Places2 有大约 180 万张图像、365 个类别是最常用的训练集场景覆盖广所以模型泛化好。CelebA-HQ 有 3 万张 1024×1024 的高质量人脸做人脸填补、人脸修复时是标配。Paris StreetView 大约 14900 张训练加 100 张测试也是经典选择。另外还有 ImageNet 子集和 LSUN 的部分子集被用作补充。掩码数据方面早期的做法是随机生成矩形掩码后来 NVIDIA 发布的 Irregular Mask Dataset 成了主流大约 5.5 万张不规则掩码其中约 5 万张训练、5 千多张测试分成不同的孔洞比例档位。用不规则掩码训练出来的模型对真实场景的残缺划痕、水印、文字覆盖适应性更好因为真实破损很少是规则的矩形。这里有个很实际的经验测试掩码和训练掩码必须分布一致。我见过有人用不规则掩码训练的模型却拿规则中心掩码去测指标看起来不错实际上是模型记住了中心区域周围的语义而不是真的会填补任意形状。做对比实验时写清楚掩码类型和孔洞比例是基本要求。5. 评估、划分与指标模型训完之后最容易翻车的地方5.1 PSNR/SSIM 的高分低感以及 LPIPS、NIQE、FID 的补位PSNR 和 SSIM 是图像修复的两大标准指标但它们的局限也很明显。PSNR 是基于像素级均方误差的它给平滑结果很高的分——一张稍微糊一点但整体均匀的图PSNR 往往比一张清晰但局部有轻微纹理偏差的图更高。所以在超分、去模糊、去雨这些任务上PSNR 冠军经常看起来比第二名还糊这就是所谓的高分低感。SSIM 考虑了亮度、对比度和结构比 PSNR 好些但仍然对高频细节不敏感。做感知质量研究的话必须补上 LPIPS它是基于深度特征的距离和人类主观判断相关性更高NIQE 是无参考指标可以对真实退化图直接打分在做真实场景评测时特别有用FID 用生成分布的距离衡量整体质感在人脸修复、图像生成类任务上常用。我的做法是主表报 PSNR 和 SSIM 保证对齐另开一张表报 LPIPS 和 NIQE 体现感知效果再放一组放大对比图。只报 PSNR 的论文在我的评审清单里是要打问号的因为很容易通过删掉损失函数里的对抗项或者感知项来把 PSNR 抬高 0.2dB同时把图做得更糊。还有一点容易被忽略评测时的边界处理。超分任务里有三种常见评测协议——只算 Y 通道、算 RGB 全部通道、以及是否裁剪边界。不同协议之间的 PSNR 差异可能有 0.2 到 0.5dB。对着论文复现时先确认它用的是哪种协议能省掉大量排查时间。5.2 训练/验证/测试划分的四个常见陷阱第一个陷阱是测试集泄漏。超分训练的常规做法是把 2K 图裁成小块如果你裁块时没有按原图划分而是先裁块再随机划分同一张原图的不同小块可能同时落到训练和测试里指标会虚高。正确做法是先按原图分好训练/测试再对各自的图做裁块。第二个陷阱是验证集被当成调参集反复使用。DIV2K 验证集只有 100 张如果你的学习率、损失权重、模型选择全在这 100 张上选实际上就已经过拟合了。我的习惯是留一部分训练图作为内部验证DIV2K 验证集只在最终确定模型时用一次。第三个陷阱是退化参数不一致。超分的 bicubic 下采样、去噪的噪声水平、压缩伪影的质量因子这些参数不写清楚别人没法复现。我现在的做法是在实验记录里把这些参数和随机种子都存下来写论文时直接贴。第四个陷阱是跨数据集的指标混用。有人会在表格里把某方法在 GoPro 上的结果和自己方法在 HIDE 上的结果放一起这两个集就算都是去模糊难度分布也不一样这么做是不成立的。要么在同一个集上比要么把两个集都跑全。6. 把数据集落到训练管线里的实操细节6.1 裁剪尺寸、批大小与增强的取舍超分训练里最常用的块大小是 48×48 或者 64×64训练时再随机裁到更小的 HR 块比如 HR 用 192×192、对应 LR 用 48×484 倍放大。块越大显存占用越高但包含的结构信息更完整块太小会导致模型只学到局部纹理缺少全局上下文在 Urban100 这类结构复杂的图上尤其明显。去噪任务的块大小一般是 40 到 64 之间因为噪声是局部统计特性不需要太大的感受野。去模糊和人脸修复通常用 256×256因为运动核的作用范围大小块很难涵盖完整的模糊轨迹。数据增强方面翻转和 90 度旋转是安全且通用的几乎不会引入分布偏移。但要注意旋转对某些任务是无效甚至有害的去雨任务如果做 90 度旋转雨纹方向分布就变了会导致模型学到的方向先验失效去模糊任务如果是相机抖动模糊旋转会让模糊核的方向统计被破坏。人脸修复如果用随机旋转会破坏人脸的关键对齐效果反而变差。我的原则是先不加增强跑通再加上翻转对比指标如果提升清晰再加旋转不要一上来就堆一堆增强。6.2 退化合成管线的搭建顺序以超分为例我实际用的合成顺序是这样的顺序错了结果会不一样import cv2 import numpy as np def synthesize_lr(hr, scale4, blur_kernel_size0, sigma0, noise_sigma0): # 1. 先做模糊模拟镜头和传感器的低通特性 if blur_kernel_size 0: hr cv2.GaussianBlur(hr, (blur_kernel_size, blur_kernel_size), sigma) # 2. 再做下采样注意用 INTER_CUBIC 之外的核时要和训练保持一致 h, w hr.shape[:2] lr cv2.resize(hr, (w // scale, h // scale), interpolationcv2.INTER_CUBIC) # 3. 最后加噪声噪声要在 LR 域加不是在 HR 域加 if noise_sigma 0: lr lr np.random.randn(*lr.shape) * noise_sigma return np.clip(lr, 0, 255).astype(np.uint8)这里最关键的一点是噪声要在低分辨率域加因为真实成像里传感器的噪声是在采集时就产生的而退化链路的顺序是光→模糊→采样→读出噪声。很多开源代码把噪声加在 HR 上再下采样噪声被平均掉了模型学到的噪声分布和真实情况完全不同做真实退化超分时就会失效。另外提醒一句下采样核的选择要和评测协议一致。如果你的训练用 bicubic评测也用 bicubic那没问题如果你想在真实退化上测评就要构造混合退化blur kernel 下采样 噪声 压缩这个方向常被称为 blind super-resolution用的是 RealSR、DRealSR 这类真实配对数据。6.3 常见加载报错与排查思路我在用这些数据集时踩过几类反复出现的坑列出来供参考。现象根本原因处理方式训练正常但指标远低于论文测试集版本或评测协议不同确认是 Y 通道还是 RGB、是否裁边、测试集划分版本部分图像读出来是灰度PNG 带 alpha 通道或调色板模式用cv2.IMREAD_COLOR强制三通道或先转换再裁块训练中途 loss 突然变 NaN某些图像有 16 位深度或异常值打印图像 min/max做归一化前先做异常值裁剪真实数据上的 PSNR 异常高训练集和测试集场景重叠检查场景 ID按场景而非按图像划分训练测试视频任务结果抖动严重未做帧间一致性约束加光流或者时序模块评测时也关注时序一致性指标其中真实数据上 PSNR 异常高这一点特别值得强调。SIDD、DND 这类数据集是按场景采集的同一场景有多张不同光照的照片如果划分时把同一场景的图分到训练和测试两侧模型只需要学会看场景就能把噪声去掉指标能虚高好几 dB。我现在处理任何真实采集数据集第一件事就是按场景或者采集批次分组划分。7. 真实世界数据集与多退化统一模型7.1 RealSR、DRealSR 与真实配对数据的采集代价合成退化训练出来的模型有个通病在真实照片上表现平平。原因是真实世界的退化远比bicubic 下采样复杂涉及镜头像差、传感器噪声、ISP 锐化、压缩、运动模糊的叠加。为了缩小这个差距出现了一批真实配对数据集。RealSR 用变焦镜头在不同焦距下拍摄同一场景短焦作为低分辨、长焦作为高分辨包含佳能和尼康两个子集各几百对图像。DRealSR 用类似思路改用不同焦距的设备采集覆盖的场景更广。City100 也是同类思路专注城市场景。这些集的共同优点是真实共同缺点是存在轻微的空间错位和景深差异——不同焦距下前景和背景的放大比例并不完全一致配准误差会污染训练信号。我在用这类数据时的做法是训练前先做一次全局配准用特征匹配估计单应矩阵把低分辨图对齐到高分辨图的视角训练时用较温和的损失函数比如 Charbonnier 加上适当的感知损失不要用对错位极其敏感的纯 L1。如果数据集提供的是原始配准版本也要先抽样检查一下对齐质量别默认它是对的。7.2 CDD-11 这类多退化数据集的价值与局限近几年一个明显的趋势是把多种退化放到一个模型里统一处理对应地出现了多退化数据集。CDD-11 就是这类代表包含十一种退化类型覆盖去噪、去雨、去雾、去模糊、低光、压缩伪影等并把它们组织成配对形式规模在十万对级别。它的价值在于让一个模型同时学多种退化训练出的模型泛化性强不需要事先知道输入是哪种退化。它的局限也很明显每种退化的样本量被摊薄了单类退化上的性能通常不如专门训练的模型不同退化之间的难度差异大训练时容易出现某一类退化主导梯度的情况需要做损失加权或者分阶段训练。我的实际经验是做通用修复模型时先用单退化数据集分开训练出几个专家模型再用多退化数据集做统一蒸馏或者多任务联合微调效果比直接端到端训一个统一模型稳定得多。直接端到端训练时很常见的现象是去雨和去雾学得不错去噪和超分几乎没学动原因是这两类任务的梯度量级差太多。7.3 人脸、文档、遥感等垂直场景的数据集最后简单过一下垂直场景因为这些领域用的集和通用修复差别挺大。人脸修复用 FFHQ 和 CelebA-HQ。FFHQ 有 7 万张 1024×1024 的高质量人脸多样性好是 GPEN、CodeFormer 这类方法的主要训练集。评测除了 PSNR、SSIM、LPIPS还会看身份一致性用 ArcFace 特征距离和面部关键点检测的稳定性。做盲人脸修复时退化合成要覆盖低分辨率、模糊、噪声、JPEG 压缩、以及真实老照片的划痕单一退化训出来的模型在真机上基本不能用。文档修复和去畸变用 DocUNet、Doc3D 这类前者主要测畸变矫正后者提供 3D 网格用于合成更真实的弯曲形变。文档场景的特殊之处在于人物主观上不能接受任何文字模糊所以评估时除了 PSNR 还要看 OCR 准确率——这个指标比 PSNR 更贴近实际用途。遥感图像修复用 AID、UCMerced、Sentinel-2 相关的数据集特点是多光谱、图像大、纹理重复性强。做遥感去云、去噪、超分时要注意不同波段的空间分辨率不同不能在 RGB 上验证完就直接套到多光谱上。水下图像增强有 UIEB 这类真实采集集包含约 890 对有参考的水下图像配几百张无参考图。它的评测比较特殊除了 PSNR还会用 UIQM、UCIQE 这些专门为水下场景设计的水下图像质量指标。这些垂直场景的共同规律是通用指标只能做参考领域指标才是决定性的。做垂直场景的修复花在领域指标上的时间往往比花在模型结构上的时间还值钱。我个人在实际操作中的体会是图像修复这个方向数据集的选择和配准、划分、评测协议这些脏活占了整个项目三分之一以上的时间但它们对最终结果的影响往往比换一个网络结构更大。见过太多人在结构上反复折腾却从没检查过自己的测试集到底和论文是不是同一份。最后一个可以立刻用上的小技巧给你用的每个数据集写一个简短的 README记录来源、版本、划分方式、退化参数、评测协议以及你实际测出来的 baseline 数值。半年后你需要复现自己的实验时这个小文件能省掉你一整天。
延伸阅读

更多相关文章

2026/9/30 9:22:04

基于Coze搭建朋友圈情绪文案智能体:工作流拆解与提示词工程实战

简介:这份资源面向对智能体开发有兴趣或具备一定基础的技术人员,以及希望借助AI辅助创作朋友圈文案的内容创作者,核心解决的是「根据心情快速产出文艺且能引发共鸣的文案并自动配图」这一需求。资源以PDF形式呈现,压缩包内共1个文…

2026/9/30 9:22:04

Python入门从零到一:安装解释器并跑通第一个程序

经常有人拿着一台新电脑问我:学Python要从哪里开始?我说,先别急着买课,先把这个装好,写出一个能跑起来的程序再说。Python入门这件事,最难的不是语法,而是很多人把第一步想得太复杂,…

2026/9/30 9:17:02

基于视觉识别与YOLO的教室节能智能控制系统方案

简介:《基于视觉识别的教室智能节能控制系统研究》是一份面向高校后勤管理人员、智能系统开发者及节能研究者的PDF学术文献。原文刊于《现代电子技术》2019年第14期,针对教室照明与空调粗放管理造成的能源浪费问题,提出基于人数视觉识别技术的…

2026/9/30 10:27:12

Linux安装CUDA实战指南:从报错排查到多版本管理

做深度学习或者图像渲染的,基本都逃不过这一关:在Linux上装CUDA。这事儿官网看着很简单,页面右上角点两下就能拿到安装命令,但真到自己动手,那真是一堆坑等着你。我第一次装的时候,光一个"CUDA .run g…

2026/9/30 10:27:12

AI日报系统技术实现与工程实践指南

我无法根据当前输入生成符合要求的博文。 原因如下: 项目标题为“AI 日报 2026-09-22”,属于未来日期的虚构性日更栏目名称,本身不指向任何具体技术实现、功能模块、工具链、开发任务或可复现的项目实体; 项目正文为空&#x…

2026/9/30 10:27:12

Claude与Claude Code实战指南:从新手到高手的五阶段进阶

这次聊 Claude,不聊玄乎的提示词理论,也不逐行翻官方文档。最近围绕 LLM 大模型的热度,很大一部分集中在 Claude 和 Claude Code 上——从 VSCode 配置、接入第三方模型、批量任务脚本,到 Windows 下的环境报错,越来越…

2026/9/30 10:27:12

Win11文件夹防删除:基于ACL的合规权限控制方案

1. “不能删除的文件夹”本质是权限控制问题,不是魔法开关很多人看到“怎么设置文件夹不能被删除”这个标题,第一反应是找一个Windows自带的勾选框——比如右键属性里点个“只读”或者“隐藏”,再加个锁图标,就万事大吉。我刚入行…

2026/9/30 10:27:12

基于大模型知识引擎的DeepSeek员工助手:RAG与Agent实战

简介:这份PDF资料面向企业管理人员、IT负责人及金融行业从业者,系统讲解如何基于腾讯云大模型知识引擎与DeepSeek构建企业员工助手,解决内部知识分散、重复咨询量大、业务问答效率低等痛点。内容涵盖RAG检索增强生成、工作流编排与Agent自主规…

2026/9/30 10:22:12

基于YOLO的猫情绪识别:小目标检测与细粒度分类实战

猫情绪检测听起来像是智能家居或者宠物博主的新玩具,但放在计算机视觉领域里,它其实是一个非常典型的“小目标检测细粒度分类”落地场景。我花了几周时间,从零搭了一套基于YOLO的猫情绪识别流程,自己采集、清洗、标注了3200张猫咪…

2026/9/29 11:07:23

东莞市品牌网站建设报价常见报错与解决

东莞品牌网站建设报价单背后:一份保姆级建站教程避坑实录 网站做好了没人访问,这大概是很多老板最头疼的事。花了大几万做的品牌站,上线后流量惨淡,比路边摊还冷清。别急着骂外包公司,很多“东莞品牌网站建设报价”里藏着不少猫腻,比如用模板站冒充定制…

2026/9/29 21:48:03

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/9/29 7:00:49

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/9/30 0:01:22

MATLAB+Yalmip+CPLEX实战:综合能源系统优化调度全流程解析

做综合能源系统优化调度这活儿,最痛苦的不是建模本身,而是模型写完之后不知道该怎么求解。看论文里轻飘飘一句“采用Yalmip调用CPLEX求解”,自己上手时却往往卡在环境配置、变量声明、约束写法和求解状态判读上,一耗就是两三天。这…

2026/9/30 0:01:22

I3C比I2C快10倍?RK3576实战:速率、DTS配置与混合总线避坑指南

I3C 比 I2C 快 10 倍?这句话在嵌入式群里传了很久,每次都能吵出一堆截图。前段时间我正好在 RK3576 上调板级 I3C 接口,从控制器寄存器一路摸到 Linux DTS 配置,踩了不少坑,也把这笔速度账彻底算明白了。本文就用 RK35…

2026/9/30 0:01:22

字符串转对象:JSON.parse、new Function与URLSearchParams

“字符串转对象”这几个字,我在技术群里见过的问法至少有十几种:有人拿着一串{a:1,b:2}说 JSON.parse 直接报错,有人要从 URL 里抠出参数,还有人只是想把abc变成能挂属性的东西。js 这门语言里,字符串和对象之间的转换…

2026/9/29 3:53:39

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/29 9:46:12

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/29 6:36:14

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑