2012—2022 年图像美学与真实场景质量评估数据集综述:选型、差异与下载入口

做 Venus 时,我在找能支撑“照片评分”的训练与评估数据。很快碰到一个容易被忽略的岔路:资料里常把“图像好看”和“图像质量高”放在一起说,它们却不是同一道题。

前者关心图像的构图,也看主题、风格与审美偏好;后者通常考察清晰度及各类成像缺陷,例如噪声、曝光和压缩伪影,还会受到设备成像的影响。两类任务都可能产出一个分数,但评价目标、标注方式和适用边界并不相同。

所以选数据集不能只看规模。先把问题说清楚:要判断的是审美,还是一张真实拍摄图像的感知质量?

下面整理 2012—2022 年间常用于图像美学评估(Image Aesthetics Assessment,IAA)与真实场景图像质量评估(Image Quality Assessment,IQA)的数据集,并附上可核验的资料与下载入口。

本文不把不同数据集的 MOS 或美学得分直接横向比较。它们的评分范围、采样人群和评价指令并不统一。

先分清两类任务:美学评估与真实场景 IQA

两类任务有交集,但不能互相替代:

graph TD
  A[图像主观评价数据集] --> B[图像美学评估 IAA]
  A --> C[真实场景图像质量评估 IQA]

  B --> D[构图、主题、风格与审美偏好]
  B --> E[AVA / AADB / FLICKR-AES / TAD66K]

  C --> F[噪声、曝光、清晰度与设备成像]
  C --> G[CLIVE / KonIQ-10K / SPAQ]
  • IAA:关注图像是否具有较高审美价值,常用于美学排序、摄影内容推荐、图像筛选和生成图像的美学偏好建模。
  • IQA:关注观察者对图像视觉质量的主观感受,常用于相机成像优化、压缩质量控制、增强算法评价与质量预测。

例如,一张构图普通但曝光准确的照片,可能具有较高感知质量,却未必有高美学评分;一张风格鲜明的艺术照片,也可能因刻意模糊或颗粒感而在 IQA 任务中得分较低。

核心数据集速览

数据集 年份 图片数量 任务定位 评分或标注特点
AVA 2012 25 万+ IAA 1–10 分评分分布、语义标签、摄影风格标签
CLIVE 2015 1,162 真实场景 IQA 多种移动设备拍摄的真实失真图像与主观质量标签
AADB 2016 10,000 IAA 1–5 综合美学评分与 11 项美学属性
FLICKR-AES 2017 40,000 IAA / 个性化美学 总体美学评分及逐标注者评分记录
KonIQ-10K 2019 10,073 真实场景 IQA 面向生态有效性的真实场景质量评分
SPAQ 2020 11,125 智能手机 IQA 0–100 MOS、图像属性、EXIF 与场景标签
TAD66K 2022 66,000 主题导向 IAA 47 个主题、主题专属准则、每图至少 1,200 份有效标注

面向通用美学研究:AVA、AADB 与 FLICKR-AES

AVA:大规模美学评估的基础基准

AVA 发布于 2012 年,包含 25 万张以上图像,是图像美学评估研究中最常见的基准之一。

AVA 的价值在于图多,也在于每张图像都保留了多个评分投票形成的分布,同时附带语义标签与摄影风格标签。需要预测美学分数、做高低美学二分类,或研究评分分布时,它仍是绕不开的起点。

需要注意的是,AVA 的原始数据获取渠道可能随时间变化。第三方聚合站点可以作为线索,但不应被表述为官方发布页;正式研究使用时,应以原始论文说明、数据许可与当前可用下载渠道为准。

AADB:适合研究“为什么好看”

AADB 论文介绍的数据集包含 10,000 张图像,每张图像具有 1–5 的综合美学评分,以及 11 项美学属性标注。

只预测一个总分时,模型很难回答“为什么”。AADB 的属性标注提供了一条拆解路径:可以把模型输出与颜色协调、构图和内容趣味性等属性放在一起看。

代价是它的规模小于 AVA,属性也不可能覆盖复杂的人类审美。把它用于属性辅助建模、解释性研究或小规模验证更合适;若要做大规模预训练,不能只依赖这一份数据。

FLICKR-AES:将个体偏好带入美学评估

FLICKR-AES 官方仓库提供 40,000 张来自 Flickr、采用 Creative Commons 许可的图像,并保存图像总体评分与逐标注者评分记录。

它也服务于通用美学评估。面对同一张图像,不同用户可能给出不同评价;这部分差异正是个性化美学建模要处理的对象。

使用时要先分清标签的用途:

  • 预测加权平均分,是通用美学评估;
  • 利用标注者身份或历史偏好建模,才是个性化美学评估。

面向真实拍摄质量:CLIVE、KonIQ-10K 与 SPAQ

CLIVE:移动设备真实失真的早期代表

LIVE In the Wild Image Quality Challenge Database(CLIVE)发布于 2015 年,包含 1,162 张由多种移动设备拍摄的真实失真图像。

CLIVE 讨论的是自然拍摄场景中的感知质量。它没有沿用“从参考图像人工合成失真”的常见设定,因而更接近真实世界会遇到的问题。

官方页面目前仍可访问,但下载需要填写表单。研究或产品原型使用前,还应确认其许可条件和引用要求。

KonIQ-10K:更大规模的真实场景 IQA

KonIQ-10K包含 10,073 张真实场景质量评分图像,强调数据集的生态有效性(ecological validity)。

KonIQ-10K 覆盖多样的真实拍摄内容与真实失真因素,是一个 in-the-wild IQA 数据集,不宜限定为“户外自然场景数据集”。它适合训练或验证无参考图像质量评估模型。

任务目标是预测用户觉得一张日常照片“看起来质量如何”时,KonIQ-10K 往往比只含人工合成失真的传统数据集更贴近实际输入。

SPAQ:为智能手机摄影而设计

SPAQ 官方仓库发布于 2020 年,包含 11,125 张由 66 款智能手机拍摄的图像。

SPAQ 的 MOS 范围为 0–100,还提供图像属性评分、EXIF 标签与场景类别标签。它可用于预测质量分数,也能用来分析设备元数据、拍摄场景和图像质量之间的关系。

目标涉及手机摄影、移动端相机优化或拍摄质量筛选时,SPAQ 比通用美学数据集更直接;它回答的是感知质量问题,艺术美感不在其评价范围内。

TAD66K:从通用美学走向主题导向评价

TAD66K 官方仓库是 2022 年发布的主题导向图像美学数据集,包含 66,000 张图像、47 个主题。

TAD66K 抓住了一个常被忽略的问题:不同主题可以采用不同的审美准则。风景图像与人像图像,以及建筑和美食图像的关注点并不一样,因此它为不同主题提供对应的评价准则,并为每张图像收集至少 1,200 份有效标注。

对于需要处理多主题内容,或希望减少“用统一美学规则评价所有图像”这一偏差的任务,TAD66K 是更合适的选择。其论文与数据集入口可见于 IJCAI 2022 论文页。

FLIVE 为什么暂不作为核心下载条目

FLIVE 常被后续 IQA 研究描述为大规模真实场景质量数据集,约包含 40,000 张图像和 120,000 个图像 patch。

不过,截至本文整理时,尚未确认稳定的第一方发布页、许可说明与下载入口。因此,它可以在“相关工作”中作为背景提及,但不适合与上述数据集并列为“附下载链接的核心资源”。

当文章的目标是帮助读者快速获取可用数据时,下载可访问性和许可状态与数据规模同样重要。

选型建议:先确定问题,再确定数据

如果还在几个数据集之间犹豫,可以按任务先做一次筛选:

  1. 研究审美排序、构图或风格偏好:优先考虑 AVA、AADB、FLICKR-AES。
  2. 研究用户个体审美差异:优先考虑 FLICKR-AES 的逐标注者评分信息。
  3. 研究真实照片的感知质量:优先考虑 CLIVE 与 KonIQ-10K。
  4. 面向手机拍摄、相机参数或 EXIF 信息建模:优先考虑 SPAQ。
  5. 需要按内容主题适配审美标准:优先考虑 TAD66K。
  6. 需要混合多个数据集训练:先统一标签语义、评分范围和训练目标;不要只做简单的数值缩放。

最后一点尤其重要。把 AVA 的美学评分、SPAQ 的质量 MOS 和 CLIVE 的主观质量标签放在同一个回归目标中,并不天然合理。数值都可以归一化到 0–1,但评价含义并不会因此自动对齐。

结语

从 AVA 到 TAD66K,变化包括样本量增加。评价目标也在逐步拆开:通用美学与个体偏好,真实拍摄质量、智能手机摄影,以及按主题变化的审美规则。

选数据集前,我会先确认这三个问题:

  • 数据集究竟评估美学,还是感知质量?
  • 标注者被要求评价的对象是什么?
  • 这些标签是否与自己的产品或研究问题一致?

问题和标签对齐之后,模型分数才值得被解释。