2012—2022 年图像美学与真实场景质量评估数据集综述:选型、差异与下载入口
做 Venus 时,我在找能支撑“照片评分”的训练与评估数据。很快碰到一个容易被忽略的岔路:资料里常把“图像好看”和“图像质量高”放在一起说,它们却不是同一道题。
前者关心图像的构图,也看主题、风格与审美偏好;后者通常考察清晰度及各类成像缺陷,例如噪声、曝光和压缩伪影,还会受到设备成像的影响。两类任务都可能产出一个分数,但评价目标、标注方式和适用边界并不相同。
所以选数据集不能只看规模。先把问题说清楚:要判断的是审美,还是一张真实拍摄图像的感知质量?
下面整理 2012—2022 年间常用于图像美学评估(Image Aesthetics Assessment,IAA)与真实场景图像质量评估(Image Quality Assessment,IQA)的数据集,并附上可核验的资料与下载入口。
本文不把不同数据集的 MOS 或美学得分直接横向比较。它们的评分范围、采样人群和评价指令并不统一。
先分清两类任务:美学评估与真实场景 IQA
两类任务有交集,但不能互相替代:
graph TD
A[图像主观评价数据集] --> B[图像美学评估 IAA]
A --> C[真实场景图像质量评估 IQA]
B --> D[构图、主题、风格与审美偏好]
B --> E[AVA / AADB / FLICKR-AES / TAD66K]
C --> F[噪声、曝光、清晰度与设备成像]
C --> G[CLIVE / KonIQ-10K / SPAQ]
- IAA:关注图像是否具有较高审美价值,常用于美学排序、摄影内容推荐、图像筛选和生成图像的美学偏好建模。
- IQA:关注观察者对图像视觉质量的主观感受,常用于相机成像优化、压缩质量控制、增强算法评价与质量预测。
例如,一张构图普通但曝光准确的照片,可能具有较高感知质量,却未必有高美学评分;一张风格鲜明的艺术照片,也可能因刻意模糊或颗粒感而在 IQA 任务中得分较低。
核心数据集速览
| 数据集 | 年份 | 图片数量 | 任务定位 | 评分或标注特点 |
|---|---|---|---|---|
| AVA | 2012 | 25 万+ | IAA | 1–10 分评分分布、语义标签、摄影风格标签 |
| CLIVE | 2015 | 1,162 | 真实场景 IQA | 多种移动设备拍摄的真实失真图像与主观质量标签 |
| AADB | 2016 | 10,000 | IAA | 1–5 综合美学评分与 11 项美学属性 |
| FLICKR-AES | 2017 | 40,000 | IAA / 个性化美学 | 总体美学评分及逐标注者评分记录 |
| KonIQ-10K | 2019 | 10,073 | 真实场景 IQA | 面向生态有效性的真实场景质量评分 |
| SPAQ | 2020 | 11,125 | 智能手机 IQA | 0–100 MOS、图像属性、EXIF 与场景标签 |
| TAD66K | 2022 | 66,000 | 主题导向 IAA | 47 个主题、主题专属准则、每图至少 1,200 份有效标注 |
面向通用美学研究:AVA、AADB 与 FLICKR-AES
AVA:大规模美学评估的基础基准
AVA 发布于 2012 年,包含 25 万张以上图像,是图像美学评估研究中最常见的基准之一。
AVA 的价值在于图多,也在于每张图像都保留了多个评分投票形成的分布,同时附带语义标签与摄影风格标签。需要预测美学分数、做高低美学二分类,或研究评分分布时,它仍是绕不开的起点。
需要注意的是,AVA 的原始数据获取渠道可能随时间变化。第三方聚合站点可以作为线索,但不应被表述为官方发布页;正式研究使用时,应以原始论文说明、数据许可与当前可用下载渠道为准。
AADB:适合研究“为什么好看”
AADB 论文介绍的数据集包含 10,000 张图像,每张图像具有 1–5 的综合美学评分,以及 11 项美学属性标注。
只预测一个总分时,模型很难回答“为什么”。AADB 的属性标注提供了一条拆解路径:可以把模型输出与颜色协调、构图和内容趣味性等属性放在一起看。
代价是它的规模小于 AVA,属性也不可能覆盖复杂的人类审美。把它用于属性辅助建模、解释性研究或小规模验证更合适;若要做大规模预训练,不能只依赖这一份数据。
FLICKR-AES:将个体偏好带入美学评估
FLICKR-AES 官方仓库提供 40,000 张来自 Flickr、采用 Creative Commons 许可的图像,并保存图像总体评分与逐标注者评分记录。
它也服务于通用美学评估。面对同一张图像,不同用户可能给出不同评价;这部分差异正是个性化美学建模要处理的对象。
使用时要先分清标签的用途:
- 预测加权平均分,是通用美学评估;
- 利用标注者身份或历史偏好建模,才是个性化美学评估。
面向真实拍摄质量:CLIVE、KonIQ-10K 与 SPAQ
CLIVE:移动设备真实失真的早期代表
LIVE In the Wild Image Quality Challenge Database(CLIVE)发布于 2015 年,包含 1,162 张由多种移动设备拍摄的真实失真图像。
CLIVE 讨论的是自然拍摄场景中的感知质量。它没有沿用“从参考图像人工合成失真”的常见设定,因而更接近真实世界会遇到的问题。
官方页面目前仍可访问,但下载需要填写表单。研究或产品原型使用前,还应确认其许可条件和引用要求。
KonIQ-10K:更大规模的真实场景 IQA
KonIQ-10K包含 10,073 张真实场景质量评分图像,强调数据集的生态有效性(ecological validity)。
KonIQ-10K 覆盖多样的真实拍摄内容与真实失真因素,是一个 in-the-wild IQA 数据集,不宜限定为“户外自然场景数据集”。它适合训练或验证无参考图像质量评估模型。
任务目标是预测用户觉得一张日常照片“看起来质量如何”时,KonIQ-10K 往往比只含人工合成失真的传统数据集更贴近实际输入。
SPAQ:为智能手机摄影而设计
SPAQ 官方仓库发布于 2020 年,包含 11,125 张由 66 款智能手机拍摄的图像。
SPAQ 的 MOS 范围为 0–100,还提供图像属性评分、EXIF 标签与场景类别标签。它可用于预测质量分数,也能用来分析设备元数据、拍摄场景和图像质量之间的关系。
目标涉及手机摄影、移动端相机优化或拍摄质量筛选时,SPAQ 比通用美学数据集更直接;它回答的是感知质量问题,艺术美感不在其评价范围内。
TAD66K:从通用美学走向主题导向评价
TAD66K 官方仓库是 2022 年发布的主题导向图像美学数据集,包含 66,000 张图像、47 个主题。
TAD66K 抓住了一个常被忽略的问题:不同主题可以采用不同的审美准则。风景图像与人像图像,以及建筑和美食图像的关注点并不一样,因此它为不同主题提供对应的评价准则,并为每张图像收集至少 1,200 份有效标注。
对于需要处理多主题内容,或希望减少“用统一美学规则评价所有图像”这一偏差的任务,TAD66K 是更合适的选择。其论文与数据集入口可见于 IJCAI 2022 论文页。
FLIVE 为什么暂不作为核心下载条目
FLIVE 常被后续 IQA 研究描述为大规模真实场景质量数据集,约包含 40,000 张图像和 120,000 个图像 patch。
不过,截至本文整理时,尚未确认稳定的第一方发布页、许可说明与下载入口。因此,它可以在“相关工作”中作为背景提及,但不适合与上述数据集并列为“附下载链接的核心资源”。
当文章的目标是帮助读者快速获取可用数据时,下载可访问性和许可状态与数据规模同样重要。
选型建议:先确定问题,再确定数据
如果还在几个数据集之间犹豫,可以按任务先做一次筛选:
- 研究审美排序、构图或风格偏好:优先考虑 AVA、AADB、FLICKR-AES。
- 研究用户个体审美差异:优先考虑 FLICKR-AES 的逐标注者评分信息。
- 研究真实照片的感知质量:优先考虑 CLIVE 与 KonIQ-10K。
- 面向手机拍摄、相机参数或 EXIF 信息建模:优先考虑 SPAQ。
- 需要按内容主题适配审美标准:优先考虑 TAD66K。
- 需要混合多个数据集训练:先统一标签语义、评分范围和训练目标;不要只做简单的数值缩放。
最后一点尤其重要。把 AVA 的美学评分、SPAQ 的质量 MOS 和 CLIVE 的主观质量标签放在同一个回归目标中,并不天然合理。数值都可以归一化到 0–1,但评价含义并不会因此自动对齐。
结语
从 AVA 到 TAD66K,变化包括样本量增加。评价目标也在逐步拆开:通用美学与个体偏好,真实拍摄质量、智能手机摄影,以及按主题变化的审美规则。
选数据集前,我会先确认这三个问题:
- 数据集究竟评估美学,还是感知质量?
- 标注者被要求评价的对象是什么?
- 这些标签是否与自己的产品或研究问题一致?
问题和标签对齐之后,模型分数才值得被解释。