CIQA 数据集技术指南:面向 JPEG 压缩的成对图像质量评估标注数据
【免费下载链接】google-researchGoogle Research项目地址: https://gitcode.com/gh_mirrors/go/google-research
CIQA(Compression Image Quality Assessment)是 Google Research 发布的一套面向 JPEG 压缩场景的图像质量评估(IQA)标注数据集,它基于著名的 Aesthetic Visual Analysis(AVA)美学数据集采样,通过强制选择(forced choice)成对比较获得人类偏好标签。本文将完整解析该数据集的采样策略、压缩方法、标注协议、CSV 字段语义与云端访问方式,帮助你理解并直接使用这套数据训练或评测面向压缩失真的人眼感知质量模型。
数据集概览:为 AVA 美学图像补齐压缩质量标签
CIQA 的本质是一份「附加标注」集合:它为 AVA 数据集中的图片提供了压缩失真场景下的人类主观偏好标签,是论文Deep Perceptual Image Quality Assessment for Compression(arXiv:2103.01114)的研究成果。
其构建思路可以概括为:
- 从 AVA 数据集中采样近无损(near lossless)的 JPEG 参考图像;
- 使用 TensorFlow 的
tf.image.adjust_jpeg_quality方法,将参考图压缩为不同 JPEG 质量因子(quality factor)的版本; - 组织人类标注者在「强制选择成对比较」实验中对压缩后的图片对给出偏好判断。
AVA 数据集本身已被 NIMA 等模型证明非常适合用于美学图像质量评估的深度学习研究,因此基于 AVA 构建的 CIQA 天然与既有的美学 IQA 研究体系衔接。值得注意的是,整个 google-research 仓库中的所有数据集均以 CC BY 4.0 International 协议发布(见 仓库根 README.md),使用本数据集时需遵循该协议要求。
构建流程一:AVA 参考图像采样
AVA 数据集包含约 255,000 张由业余摄影师按美学质量评分的图像。由于这些图像本身以 JPEG 压缩格式存储,直接将其作为「参考图」会在评估压缩失真时引入不可控的二次压缩噪声。因此 CIQA 的构建者只采样JPEG 质量因子 Q ≥ 99(即近无损)的图像子集,并使用 ImageMagick 图像处理工具完成筛选与采样。
这样做保证了后续所有压缩操作都以接近无损的源图作为起点,使最终标签能够准确反映「从该质量因子的压缩中引入的失真」,而非源图自身历史压缩痕迹的叠加。
构建流程二:成对压缩与语义分布保持
被采样的参考图会被压缩为两个随机 JPEG 质量因子的版本(质量因子取值区间为 10~100)。整个采样与压缩过程还刻意保持了以下两个分布特性:
| 维度 | 保持策略 | 说明 |
|---|---|---|
| 语义类别分布 | 各类近似等频 | animal、architecture、cityscape、floral、food/drink、landscape、portrait、still life 八类各约占 6.25%,合计约 50% |
| 通用类别 | 占比 50% | 所有参考图与「generic」类别各占 50%,保证采样图像多样性 |
| 分辨率分布 | 保持宽分布 | 图像分辨率在 200×200 到 800×800 之间变化,且不保证等宽高 |
这种设计的目的在于:既保证采样图像覆盖多样的语义内容,避免模型只学会评估某一类图像,又能更准确地代表普遍的人眼感知图像质量——而非偏向特定内容或特定分辨率的偏差样本。
人工标注协议:32 人强制选择成对比较
CIQA 的标签来自严谨的人工实验:
- 共生成7,808 对成对比较,每一对由32 名独立参与者评分;
- 每一对图片由参考图压缩到两个 10~100 之间的随机 JPEG 质量因子构成;
- 由6,667 张参考图像共生成13,868 张压缩图像;
- 其中6,372 张参考图像用于训练集,256 张参考图像用于测试集。
训练集与测试集在比较结构上存在差异,这是理解数据集的关键:
- 训练集:每张参考图被压缩为两个不同 JPEG 质量因子,产生 1 对比较,共6,372 个训练样例;
- 测试集:每张参考图被压缩为 4 个不同 JPEG 质量因子,两两组合产生 6 对比较,共256 × 6 = 1,536 个测试样例。
注:原文档中「256 reference images were used in the training set」一句中的 "training set" 按上下文(下一句明确描述测试集为 256 张参考图、每张 6 对比较)应为笔误,实际指测试集,否则 1,536 个测试样例的数目无法成立。
结果数据格式:CSV 字段语义
最终数据集为训练集(6,372 对)与测试集(1,536 对)两张 CSV 表,列名与语义如下:
| 字段 | 含义 |
|---|---|
ref_id | AVA 数据集中的参考图像 ID |
jpg1 | 第一张图的文件名,格式为{reference_image_id}/{jpg_Quality_Factor_1} |
jpg2 | 第二张图的文件名,格式为{reference_image_id}/{jpg_Quality_Factor_2} |
q1 | 第一张图相对参考图使用的 JPEG 压缩质量因子 |
q2 | 第二张图相对参考图使用的 JPEG 压缩质量因子 |
jpg2_pref | 0.0~1.0 之间的标签,表示偏好第二张图的标注者比例;偏好第一张图的比例可通过1 - jpg2_pref推断 |
原文档在字段列表中把
jpg1的说明重复书写了两次,第二处实际对应的应为jpg2(第二张图的文件名),此处按上下文语义修正呈现。
这一标签设计非常巧妙:jpg2_pref并非离散的二分类标签,而是连续的人众比例,天然携带了「分歧强度」信息(例如 0.5 表示标注者各执一词,而 0.95 表示压倒性偏好),可以同时支持分类、回归与排序(ranking)三种训练范式。
数据获取与加载方式
训练集与测试集存放在 Google Research GCP 公共存储桶gs://gresearch下的CIQA目录中,支持三种访问方式:
- gcloud storage CLI:适合命令行下载到本地;
- tf.io.gfile API:适合在 TensorFlow 训练管线中直接流式读取;
- HTTP API:适合任意语言或脚本直接下载。
对应两个数据文件的直接地址为:
- 训练集:
http://storage.googleapis.com/gresearch/ciqa/train.csv - 测试集:
http://storage.googleapis.com/gresearch/ciqa/test.csv
以下给出使用tf.io.gfile与 pandas 加载训练数据的参考写法:
import tensorflow as tf import pandas as pd import io train_url = "gs://gresearch/ciqa/train.csv" # 亦可通过 HTTP 直取:http://storage.googleapis.com/gresearch/ciqa/train.csv with tf.io.gfile.GFile(train_url, "r") as f: train_df = pd.read_csv(io.StringIO(f.read())) print(train_df.head()) print(train_df[["q1", "q2", "jpg2_pref"]].describe())命令行方式则可以使用 gcloud storage 直接同步:
gcloud storage cp gs://gresearch/ciqa/train.csv . gcloud storage cp gs://gresearch/ciqa/test.csv .典型应用方向与使用建议
结合数据字段语义与构建方法(这部分为基于数据结构与论文主题的推断),CIQA 可用于以下场景:
- 压缩感知质量建模:以
(q1, q2)与压缩图像对为输入,回归或分类预测jpg2_pref,训练可预测「人眼更偏好哪个压缩档位」的模型; - IQA 模型的评测基准:测试集每张参考图覆盖 4 个质量因子、6 对比较的稠密结构,适合评估模型对质量排序的判别能力;
- 结合美学 IQA 研究:由于数据源于 AVA,可与 NIMA 等美学质量模型衔接,研究压缩失真与美学评分之间的交互。
使用时的几个注意点:
jpg2_pref是「偏好第二张图」的比例,建模前需明确方向性,避免标签取反;- 训练样例与测试样例的比较结构不同(1 对/图 vs 6 对/图),跨集合评测时需注意分布差异;
- 按文档给出的数据,训练集 6,372 例与测试集 1,536 例合计 7,908,与声明总数 7,808 存在 100 例出入,若对总量敏感建议在下载后自行核对 CSV 行数。
小结
CIQA 以近乎严谨的实验设计补齐了 AVA 美学数据集在压缩失真维度上的主观质量标签:近无损源图采样保证了失真的纯净性,语义与分辨率分布的刻意保持提升了结论的泛化性,32 人强制选择协议与连续比例标签则提供了高信息量的监督信号。配合其简单的 CSV 格式与三种云端访问方式,它是一条上手成本极低、可复现性强的压缩 IQA 研究数据资产。详细原始说明可参阅 CIQA/README.md。
【免费下载链接】google-researchGoogle Research项目地址: https://gitcode.com/gh_mirrors/go/google-research
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考