news 2026/9/19 17:14:11

CIQA 数据集技术指南:面向 JPEG 压缩的成对图像质量评估标注数据

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
CIQA 数据集技术指南:面向 JPEG 压缩的成对图像质量评估标注数据

CIQA 数据集技术指南:面向 JPEG 压缩的成对图像质量评估标注数据

【免费下载链接】google-researchGoogle Research项目地址: https://gitcode.com/gh_mirrors/go/google-research

CIQA(Compression Image Quality Assessment)是 Google Research 发布的一套面向 JPEG 压缩场景的图像质量评估(IQA)标注数据集,它基于著名的 Aesthetic Visual Analysis(AVA)美学数据集采样,通过强制选择(forced choice)成对比较获得人类偏好标签。本文将完整解析该数据集的采样策略、压缩方法、标注协议、CSV 字段语义与云端访问方式,帮助你理解并直接使用这套数据训练或评测面向压缩失真的人眼感知质量模型。

数据集概览:为 AVA 美学图像补齐压缩质量标签

CIQA 的本质是一份「附加标注」集合:它为 AVA 数据集中的图片提供了压缩失真场景下的人类主观偏好标签,是论文Deep Perceptual Image Quality Assessment for Compression(arXiv:2103.01114)的研究成果。

其构建思路可以概括为:

  1. 从 AVA 数据集中采样近无损(near lossless)的 JPEG 参考图像;
  2. 使用 TensorFlow 的tf.image.adjust_jpeg_quality方法,将参考图压缩为不同 JPEG 质量因子(quality factor)的版本;
  3. 组织人类标注者在「强制选择成对比较」实验中对压缩后的图片对给出偏好判断。

AVA 数据集本身已被 NIMA 等模型证明非常适合用于美学图像质量评估的深度学习研究,因此基于 AVA 构建的 CIQA 天然与既有的美学 IQA 研究体系衔接。值得注意的是,整个 google-research 仓库中的所有数据集均以 CC BY 4.0 International 协议发布(见 仓库根 README.md),使用本数据集时需遵循该协议要求。

构建流程一:AVA 参考图像采样

AVA 数据集包含约 255,000 张由业余摄影师按美学质量评分的图像。由于这些图像本身以 JPEG 压缩格式存储,直接将其作为「参考图」会在评估压缩失真时引入不可控的二次压缩噪声。因此 CIQA 的构建者只采样JPEG 质量因子 Q ≥ 99(即近无损)的图像子集,并使用 ImageMagick 图像处理工具完成筛选与采样。

这样做保证了后续所有压缩操作都以接近无损的源图作为起点,使最终标签能够准确反映「从该质量因子的压缩中引入的失真」,而非源图自身历史压缩痕迹的叠加。

构建流程二:成对压缩与语义分布保持

被采样的参考图会被压缩为两个随机 JPEG 质量因子的版本(质量因子取值区间为 10~100)。整个采样与压缩过程还刻意保持了以下两个分布特性:

维度保持策略说明
语义类别分布各类近似等频animal、architecture、cityscape、floral、food/drink、landscape、portrait、still life 八类各约占 6.25%,合计约 50%
通用类别占比 50%所有参考图与「generic」类别各占 50%,保证采样图像多样性
分辨率分布保持宽分布图像分辨率在 200×200 到 800×800 之间变化,且不保证等宽高

这种设计的目的在于:既保证采样图像覆盖多样的语义内容,避免模型只学会评估某一类图像,又能更准确地代表普遍的人眼感知图像质量——而非偏向特定内容或特定分辨率的偏差样本。

人工标注协议:32 人强制选择成对比较

CIQA 的标签来自严谨的人工实验:

  • 共生成7,808 对成对比较,每一对由32 名独立参与者评分;
  • 每一对图片由参考图压缩到两个 10~100 之间的随机 JPEG 质量因子构成;
  • 6,667 张参考图像共生成13,868 张压缩图像
  • 其中6,372 张参考图像用于训练集256 张参考图像用于测试集

训练集与测试集在比较结构上存在差异,这是理解数据集的关键:

  • 训练集:每张参考图被压缩为两个不同 JPEG 质量因子,产生 1 对比较,共6,372 个训练样例
  • 测试集:每张参考图被压缩为 4 个不同 JPEG 质量因子,两两组合产生 6 对比较,共256 × 6 = 1,536 个测试样例

注:原文档中「256 reference images were used in the training set」一句中的 "training set" 按上下文(下一句明确描述测试集为 256 张参考图、每张 6 对比较)应为笔误,实际指测试集,否则 1,536 个测试样例的数目无法成立。

结果数据格式:CSV 字段语义

最终数据集为训练集(6,372 对)与测试集(1,536 对)两张 CSV 表,列名与语义如下:

字段含义
ref_idAVA 数据集中的参考图像 ID
jpg1第一张图的文件名,格式为{reference_image_id}/{jpg_Quality_Factor_1}
jpg2第二张图的文件名,格式为{reference_image_id}/{jpg_Quality_Factor_2}
q1第一张图相对参考图使用的 JPEG 压缩质量因子
q2第二张图相对参考图使用的 JPEG 压缩质量因子
jpg2_pref0.0~1.0 之间的标签,表示偏好第二张图的标注者比例;偏好第一张图的比例可通过1 - jpg2_pref推断

原文档在字段列表中把jpg1的说明重复书写了两次,第二处实际对应的应为jpg2(第二张图的文件名),此处按上下文语义修正呈现。

这一标签设计非常巧妙:jpg2_pref并非离散的二分类标签,而是连续的人众比例,天然携带了「分歧强度」信息(例如 0.5 表示标注者各执一词,而 0.95 表示压倒性偏好),可以同时支持分类、回归与排序(ranking)三种训练范式。

数据获取与加载方式

训练集与测试集存放在 Google Research GCP 公共存储桶gs://gresearch下的CIQA目录中,支持三种访问方式:

  • gcloud storage CLI:适合命令行下载到本地;
  • tf.io.gfile API:适合在 TensorFlow 训练管线中直接流式读取;
  • HTTP API:适合任意语言或脚本直接下载。

对应两个数据文件的直接地址为:

  • 训练集:http://storage.googleapis.com/gresearch/ciqa/train.csv
  • 测试集:http://storage.googleapis.com/gresearch/ciqa/test.csv

以下给出使用tf.io.gfile与 pandas 加载训练数据的参考写法:

import tensorflow as tf import pandas as pd import io train_url = "gs://gresearch/ciqa/train.csv" # 亦可通过 HTTP 直取:http://storage.googleapis.com/gresearch/ciqa/train.csv with tf.io.gfile.GFile(train_url, "r") as f: train_df = pd.read_csv(io.StringIO(f.read())) print(train_df.head()) print(train_df[["q1", "q2", "jpg2_pref"]].describe())

命令行方式则可以使用 gcloud storage 直接同步:

gcloud storage cp gs://gresearch/ciqa/train.csv . gcloud storage cp gs://gresearch/ciqa/test.csv .

典型应用方向与使用建议

结合数据字段语义与构建方法(这部分为基于数据结构与论文主题的推断),CIQA 可用于以下场景:

  1. 压缩感知质量建模:以(q1, q2)与压缩图像对为输入,回归或分类预测jpg2_pref,训练可预测「人眼更偏好哪个压缩档位」的模型;
  2. IQA 模型的评测基准:测试集每张参考图覆盖 4 个质量因子、6 对比较的稠密结构,适合评估模型对质量排序的判别能力;
  3. 结合美学 IQA 研究:由于数据源于 AVA,可与 NIMA 等美学质量模型衔接,研究压缩失真与美学评分之间的交互。

使用时的几个注意点:

  • jpg2_pref是「偏好第二张图」的比例,建模前需明确方向性,避免标签取反;
  • 训练样例与测试样例的比较结构不同(1 对/图 vs 6 对/图),跨集合评测时需注意分布差异;
  • 按文档给出的数据,训练集 6,372 例与测试集 1,536 例合计 7,908,与声明总数 7,808 存在 100 例出入,若对总量敏感建议在下载后自行核对 CSV 行数。

小结

CIQA 以近乎严谨的实验设计补齐了 AVA 美学数据集在压缩失真维度上的主观质量标签:近无损源图采样保证了失真的纯净性,语义与分辨率分布的刻意保持提升了结论的泛化性,32 人强制选择协议与连续比例标签则提供了高信息量的监督信号。配合其简单的 CSV 格式与三种云端访问方式,它是一条上手成本极低、可复现性强的压缩 IQA 研究数据资产。详细原始说明可参阅 CIQA/README.md。

【免费下载链接】google-researchGoogle Research项目地址: https://gitcode.com/gh_mirrors/go/google-research

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/19 17:13:02

Applied Intelligence投稿实战:算法创新与工业验证双驱动指南

1. 为什么“Applied Intelligence”不是随便投投就能中的水刊——从6投5中1拒的真实数据说起Applied Intelligence 这本期刊,名字听起来平平无奇,甚至有点像某门本科通识课的副标题。但只要你真把它当普通EI会议或水刊去投,大概率会在第1轮就…

作者头像 李华
网站建设 2026/9/19 17:12:12

Vue 官方测试与调试工具链全景:Devtools 到 Vitest 与 Playwright

Vue 官方测试与调试工具链全景,这个词听起来像是一张打包好的地图,但真正跑通它,我从 Vue 2 时代一路踩坑到 Vue 3,花了不止一个下午。很多朋友在社区里问“Vue 调试用啥”“测试到底学 Vitest 还是 Jest”“Devtools 装了怎么不显…

作者头像 李华
网站建设 2026/9/19 17:10:36

Embedding模型技术解析与应用实践指南

1. Embedding模型基础认知第一次接触Embedding这个概念是在处理自然语言处理任务时。当时我正试图用传统方法解决文本分类问题,发现词袋模型和TF-IDF在面对同义词和语义相似度判断时表现糟糕。直到尝试了Word2Vec,才真正理解向量化表示的革命性意义——它…

作者头像 李华
网站建设 2026/9/19 17:10:32

具身智能开发平台:嵌入式+AI大模型+机器人技术解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/19 17:10:23

大数据运维规划实战:故障分级与采集作业保障

简介:这是一份面向企业IT运维与大数据平台规划人员的解决方案文档,聚焦OLTP与OLAP系统融合趋势下的大数据运维体系设计。内容从组织架构切入,系统对比了开发和运维纵向一体化、完全分离以及均衡三种交维模式,剖析各自适用场景与利…

作者头像 李华