摘要
本文系统论证:FAIR是必要基础但非充分条件,应构建"FAIR基础层 + AI-ready能力层 + Responsible Reuse治理层"的三层框架。
全文结构(13章)
| 章节 | 核心内容 |
|---|---|
| 1–2 | 问题提出;FAIR的起源、成就与五个结构性边界 |
| 3 | AI-ready的四个维度:质量适配、语义上下文、来源版本、可评测性 |
| 4 | Responsible Reuse的五要素:权利许可、隐私同意、公平影响、知识主权、持续治理 |
| 5 | 三层框架的理论辩护:三种不可通约的善 |
| 6 | 治理闸门(含医院病历分级放行完整案例) |
| 7 | 与CARE、OCAR、FAIR²的关系辨析 |
| 8 | 四个反方论证的逐一回应 |
| 9 | 医疗、公共治理、文化遗产、开放科学四领域应用 |
| 10 | 数据生命周期协议(含撤回同意传导机制) |
| 11 | 指标体系 +DARM成熟度模型(L0–L4五级)+ 古德哈特失效防范 + 资金/出版/评价联动 |
| 12 | 结论 +六个开放研究问题(机器遗忘、指标自动化、量化整合、跨法域互认、具身数据、数据劳动正义)+四阶段实施路线图+ 结语 |
| 13 | 参考文献 |
关键理论贡献
1. 形式化就绪判定(合取式结构)
Ready(d,u)=⋀i=13[Si(d)≥τi(u)] \text{Ready}(d, u) = \bigwedge_{i=1}^{3} \left[ S_i(d) \geq \tau_i(u) \right]Ready(d,u)=i=1⋀3[Si(d)≥τi(u)]
编码核心治理直觉:任何一层的严重不足都不能被其他层补偿——高AI-ready分数不能洗白治理缺陷。
2. 三层分工命题
FAIR回答"数据如何被找到和使用";AI-ready回答"数据如何被正确地用于学习";Responsible Reuse回答"数据是否应当被如此使用"。
3. 存量数据修复路径
百年科学数据遗产的AI化:先FAIR化(标识、许可追认)→ 再AI-ready化(偏差校正、谱系重建)→ 最后治理化(用途审查、主权安排)。
结语核心句
让数据可复用只是起点;让每一次复用都配得上数据所承载的知识、劳动与信任,才是AI时代数据治理的真正目标。