ML-For-Beginners 中的机器学习公平性与负责任 AI:偏差识别、影响评估与 RAI 调试实践
【免费下载链接】ML-For-Beginners12 weeks, 26 lessons, 52 quizzes, classic Machine Learning for all项目地址: https://gitcode.com/GitHub_Trending/ml/ML-For-Beginners
本篇技术指南基于 ML-For-Beginners 课程中的《Fairness and machine learning》(1-Introduction/3-fairness/README.md)一课展开,系统讲解机器学习系统中的公平性(Fairness)与负责任 AI(Responsible AI)核心原则。读完本文,你将能够识别训练数据中潜在的偏差来源、区分五类公平性相关伤害(fairness-related harms)、在模型训练前完成影响评估(impact assessment),并理解如何通过 RAI 调试工具对模型进行错误分析、模型概览、数据分析与可解释性审查。
该图由课程原作者 Tomomi Imura 绘制,是对本课核心内容的可视化总结,源文件见 sketchnotes/ml-fairness.png。
一、课程定位:为什么公平性是 ML 入门必修课
ML-For-Beginners 是一套「12 周、26 课、52 个测验」的经典机器学习课程。在 Introduction 章节总览 中,本课被列为第 3 课,前接《Introduction to machine learning》与《The History of machine learning and AI》,后接《Techniques of machine learning》。也就是说,课程在讲任何具体算法(回归、分类、聚类等)之前,先要求学习者理解:AI 系统正深度参与日常决策——医疗诊断、贷款审批、欺诈检测等,而和任何软件一样,AI 系统同样会失误、会产出不可接受的后果,因此「理解并解释 AI 模型的行为」成为工程师的基本功。
从课程结构看,公平性并非孤立的理论课。仓库中 9-Real-World/1-Applications/README.md 在「真实世界 ML 应用」一节明确呼应了本课:Grammarly 曾发布技术案例研究,讲述其如何在产品级的自然语言处理模型中处理性别偏差问题,这正是本入门课所讲授内容的工业落地。此外,本课还提供中文译文 translations/zh-CN/1-Introduction/3-fairness/README.md,可对照阅读。
核心问题是:当你用于构建模型的数据缺失某些人群(如特定种族、性别、宗教),或过度代表某些人群时会发生什么?当模型输出被解读为偏好某个人群时,应用会面临什么后果?当模型产出有害结果时,谁该为 AI 系统的行为负责?本课正是围绕这些问题建立的。
二、学习目标
原课明确列出六项学习目标,构成本篇的知识框架:
- 提高对机器学习中公平性及其相关伤害重要性的认识;
- 熟悉通过探索离群值与异常场景来保障可靠性与安全性的实践;
- 理解通过设计包容性系统来赋能每个人的必要性;
- 认识保护数据与个人隐私和安全的关键性;
- 理解「玻璃盒(glass box)」方式解释 AI 模型行为的重要性;
- 牢记问责(accountability)对建立 AI 系统信任的关键作用。
三、公平性(Fairness)与五类公平性相关伤害
3.1 公平性的基本定义
AI 系统应当公平地对待每个人,避免以不同方式影响相似的人群。例如,当 AI 系统提供医疗建议、贷款申请或就业决策支持时,它应对具有相似症状、财务状况或专业资质的人做出相同的推荐。每个人身上都携带着影响决策与行为的固有偏见,这些偏见会体现在用于训练 AI 系统的数据中,而且这种操纵有时是无意识发生的——你往往很难自觉意识到自己正在给数据引入偏差。
图源 1-Introduction/3-fairness/images/fairness.png,展示「负责任 AI 六大原则」中的公平性原则。
3.2 五类公平性相关伤害
**「不公平性(Unfairness)」**指对一群人(如按种族、性别、年龄或残障状况界定的人群)造成负面影响,即所谓的「伤害(harms)」。原课将其归纳为五类,这也是后文模型调试章节的评估基准:
| 伤害类型 | 含义 | 典型示例 |
|---|---|---|
| 资源分配不公(Allocation) | 性别或种族等某一群体被偏好于另一群体 | 招聘 AI 优先推荐某一性别候选人 |
| 服务质量(Quality of service) | 针对单一场景训练,但现实复杂得多,导致服务表现差 | 感应式洗手液无法感应深色皮肤人群 |
| 贬低(Denigration) | 不公平地批评或给某人/某物贴标签 | 图像标签技术曾将深色皮肤的人错误标记为「大猩猩」 |
| 过度或不足代表(Over- or under-representation) | 某职业中看不到某群体,而持续强化这一现象的服务都在助长伤害 | 高管岗位数据集几乎全是男性 |
| 刻板印象(Stereotyping) | 将某群体与预设属性关联 | 英-土翻译系统因带有性别刻板印象的词汇出现不准确 |
其中「刻板印象」一课给出了非常具体的实证截图:把英文 "He's a nurse. She's a doctor." 翻译成土耳其语时,系统输出 "O bir hemşire. O bir doktor."(土耳其语不分性别,性别信息丢失);再翻译回英文时,系统却输出 "She's a nurse. He's a doctor."——性别与职业的对应关系被系统按刻板印象「重新分配」了。这两张截图保存在 1-Introduction/3-fairness/images/gender-bias-translate-en-tr.png 与 1-Introduction/3-fairness/images/gender-bias-translate-tr-en.png,是检验翻译模型是否存在性别偏差的最小可复现案例。
图源 1-Introduction/3-fairness/images/gender-bias-translate-en-tr.png。
图源 1-Introduction/3-fairness/images/gender-bias-translate-tr-en.png。
在设计 AI 系统时,必须确保 AI 是公平的,没有被编程为做出有偏见或歧视性的决策——这些决策连人类本人也被禁止做出。原课特别强调:在 AI 与机器学习中保证公平性,仍然是一个复杂的「社会-技术(sociotechnical)」挑战。
四、负责任 AI 的其余维度
公平性之外,原课还围绕负责任 AI 展开五个配套维度,它们共同构成训练前的检查清单。
4.1 可靠性与安全(Reliability and safety)
要赢得信任,AI 系统需要在正常与异常条件下都可靠、安全、一致。关键是要了解系统在多种情境下的行为,尤其是离群(outlier)场景。构建 AI 解决方案时,需要对系统可能遇到的广泛情境给予充分关注:例如自动驾驶汽车必须以人的安全为最高优先级,驱动它的 AI 需要考虑车辆可能遇到的一切场景——夜间、雷暴、暴风雪、横穿马路的儿童、宠物、道路施工等。一个 AI 系统能在多宽范围、多恶劣的条件下可靠安全地运行,反映出数据科学家或 AI 开发者在设计与测试阶段考虑了多少种预期。
4.2 包容性(Inclusiveness)
AI 系统应当被设计为能够触达并赋能每一个人。在设计过程中,数据科学家与开发者需要识别并处理系统中可能无意中排斥某些人的潜在障碍。据原课引用,全球约有 10 亿残障人士;随着 AI 发展,他们可以在日常生活中更便捷地获取信息与机会。消除障碍不仅帮助弱势群体,也为所有人创造了开发体验更好产品的创新机会。
4.3 安全与隐私(Security and privacy)
AI 系统应当安全并尊重个人隐私。把隐私、信息或生命置于风险中的系统会失去人们的信任。训练机器学习模型依赖数据来产出最佳结果,过程中必须考虑数据的来源与完整性:数据是用户提交的还是公开可用的?在处理数据时,必须构建能够保护机密信息并抵御攻击的 AI 系统。原课补充了五点行业观察:
- 行业在隐私与安全上已取得重大进展,其中欧盟 GDPR(通用数据保护条例)等法规起到了显著推动作用;
- 但就 AI 系统而言,必须承认一种内在张力:让系统更个性化、更有效需要更多个人数据,这与隐私诉求相冲突;
- 就像互联计算机诞生时一样,AI 相关的网络安全问题也在急剧增多;
- 同时,AI 本身也被用于提升安全——如今大多数现代杀毒软件都由 AI 启发式驱动;
- 数据科学流程必须与最新的隐私和安全实践相融合。
4.4 透明性(Transparency)
AI 系统应当是可理解的。透明性的关键是解释 AI 系统及其组成部分的行为。提升对 AI 系统的理解,要求利益相关者理解系统如何工作、为何工作,从而能够识别潜在的性能问题、安全与隐私隐患、偏见、排斥性实践或非预期结果。AI 的使用者应当诚实地说明自己何时、为何、如何部署系统,以及系统的局限性。例如,银行若用 AI 支持消费贷款决策,就必须审查结果、理解哪些数据影响了系统推荐。政府开始跨行业监管 AI,数据科学与组织必须能解释一个 AI 系统是否满足监管要求,尤其是在出现不良结果时。原课同时指出透明性面临的现实困难:
- AI 系统非常复杂,很难理解其工作机制并解读结果;
- 这种理解缺失影响系统被管理、工程化与文档化的方式;
- 更关键的是,它影响人们基于系统输出做出的决策。
4.5 问责(Accountability)
设计并部署 AI 系统的人必须对其系统如何运行负责。这种问责需求在敏感技术(如人脸识别)中尤为关键。人脸识别技术的需求日益增长,执法机构看重其在寻找失踪儿童等场景中的潜力;但这类技术也可能被用于对特定个体实施持续监控,从而威胁公民的基本自由。因此,数据科学家与组织必须对其 AI 系统对个人或社会的影响负责。原课结尾点出这一代人的根本问题:作为第一批把 AI 带入社会的世代,如何确保计算机对人们负责,以及如何确保设计计算机的人对其他人负责。
五、影响评估(Impact assessment)
原课强调:在训练机器学习模型之前,必须进行影响评估,以弄清四件事——AI 系统的目的是什么、预期用途是什么、部署在哪里、谁会与该系统交互。这些信息帮助评审者或测试者在识别潜在风险与预期后果时知道应考虑哪些因素。评估聚焦四个领域:
- 对个人的不利影响(Adverse impact on individuals):必须了解任何限制、要求、不支持的用法,以及任何已知会阻碍系统性能的限制条件,以确保系统不会被以伤害个人的方式使用;
- 数据要求(Data requirements):理解系统将以何种方式、在何处使用数据,帮助评审者审视需要留意的数据合规要求(例如 GDPR 或 HIPAA 数据法规),并检查数据来源与数据量是否足以支撑训练;
- 影响摘要(Summary of impact):收集一份使用该系统可能引发的潜在伤害清单,并在整个 ML 生命周期中持续复查这些问题是否已被缓解或处理;
- 各项原则的适用目标(Applicable goals):针对六个核心原则逐条评估目标是否达成、是否存在缺口。
这四条本质上是把「公平性原则」转化为可执行的训练前 checklist:先定义用途边界,再审查数据合规与数量,然后登记风险清单,最后逐条对照原则验收。
六、用负责任 AI 调试模型(Debugging with responsible AI)
6.1 为什么传统指标不够
与调试软件应用类似,调试 AI 系统也是识别并解决系统问题的必要过程。影响模型「不按预期或负责任地运行」的因素很多。传统模型性能指标大多是模型表现的定量聚合值,不足以分析模型如何违反负责任 AI 原则;而且机器学习模型是黑箱,难以理解是什么驱动了其结果、也难以在其出错时给出解释。原课指明,课程后续将学习用 Responsible AI dashboard 帮助调试 AI 系统,它提供四个整体性组件:
- 错误分析(Error analysis):识别可能影响系统公平性或可靠性的模型错误分布;
- 模型概览(Model overview):发现模型性能在不同数据队列(cohorts)之间的差异;
- 数据分析(Data analysis):理解数据分布,识别可能导致公平性、包容性与可靠性问题的数据偏见;
- 模型可解释性(Model interpretability):理解哪些因素驱动模型的预测,用于解释模型行为,这对透明性与问责至关重要。
6.2 仓库中的纵深实践:RAI dashboard 四组件详解
本课对四个组件只给出概念性说明,仓库中 9-Real-World/2-Debugging-ML-Models/README.md 则提供了对应的实操级细节,可作为本课原理的直接延伸,值得对照阅读:
- 错误分析:传统准确率指标无法揭示错误在数据分布中的位置——模型整体准确率可能是 89%,但在某些数据区域失败率高达 42%。RAI dashboard 用树状可视化展示错误在不同队列中的分布(节点红色越深错误率越高),并支持用一到两个特征构建热图(heatmap)定位错误贡献者;
- 模型概览:支持两类差异度指标(disparity metrics):其一是「模型性能差异」,计算选定性能指标(准确率、错误率、精确率、召回率、MAE 等)在各数据子群间的差值;其二是「选择率差异(disparity in selection rate)」,即各子群中有利预测(selection rate)的比例差,例如贷款审批率在不同队列间的差异。该组件还内置智能,可基于所选特征自动生成队列(如
time_in_hospital < 3与time_in_hospital >= 7),把特定特征从大数据群中隔离出来检查是否为错误结果的关键驱动; - 数据分析:数据是传统性能指标的巨大盲区。原课给出的例子是:若公司高管职位中女性占 27%、男性占 73%,用该数据训练的广告定向模型就会偏向男性受众——这不是公平性问题,同时说明模型不够包容、不可靠。RAI dashboard 的数据分析组件帮助用户按预测/实际结果、错误组与具体特征切分数据集,判断公平性发现是否源自数据分布本身,并决定应在哪些区域补充数据;
- 模型可解释性:区分「全局解释」(哪些特征影响模型整体行为)与「局部解释」(单个案例中哪些特征驱动了预测)。若某个敏感特征(如种族、性别)对预测影响力过高,可能是种族或性别偏见的信号;对单个案例的局部解释能力也便于审计与合规场景中的问责。
从源码结构看,本课与第 9 章形成了一个「概念课 → 工具课」的递进关系:3-fairness 讲「要查什么、为什么查」,Debugging-ML-Models 讲「用什么工具、怎么查」。学习本课后可直接跳转该课完成动手验证。
七、课堂挑战(Challenge)
原课以开放题收尾:为防止伤害在源头上被引入,我们应当做到:
- 让参与系统构建的人员具备多样化的背景与视角;
- 投资于反映社会多样性的数据集;
- 在整个机器学习生命周期中发展更好的方法来检测和纠正不负责任的 AI 行为。
并留出一个思考题:回想模型不可信在「建模过程」与「使用过程」中明显出现的真实场景,我们还需要考虑什么?
八、作业:探索 Responsible AI Toolbox(RAI Toolbox)
本课配套作业见 1-Introduction/3-fairness/assignment.md,要求探索 RAI Toolbox(一个「帮助数据科学家分析和改进 AI 系统的开源、社区驱动项目」)中 Responsible AI dashboard 的入门 notebook,并以论文或演示文稿形式汇报发现。其评分标准(Rubric)如下:
| 评价维度 | 优秀(Exemplary) | 合格(Adequate) | 待改进(Needs Improvement) |
|---|---|---|---|
| 汇报内容 | 提交讨论 Fairlearn 系统、所运行的 notebook 及由此得出结论的论文或 PPT | 提交了论文但没有结论 | 未提交论文 |
九、小结:从「公平性原则」到「可执行动作」
回看本课骨架,可以提炼出一条完整的负责任 AI 工作流:
- 训练前:完成影响评估四问——用途、部署、用户、个人不利影响;审查数据来源与合规要求(GDPR/HIPAA);登记潜在伤害清单。
- 训练后:用 RAI 四组件调试——错误分析定位错误分布,模型概览对比队列间差异(含选择率差异),数据分析检查过度/不足代表,可解释性审查敏感特征的影响力。
- 上线后:坚持透明(向利益相关者解释行为与局限)与问责(设计部署者对系统行为负责),把「玻璃盒」而非「黑箱」作为系统设计默认值。
- 全程:对照五类伤害(分配、服务质量、贬低、过度/不足代表、刻板印象)逐一自查,避免数据中的固有偏见被模型继承并放大。
仓库中相关的延伸阅读路径:Introduction 章节总览、真实世界应用课、模型调试实践课,以及本课中文译文 translations/zh-CN/1-Introduction/3-fairness/README.md。
【免费下载链接】ML-For-Beginners12 weeks, 26 lessons, 52 quizzes, classic Machine Learning for all项目地址: https://gitcode.com/GitHub_Trending/ml/ML-For-Beginners
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考