第 5 周 · 第 1 课 · 50-60 分钟
审视一个数据集是否公平
了解不均衡的样例如何造成偏见,读懂分组结果,看清一个系统对谁管用,并审视一个数据集是否公平。
- 材料
- 在网页浏览器中打开的这节课 · 纸和笔,或者一个记事应用
- 本课
- 进行中
会自动保存在这台设备上
你将能够做到
- 给偏见和代表性下定义,并说明二者如何相互关联。
- 读懂分组结果,比较一个系统对不同群体的效果好坏。
- 说明当人工智能对不同群体区别对待时,公平意味着什么。
- 审视一个被描述的数据集,并指出它的样例在哪一方面不均衡。
想一想
语音助手几乎每次都能听懂一位朋友,却老是听错另一位口音不同的朋友。对两个人来说,软件是同一个。为什么它对两人的表现会差这么多?
记住你的第一个猜想,本课后面你会拿真实的分组数字来检验它。
做个预测
预测一下:如果一个人脸识别系统主要是从成年人的照片中学习的,你觉得它在儿童照片上会同样好用吗?
- 偏见
- 当一个系统对某些人或某些事物总是表现得更好或更差时,通常是因为它学习所用的样例。
- 代表性
- 某个群体在数据集中出现得有多多。样例多,这个群体的代表性就好;样例少,就是代表性不足。
- 分组结果
- 为每个群体分别测出的成绩,而不是用一个数字概括所有人,好让你看清系统对谁管用。
- 公平
- 以人们会认为公道、合理的方式对待各个群体,不让某个群体在没有正当理由的情况下处于不利地位。
偏见来自样例,而不是计算机「想要」什么
计算机没有观点,也没有感情。我们说一个人工智能有偏见,意思是它总是对某些人或某些事物表现得更好。几乎无一例外,这都源于它学习所用的样例。
如果一个系统是从不均衡的样例中学习的,它就会擅长常见情况,而在少见情况上更弱。软件做的正是它被训练去做的事,不均衡是人给它的数据带来的。
- 主要用一种口音训练出的语音系统,对那种口音理解得最好。
- 主要用白天照片训练出的图片分类器,在夜里就吃力。
- 用正式书面语训练出的翻译工具,处理俚语就很差。
代表性:样例里有谁,又有多少
代表性说的是每个群体在数据中出现得有多多。一个群体样例多,代表性就好;样例少,就是代表性不足。一个数据集可能有成千上万个样例,却仍然让某些群体几乎一个都没有。
代表性不足是偏见最大的来源之一。模型只能学到它见过的规律。如果某个群体在样例中几乎不出现,模型就没什么可学的,于是往往对那个群体犯更多错。
- 一个含 10,000 张狗照片的数据集,其中某个品种只有 20 张。
- 一份主要采自成年人、儿童很少的医学数据集。
- 一个手写数据集,印刷体很多,连笔字却极少。
分组结果能显示单一总分所掩盖的东西
人很容易用一个数字来评判一个系统,比如「它的准确率有 92%」。但一个数字是所有人身上的平均值。它可能看着很棒,同时却在某个较小的群体上惨败,而那些错误被平均值埋掉了。
分组结果为每个群体分别测量准确率。把成绩拆开,你就能看出系统对谁管用、对谁不管用。关于公平的问题,几乎总是需要分组结果,而不只是一个总数。
- 总体 92%,但某个口音群体只有 74%。
- 总体准确率很高,但夜间照片的错误远多于白天照片。
- 一项平均下来通过的测试,对左手写字的人却经常出错。
公平:有没有人在没有正当理由的情况下吃了亏?
公平意味着以人们会认为公道、合理的方式对待各个群体。它并不总是要求结果完全一样,但它要追问:是否有某个群体在吃亏,以及这个差距是否有正当理由。
公平是人的判断,不是计算机来决定的事。必须由人去看分组结果、判断某个差距是否可以接受,并承担起纠正它的责任,而这往往意味着去收集更均衡的样例。
- 判定 74% 与 92% 的准确率差距太大,不适合上线。
- 选择为代表性不足的群体收集更多样例。
- 追问:如果系统对某个特定群体出错,受害的是谁。
例题讲解
审视一个微笑检测器的数据集
- 说清任务。一个相机应用想在所有人都在微笑时按下快门。输入:一张人脸。输出:「在微笑」或「没在微笑」。
- 看看代表性。训练集里有 8,000 张成年人照片,却只有 500 张幼儿照片。
- 预测后果。儿童样例这么少,模型几乎学不到孩子是怎么笑的,因此很可能在儿童身上犯更多错。
- 看分组结果,而不只是平均值。总体准确率是 90%,但按群体拆开,成年人是 94%,儿童只有 71%。
- 做出关于公平的判断。差距很大,而且儿童在没有正当理由的情况下吃了亏,所以公平的做法是收集更多儿童样例,在上线前重新测试。
要点:审视一个数据集,先问谁的代表性不足,再看分组结果,判断这种不均衡是否变成了不公平的错误。
数值以准确率(%)为单位。
一张条形图,用百分比分别显示一个语音识别系统在四个口音群体上的准确率。总体平均为 88%,但各群体并不均衡:口音群体 A 为 94%,口音群体 B 为 91%,口音群体 C 为 82%,口音群体 D 为 74%。训练样例最少的 C 组和 D 组,成绩远低于平均水平,所以单一的总体数字掩盖了最好与最差群体之间约 20 个百分点的真实差距。
把平均值拆开,就能清楚看到这个系统对某些群体明显比对另一些更管用。
| 口音群体 | 训练样例数 | 准确率 |
|---|---|---|
| A | 5,000 | 94% |
| B | 4,200 | 91% |
| C | 900 | 82% |
| D | 400 | 74% |
一张表,把每个口音群体的训练样例数量与它的准确率对应起来。A 组:5,000 个样例,准确率 94%。B 组:4,200 个样例,91%。C 组:900 个样例,82%。D 组:400 个样例,74%。样例最少的群体准确率最低,显示出代表性不足是怎样变成偏见的。
活动
公平性审查
审查一所虚构学校的理工科项目推荐系统:看清总体准确率如何掩盖了某个较小群体的糟糕结果,再通过限制一个替代特征、补充代表性不足的样例来纠正它。
- 先看总体准确率,再看每一组的准确率。它们并不一样。
- 模型依赖了一个有误导性的替代特征。把它的权重调低,再给代表性不足的那一组补充样本。
- 重新跑一次审计,和有问题的基准比较。公平性变好是进步,但不是保证。
虚构情境:一所学校在推荐课后 STEM 项目。这里的每个学生、每个群体、每个片区都是编的。两个群体:山坡区(人数多,离校区近)和 河畔区(人数少,离得远)。
总体准确率
63%
5 of 8 test students predicted correctly.
各组的准确率
误批:0 · 漏掉的合适学生:0 · 训练样本数:10
误批:0 · 漏掉的合适学生:3 · 训练样本数:6
总体数字看着还行,某一组却可能差得多,一定要看分组的结果。
调整前后
| 指标 | 有问题的基准 | 你的版本 |
|---|---|---|
| 总体准确率 | 63% | 63% |
| 山坡区的准确率 | 100% | 100% |
| 河畔区的准确率 | 25% | 25% |
把替代特征的权重调低,或者补充河畔区的样本,都会提高河畔区的准确率。要注意,一个改动也可能让另一组的结果发生变化:改善代表性是实实在在的进步,但并不保证做到完全公平。
检查你的理解
回答这些题,检验你能否发现偏见、读懂分组结果并判断公平。
Question 1. 人工智能系统里的偏见,最常来自哪里?
Question 2. 判断这句话是对还是错。
单一的总体准确率数字,足以证明一个系统对每个群体都公平。
Question 3. 根据分组结果,最合理的下一步是什么?
一个照片应用报告说总体准确率为 90%。按群体拆开后,成年人为 95%,儿童为 70%。训练集里的儿童照片非常少。
已回答 0 / 3
自己动手试试
设计一个更公平的数据集
挑一项简单的人工智能任务,在训练任何模型之前,先规划一个对各群体都公平的数据集。
- 选一项任务,比如识读手写字,或者辨认宠物。
- 列出这个系统应当为之服务好的那些群体。
- 大致决定每个群体需要多少样例,才能让谁都不至于代表性不足。
- 写下你会如何用分组准确率、而不只是总体平均值来检查结果。
做到这样就算成功
- 至少写出三个系统应当服务的群体。
- 方案给每个群体的样例足够多,避免代表性不足。
- 方案用分组结果来检查公平性。
反思
输入时会保存在这台设备上
请不要写私人信息。你的回答只保存在这个浏览器里,不会发送到任何地方。
小结
偏见通常来自不均衡的代表性,而只有分组结果才能揭示一个系统是否对每个群体都公平。
- 偏见指的是系统总是对某些群体比对另一些表现更好,通常源于它的样例。
- 代表性不足的群体往往会遇到更多错误,因为模型见到的样例更少。
- 单一的总体成绩可能掩盖真实差距;分组结果才显示系统对谁管用。
- 公平是人的判断:某个差距是否可以接受,又该如何纠正。
七至八年级延伸内容
当准确率相同却依然不公平
有时两个群体的准确率一样,但错误对其中一个群体的影响要严重得多。设想一个把图书馆藏书标记为「逾期」的系统。一次错误标记,对一个群体可能只是小小的麻烦,对另一个群体却可能让他们完全借不到书。
挑一个人工智能可能做出的决定,描述这样一种情形:各群体准确率相同,却仍然导致不公平的后果,因为犯错的代价并不相等。你还需要哪些额外信息,才能察觉到这一点?
完成这一课
- Attempt the knowledge check(未完成)
- Save a reflection (recommended)(未完成)
先做一下知识检查,才能完成这一课。