跳到主要内容
返回课程

第 5 周 · 第 1 课 · 50-60 分钟

审视一个数据集是否公平

了解不均衡的样例如何造成偏见,读懂分组结果,看清一个系统对谁管用,并审视一个数据集是否公平。

材料
在网页浏览器中打开的这节课 · 纸和笔,或者一个记事应用
本课
进行中

会自动保存在这台设备上

你将能够做到

  • 给偏见和代表性下定义,并说明二者如何相互关联。
  • 读懂分组结果,比较一个系统对不同群体的效果好坏。
  • 说明当人工智能对不同群体区别对待时,公平意味着什么。
  • 审视一个被描述的数据集,并指出它的样例在哪一方面不均衡。

想一想

语音助手几乎每次都能听懂一位朋友,却老是听错另一位口音不同的朋友。对两个人来说,软件是同一个。为什么它对两人的表现会差这么多?

记住你的第一个猜想,本课后面你会拿真实的分组数字来检验它。

做个预测

预测一下:如果一个人脸识别系统主要是从成年人的照片中学习的,你觉得它在儿童照片上会同样好用吗?

偏见
当一个系统对某些人或某些事物总是表现得更好或更差时,通常是因为它学习所用的样例。
代表性
某个群体在数据集中出现得有多多。样例多,这个群体的代表性就好;样例少,就是代表性不足。
分组结果
为每个群体分别测出的成绩,而不是用一个数字概括所有人,好让你看清系统对谁管用。
公平
以人们会认为公道、合理的方式对待各个群体,不让某个群体在没有正当理由的情况下处于不利地位。

偏见来自样例,而不是计算机「想要」什么

计算机没有观点,也没有感情。我们说一个人工智能有偏见,意思是它总是对某些人或某些事物表现得更好。几乎无一例外,这都源于它学习所用的样例。

如果一个系统是从不均衡的样例中学习的,它就会擅长常见情况,而在少见情况上更弱。软件做的正是它被训练去做的事,不均衡是人给它的数据带来的。

  • 主要用一种口音训练出的语音系统,对那种口音理解得最好。
  • 主要用白天照片训练出的图片分类器,在夜里就吃力。
  • 用正式书面语训练出的翻译工具,处理俚语就很差。

代表性:样例里有谁,又有多少

代表性说的是每个群体在数据中出现得有多多。一个群体样例多,代表性就好;样例少,就是代表性不足。一个数据集可能有成千上万个样例,却仍然让某些群体几乎一个都没有。

代表性不足是偏见最大的来源之一。模型只能学到它见过的规律。如果某个群体在样例中几乎不出现,模型就没什么可学的,于是往往对那个群体犯更多错。

  • 一个含 10,000 张狗照片的数据集,其中某个品种只有 20 张。
  • 一份主要采自成年人、儿童很少的医学数据集。
  • 一个手写数据集,印刷体很多,连笔字却极少。

分组结果能显示单一总分所掩盖的东西

人很容易用一个数字来评判一个系统,比如「它的准确率有 92%」。但一个数字是所有人身上的平均值。它可能看着很棒,同时却在某个较小的群体上惨败,而那些错误被平均值埋掉了。

分组结果为每个群体分别测量准确率。把成绩拆开,你就能看出系统对谁管用、对谁不管用。关于公平的问题,几乎总是需要分组结果,而不只是一个总数。

  • 总体 92%,但某个口音群体只有 74%。
  • 总体准确率很高,但夜间照片的错误远多于白天照片。
  • 一项平均下来通过的测试,对左手写字的人却经常出错。

公平:有没有人在没有正当理由的情况下吃了亏?

公平意味着以人们会认为公道、合理的方式对待各个群体。它并不总是要求结果完全一样,但它要追问:是否有某个群体在吃亏,以及这个差距是否有正当理由。

公平是人的判断,不是计算机来决定的事。必须由人去看分组结果、判断某个差距是否可以接受,并承担起纠正它的责任,而这往往意味着去收集更均衡的样例。

  • 判定 74% 与 92% 的准确率差距太大,不适合上线。
  • 选择为代表性不足的群体收集更多样例。
  • 追问:如果系统对某个特定群体出错,受害的是谁。

例题讲解

审视一个微笑检测器的数据集

  1. 说清任务。一个相机应用想在所有人都在微笑时按下快门。输入:一张人脸。输出:「在微笑」或「没在微笑」。
  2. 看看代表性。训练集里有 8,000 张成年人照片,却只有 500 张幼儿照片。
  3. 预测后果。儿童样例这么少,模型几乎学不到孩子是怎么笑的,因此很可能在儿童身上犯更多错。
  4. 看分组结果,而不只是平均值。总体准确率是 90%,但按群体拆开,成年人是 94%,儿童只有 71%。
  5. 做出关于公平的判断。差距很大,而且儿童在没有正当理由的情况下吃了亏,所以公平的做法是收集更多儿童样例,在上线前重新测试。

要点:审视一个数据集,先问谁的代表性不足,再看分组结果,判断这种不均衡是否变成了不公平的错误。

各群体的准确率:一个平均值掩盖了真实差距

一张条形图,用百分比分别显示一个语音识别系统在四个口音群体上的准确率。总体平均为 88%,但各群体并不均衡:口音群体 A 为 94%,口音群体 B 为 91%,口音群体 C 为 82%,口音群体 D 为 74%。训练样例最少的 C 组和 D 组,成绩远低于平均水平,所以单一的总体数字掩盖了最好与最差群体之间约 20 个百分点的真实差距。

把平均值拆开,就能清楚看到这个系统对某些群体明显比对另一些更管用。

代表性与准确率差距正好对得上
口音群体训练样例数准确率
A5,00094%
B4,20091%
C90082%
D40074%

一张表,把每个口音群体的训练样例数量与它的准确率对应起来。A 组:5,000 个样例,准确率 94%。B 组:4,200 个样例,91%。C 组:900 个样例,82%。D 组:400 个样例,74%。样例最少的群体准确率最低,显示出代表性不足是怎样变成偏见的。

活动

公平性审查

审查一所虚构学校的理工科项目推荐系统:看清总体准确率如何掩盖了某个较小群体的糟糕结果,再通过限制一个替代特征、补充代表性不足的样例来纠正它。

  1. 先看总体准确率,再看每一组的准确率。它们并不一样。
  2. 模型依赖了一个有误导性的替代特征。把它的权重调低,再给代表性不足的那一组补充样本。
  3. 重新跑一次审计,和有问题的基准比较。公平性变好是进步,但不是保证。

虚构情境:一所学校在推荐课后 STEM 项目。这里的每个学生、每个群体、每个片区都是编的。两个群体:山坡区(人数多,离校区近)和 河畔区(人数少,离得远)。

总体准确率

63%

5 of 8 test students predicted correctly.

各组的准确率

山坡区100% (4/4)

误批:0 · 漏掉的合适学生:0 · 训练样本数:10

河畔区25% (1/4)

误批:0 · 漏掉的合适学生:3 · 训练样本数:6

总体数字看着还行,某一组却可能差得多,一定要看分组的结果。

模型依赖哪些特征?
兴趣方向 权重 1

学生喜欢什么,这和项目是否合适直接相关。

放学后有空 权重 1

学生能不能来参加,这是相关的。

以前参加过的 STEM 活动 权重 1

以前的参与情况,这是相关的。

住得离校区近 proxy权重 2

这是「住在哪个片区」的替代变量。它衡量的不是合不合适,而是学生属于哪一组,是一个有误导性的特征。

补充代表性不足的样本

训练集现在有 10 个山坡区学生和 6 个河畔区学生。下面这些合适的河畔区学生之前是缺席的:

调整前后

把有问题的基准和你现在的审计设置放在一起,比较总体准确率和分组准确率。
指标有问题的基准你的版本
总体准确率63%63%
山坡区的准确率100%100%
河畔区的准确率25%25%

把替代特征的权重调低,或者补充河畔区的样本,都会提高河畔区的准确率。要注意,一个改动也可能让另一组的结果发生变化:改善代表性是实实在在的进步,但并不保证做到完全公平。

检查你的理解

回答这些题,检验你能否发现偏见、读懂分组结果并判断公平。

  1. Question 1. 人工智能系统里的偏见,最常来自哪里?

  2. Question 2. 判断这句话是对还是错。

    单一的总体准确率数字,足以证明一个系统对每个群体都公平。

  3. Question 3. 根据分组结果,最合理的下一步是什么?

    一个照片应用报告说总体准确率为 90%。按群体拆开后,成年人为 95%,儿童为 70%。训练集里的儿童照片非常少。

已回答 0 / 3

自己动手试试

设计一个更公平的数据集

挑一项简单的人工智能任务,在训练任何模型之前,先规划一个对各群体都公平的数据集。

  1. 选一项任务,比如识读手写字,或者辨认宠物。
  2. 列出这个系统应当为之服务好的那些群体。
  3. 大致决定每个群体需要多少样例,才能让谁都不至于代表性不足。
  4. 写下你会如何用分组准确率、而不只是总体平均值来检查结果。

做到这样就算成功

  • 至少写出三个系统应当服务的群体。
  • 方案给每个群体的样例足够多,避免代表性不足。
  • 方案用分组结果来检查公平性。

反思

输入时会保存在这台设备上

请不要写私人信息。你的回答只保存在这个浏览器里,不会发送到任何地方。

小结

偏见通常来自不均衡的代表性,而只有分组结果才能揭示一个系统是否对每个群体都公平。

  • 偏见指的是系统总是对某些群体比对另一些表现更好,通常源于它的样例。
  • 代表性不足的群体往往会遇到更多错误,因为模型见到的样例更少。
  • 单一的总体成绩可能掩盖真实差距;分组结果才显示系统对谁管用。
  • 公平是人的判断:某个差距是否可以接受,又该如何纠正。

七至八年级延伸内容

当准确率相同却依然不公平

有时两个群体的准确率一样,但错误对其中一个群体的影响要严重得多。设想一个把图书馆藏书标记为「逾期」的系统。一次错误标记,对一个群体可能只是小小的麻烦,对另一个群体却可能让他们完全借不到书。

挑一个人工智能可能做出的决定,描述这样一种情形:各群体准确率相同,却仍然导致不公平的后果,因为犯错的代价并不相等。你还需要哪些额外信息,才能察觉到这一点?

完成这一课

  • Attempt the knowledge check(未完成)
  • Save a reflection (recommended)(未完成)

先做一下知识检查,才能完成这一课。