AI 审查任务
你在一个审查委员会里,要在一个虚构的 AI 产品上线之前把它检查一遍。先回答问题,再写下你的建议。这是给你自己学习用的:没有评分,不会把任何内容发送出去,每一部分都可以重做。
这个产品: 北门社区学校提出了「PathwayAI」,这是一个助手,它会(1)向学生推荐课后活动,(2)在聊天窗口回答家长的问题,(3)标记出需要教职工复核的奖学金申请。你在审查委员会的工作,就是在它上线之前把它检查一遍。
- A. 概念人工智能与规则程序的区别、训练与测试、置信度,以及推荐系统的行为。
- B. 读懂结果总体结果与分组结果、模型的错误,以及不确定性。
- C. 公平与隐私代表性不足的数据、没必要的个人数据,以及人工复核。
- D. 虚假信息来源、日期、语境和独立证据。
回答 A 到 D 四个部分共 10 道题。答对 7 道就算稳稳通过,不过不需要满分也能学完这门课。
Question 1. PathwayAI 的推荐功能是从成千上万条以往学生的选择里学出来的。是什么让它算人工智能,而不是传统程序?
Question 2. 团队只用它学过的那批学生来检验推荐效果。这为什么有问题?
Question 3. 聊天机器人回答家长问题时说自己有「95% 的置信度」。这个置信度是什么意思?
Question 4. 有个学生一直只选体育类活动,PathwayAI 就一直推荐同一类活动。这是怎么回事?
Question 5. 看这张准确率图表。它说明了什么?
PathwayAI 标记申请的准确率 总体91A 组94B 组62数值以% 正确为单位。
以百分比表示的准确率。总体:91%。A 组申请人:94%。B 组申请人:62%。总体数字掩盖了 B 组被处理得差得多这一点。
Question 6. 看这张混淆矩阵。哪种错误最常见?
标记结果(行 = 实际,列 = 预测) 预测 实际 通过 复核 通过 40 18 复核 5 37 实际为「通过」这一行:预测通过 40 件,预测复核 18 件。实际为「复核」这一行:预测通过 5 件,预测复核 37 件。最大的错误是 18 件本可通过的申请被错送去复核。
Question 7. 对某一件申请,PathwayAI 以 54% 的置信度预测「复核」。负责任的解读是什么?
某一件申请的置信度 复核54通过46数值以% 置信度为单位。
置信度:复核 54%,通过 46%。几乎打平,说明模型没有把握。
Question 8. B 组的申请被处理得更差,而且 B 组在训练数据里占比很低。哪些做法是好的?把符合的都选上。
把符合的都选上。
Question 9. 为了推荐活动,PathwayAI 不需要哪些数据?把不必要或过于敏感的都选上。
把符合的都选上。
Question 10. 一条爆火的帖子配着一张很有冲击力的照片,说「PathwayAI 上周拒了 500 名学生!」。在相信它之前,你应该做哪些核查?把符合的都选上。
把符合的都选上。
已回答 0 / 10
E · 你的建议
这几个选项都可能是对的决定,关键在于你的理由。不要写私人信息。
它可能带来什么好处?
哪里可能出问题?
哪些数据需要,哪些不需要?
谁可能被区别对待?
由谁复核?什么时候复核?
有人不服结果时,怎么申诉?
选一个决定 · 已写 0 / 6 条理由。
结业反思
保存在这台设备上。不要写私人信息。