跳到主要内容
返回课程

第 2 周 · 第 1 课 · 45-55 分钟

样例、标签和特征

打开一个数据集,认识它的组成部分:每一个样例、说明它属于哪个类别的标签,以及描述它的那些特征。

材料
在网页浏览器中打开的这节课 · 纸和笔,或者一个记事应用 · 本课中内置的水果数据集
本课
进行中

会自动保存在这台设备上

你将能够做到

  • 说出数据集的各个组成部分:样例、标签和特征。
  • 读懂一张数据表,并指出一个样例、它的特征和它的标签。
  • 说明特征和标签如何帮助模型学出某个类别的规律。

想一想

设想一张表,每一行是一个水果。各列写着它的颜色、重量和形状,最后一列写着它是什么水果。如果把最后一列盖住,你还猜得出每个水果吗?你会看哪些信息?

记住你的答案,这节课会给那张表的每一部分都取好名字。

做个预测

预测一下:水果表里的哪一项信息是模型要学会的「答案」,哪些又是线索?

数据集
为了让模型从中学习而收集在一起的一批样例,通常以由行和列构成的表格形式呈现。
样例
数据集中的一项,通常就是一行,比如一个水果、一张照片或一条消息。
标签
附在样例上的正确答案,说明它属于哪个类别,比如「苹果」或「香蕉」。
特征
描述一个样例的一条信息,比如它的颜色、重量或形状。每个特征通常是表格中的一列。
类别
模型把样例归入的其中一组。标签就来自这份类别清单。
规律
特征中常常与某个类别相伴出现的规律性,比如「又长又黄通常意味着香蕉」。

数据集是一张由样例组成的表

数据集是供模型学习的一批样例。最容易想象的方式就是一张表:每一行是一个样例,每一列存放关于这个样例的一类信息。

如果数据集讲的是水果,那么一行可能就是一根香蕉。如果讲的是邮件,一行就是一条消息。数据集的意义,就是把大量样例汇集到一处,好让模型从中找出规律。

  • 一张表,每行一个水果,列有颜色、重量和形状
  • 一张表,每行一封邮件,有一列写着「垃圾邮件」或「不是垃圾邮件」
  • 一张表,每行一张照片,有一列写出照片里的动物

特征负责描述;标签负责回答

在每个样例里,特征就是那些描述,也就是线索。在水果表中,颜色、重量和形状都是特征。特征通常是那些告诉你这个样例是什么样子的列。

标签是这个样例的正确答案,也就是它所属的类别。对一根香蕉来说,标签就是「香蕉」。特征和标签的分工不同:特征是你要看的线索,标签是你想对上的答案。

  • 一个水果的特征:颜色 = 黄色,形状 = 细长,重量 = 120 克
  • 这个水果的标签:香蕉
  • 一封邮件的特征:链接很多,出现「免费」一词;标签:垃圾邮件

类别,以及与之相配的规律

类别是你可以把样例归入的其中一组。如果一个数据集里只有苹果和香蕉,那么「苹果」和「香蕉」就是两个类别,而每一个标签都是其中之一。

模型通过找出规律来学习:也就是特征往往与某个类别相对应的方式。从许多带标签的水果中,它可能学到「又长又黄通常意味着香蕉」以及「又圆又红通常意味着苹果」。之后,它就能只凭特征给一个从没见过的新水果贴上标签。

  • 类别:苹果、香蕉
  • 学到的规律:圆 + 红 → 苹果;长 + 黄 → 香蕉
  • 一个特征为又圆又红的新水果 → 模型预测为「苹果」

例题讲解

读懂水果数据集中的一行

  1. 看一行:颜色 = 黄色,形状 = 细长,重量 = 120 克,水果 = 香蕉。
  2. 找出样例:这一整行就是一个样例,也就是一个水果。
  3. 找出特征:颜色、形状和重量就是描述它的特征。
  4. 找出标签:「香蕉」就是标签,也就是这个样例的正确类别。
  5. 留意规律正在成形:标注为香蕉的那些行反复出现「黄色」和「细长」,于是这些特征就成了香蕉这个类别的线索。

要点:每个样例都是一行;它的特征是那些起描述作用的列,它的标签则是答案那一列。

一个标注清楚的水果数据集
颜色重量(克)形状水果(标签)
Red150圆形苹果
黄色120细长香蕉
绿色160圆形苹果
黄色115细长香蕉

一张小小的数据表。每一行是一个水果样例。颜色、重量和形状这三列是特征。最后一列「水果」是标签,也就是该样例的类别。第 1 行:红色,150 克,圆形,苹果。第 2 行:黄色,120 克,细长,香蕉。第 3 行:绿色,160 克,圆形,苹果。第 4 行:黄色,115 克,细长,香蕉。

前三列是特征;最后一列是标签。

一个样例的各个部分

一张关于数据集中单独一行的示意图。一个箭头指向整行,标注为「样例」。三个单元格(颜色、重量、形状)被框在一起,标注为「特征:线索」。末尾的一个单元格(水果)标注为「标签:答案」。一条注释写着:「标签指明了这个样例所属的类别。」

特征是描述样例的线索;标签则是它的类别。

活动

数据标注工作台

查看一个内置的太空水果数据集,仅凭特征给每个样例贴上「安全」或「不安全」的标签,并把重复项和缺失值找出来。

  1. 在表格里查看每一颗太空水果的特征。
  2. 尽量给更多水果打上标签(可以吃 / 不能吃)。留意重复的行和缺失的数值。
  3. 用筛选和排序功能来调查。然后把你的标签和答案对照一下。

数据集概览

  • 样本总数: 14
  • 你的标注 — 可以吃: 0, Not safe: 0, left to do: 14
  • 发现的重复行: 4 · Missing values: 2

按质地统计

按质地统计: 光滑: 5, 凹凸: 3, 毛茸茸: 3, 带刺: 3.

在相信这份数据之前,先注意:

  • 有 4 行是重复的(和另一行特征完全相同)。同一颗水果算两次,会让它的分量过重。
  • 有 2 行缺了某个特征值,显示为「—」。缺值会让这颗水果很难打标签。
  • 记住:只是长得像的两颗水果不算重复,只有特征完全相同的行才算。
筛选

显示 14 / 14

  • 倒刺锥

    颜色
    天蓝
    形状
    星形
    质地
    带刺
    生长在
    洞窟
    种子数
    3
    甜度
    2
    发光等级
    2
    大小
    5 厘米
  • 尖刺螺

    颜色
    紫罗兰
    形状
    螺旋形
    质地
    带刺
    生长在
    陨石坑
    种子数
    1
    甜度
    3
    发光等级
    1
    大小
    4 厘米
  • 晨曦莓

    与 晨曦莓孪生 重复
    颜色
    深红
    形状
    圆形
    质地
    光滑
    生长在
    林冠
    种子数
    6
    甜度
    8
    发光等级
    0
    大小
    10 厘米
  • 晨曦莓孪生

    与 晨曦莓 重复
    颜色
    深红
    形状
    圆形
    质地
    光滑
    生长在
    林冠
    种子数
    6
    甜度
    8
    发光等级
    0
    大小
    10 厘米
  • 沙丘滴

    缺少 质地
    颜色
    琥珀
    形状
    圆形
    质地
    生长在
    沙丘
    种子数
    3
    甜度
    7
    发光等级
    1
    大小
    7 厘米
  • 沙李

    颜色
    琥珀
    形状
    椭圆形
    质地
    凹凸
    生长在
    沙丘
    种子数
    4
    甜度
    7
    发光等级
    1
    大小
    8 厘米
  • 淡星

    颜色
    紫罗兰
    形状
    星形
    质地
    光滑
    生长在
    陨石坑
    种子数
    1
    甜度
    4
    发光等级
    3
    大小
    6 厘米
  • 深渊螺

    颜色
    天蓝
    形状
    螺旋形
    质地
    凹凸
    生长在
    洞窟
    种子数
    1
    甜度
    2
    发光等级
    5
    大小
    4 厘米
  • 潮汐果

    与 潮汐果(副本) 重复
    颜色
    青绿
    形状
    圆形
    质地
    毛茸茸
    生长在
    礁石
    种子数
    8
    甜度
    9
    发光等级
    0
    大小
    12 厘米
  • 潮汐果(副本)

    与 潮汐果 重复
    颜色
    青绿
    形状
    圆形
    质地
    毛茸茸
    生长在
    礁石
    种子数
    8
    甜度
    9
    发光等级
    0
    大小
    12 厘米
  • 玫瑰滴

    缺少 甜度
    颜色
    深红
    形状
    椭圆形
    质地
    光滑
    生长在
    沙丘
    种子数
    5
    甜度
    发光等级
    1
    大小
    9 厘米
  • 甜礁

    颜色
    青绿
    形状
    椭圆形
    质地
    光滑
    生长在
    礁石
    种子数
    6
    甜度
    9
    发光等级
    0
    大小
    10 厘米
  • 软琥珀

    颜色
    琥珀
    形状
    圆形
    质地
    毛茸茸
    生长在
    林冠
    种子数
    3
    甜度
    7
    发光等级
    2
    大小
    7 厘米
  • 陨坑刺

    颜色
    紫罗兰
    形状
    星形
    质地
    带刺
    生长在
    陨石坑
    种子数
    2
    甜度
    3
    发光等级
    4
    大小
    5 厘米

先给几颗水果打上标签。答案在你选择对照之前一直藏着:先自己调查,再揭晓。

检查你的理解

回答这些题,检验你能否说出数据集的各个组成部分。

  1. Question 1. 在水果表里,写着「苹果」或「香蕉」的那一列是……

  2. Question 2. 在一个水果数据集中,下面哪些是特征?选出所有符合的。

    把符合的都选上。

  3. Question 3. 判断这句话是对还是错。

    数据集中的一个样例,通常就是表格里的一行。

已回答 0 / 3

自己动手试试

设计一个属于你的小数据集

为你熟悉的一组类别编一个小数据集,比如「狗还是猫」或者「工作日还是周末」。

  1. 选定两个类别,把它们写下来作为你的标签。
  2. 挑出三个有助于区分这两个类别的特征。
  3. 做一张有五行样例的表,为每一行填上特征和正确的标签。

做到这样就算成功

  • 有两个清晰的类别,用作标签。
  • 挑出了三个合理的特征。
  • 有五行样例,每行都有特征和正确的标签。

反思

输入时会保存在这台设备上

请不要写私人信息。你的回答只保存在这个浏览器里,不会发送到任何地方。

小结

数据集是一张由样例组成的表;每个样例都有描述它的特征和指明其类别的标签,而模型学的是把特征与类别联系起来的规律。

  • 一个样例就是一行;特征是起描述作用的列,标签是答案那一列。
  • 类别就是那些分组;每个标签都是其中的一个类别。
  • 模型学的是把特征与某个类别联系起来的规律。

七至八年级延伸内容

哪些特征才真正管用?

并不是每个特征都有用。在水果表里,「形状」和「颜色」能很好地把苹果和香蕉分开,但像「水果的采摘日期」这样的特征,多半对模型毫无帮助。

看看你自己的小数据集。哪个特征在区分类别上出力最多?有没有哪个特征可以去掉而不影响规律?说说你的理由。

完成这一课

  • Attempt the knowledge check(未完成)
  • Save a reflection (recommended)(未完成)

先做一下知识检查,才能完成这一课。