跳到主要内容

第 2 周,共 6 周 · 2.5-3 小时

数据如何教会一个模型

看看样例、标签和特征是怎样变成模型学习所依据的数据的,以及为什么数据干净、均衡如此重要。

核心问题:数据是怎样教会一个模型的?什么样的数据才足够好,值得从中学习?

这一周结束时

  • 找出一个数据集中的样例、标签、特征和类别。
  • 说明规律是怎样把特征和类别联系起来的。
  • 描述为什么模型要用一组数据训练、用另一组数据测试,并给泛化和准确率下定义。
  • 找出并修复重复项、错误标签和不均衡的类别。

正在加载你的进度…

  1. 样例、标签和特征打开一个数据集,认识它的组成部分:每一个样例、说明它属于哪个类别的标签,以及描述它的那些特征。
  2. 训练数据与测试数据看看为什么要用一组样例来教模型、再用另一组来检验它,以及用没见过的样例来测试,是如何衡量它是否真的学到了规律的。
  3. 修复数据集当一回数据侦探:揪出重复项、错误标签和不均衡的类别,把它们一一修好,让模型能学到公平又准确的规律。