特征、标签和数据集是什么?模型到底从什么里面学习

样本是一条完整记录,特征是提供给模型的信息,标签是监督学习希望模型预测的答案。

学习路线:AI 入门与 PyTorch 基础(1~20) · 第 5 课
Learning Path

AI 入门与 PyTorch 基础(1~20)

从 AI 基本概念、机器学习任务、深度学习直觉、PyTorch 入门到中文文本分类项目全貌。

学完本阶段你能做到:能说清 AI、机器学习、深度学习、PyTorch 训练流程和一个中文文本分类项目的大致链路。

推荐读法:零基础建议顺序阅读;已有基础的读者可以把它当作路线地图和查漏补缺清单。

查看完整阶段 · 20 篇
Lesson Guide

这一课怎么学

先看目标,再带着问题读正文。读完后用练习确认自己真的理解了。

本节你会学到

  • 说清楚「特征、标签和数据集是什么?模型到底从什么里面学习」解决的核心问题
  • 知道它在「AI 入门与 PyTorch 基础(1~20)」中的位置
  • 把 监督学习、特征工程、机器学习 这些关键词联系起来

前置知识

  • 建议先读完上一篇:分类和回归有什么区别?先看模型要预测什么
  • 能区分输入、输出、数据和模型目标。

概念回顾

  • 【监督学习】如果训练数据里有“题目”和“答案”,模型学会以后再给它新题目,它就尝试给出答案。 前面或后面会反复用到它。
  • 【特征工程】模型不能直接理解很多现实信息,特征工程就是把信息翻译成模型能吃进去的格式。 前面或后面会反复用到它。
  • 【机器学习】机器学习的重点不是手写所有规则,而是准备数据、定义目标,让模型自己找到可复用的模式。 前面或后面会反复用到它。
  • 【分类与回归】判断邮件是不是垃圾邮件是分类,预测房价是多少是回归。 前面或后面会反复用到它。

常见误区

  • 不要只记定义,要追问它解决了什么问题。
  • 不要把概念孤立背下来,要放回数据到结果的完整链路里。

课后练习

  • 用 3 句话向一个零基础朋友解释「特征、标签和数据集是什么?模型到底从什么里面学习」。
  • 打开概念库里的「监督学习」,补一遍它和本文的关系。
  • 读下一课「训练集、验证集和测试集分别做什么?」前,先写下你认为它会解决的问题。

自检练习与参考答案

1. 用一句话说清「特征、标签和数据集是什么?模型到底从什么里面学习」解决了什么问题。

合格答案不是复述标题,而是说清它在“数据进入模型、模型学习、结果评估或项目落地”中的作用。

2. 这篇文章和上一课或下一课是什么关系?

它应该为下一课「训练集、验证集和测试集分别做什么?」铺路:读完后要知道下一课为什么自然出现。

下一步建议读「训练集、验证集和测试集分别做什么?」。

模型不会直接理解“用户”“房子”或“短信”。它看到的是被整理成数字、类别或文本表示的数据。

要读懂一份训练代码,先要分清样本、特征和标签。

第 5 课视频 · 特征、标签和数据集(约 1 分 17 秒)

样本:一条完整的观察记录

假设我们要预测房价,每一套房子就是一个样本:

面积 房间数 距地铁距离 成交价
89 2 600 260 万
120 3 1100 315 万

一行通常代表一个样本,很多样本共同组成数据集。

特征:模型作判断时看到的信息

面积、房间数和距地铁距离都是特征。它们是模型用来寻找规律的输入,通常写成 X

好的特征应该与任务有关,并且在真实预测时能够获得。用不到、质量差或带有未来信息的特征,可能让模型学偏。

在深度学习里,模型可以自动学习更复杂的内部特征,但最初输入的数据仍然需要正确准备。

标签:希望模型学会预测的答案

成交价是标签,也叫目标值,通常写成 y

训练时,模型根据特征预测价格,再把预测价格和真实标签比较。分类任务的标签可能是类别编号,回归任务的标签通常是连续数值。

数据不只是一个文件

真正可训练的数据还包括:

  • 字段含义和单位;
  • 缺失值处理规则;
  • 标签定义;
  • 数据采集范围;
  • 每个字段的数据类型;
  • 是否包含敏感或不可使用的信息。

这些信息不清楚,代码即使能够运行,训练结果也可能没有意义。

先检查 Shape 和 dtype

进入 PyTorch 后,需要额外关注:

  • Shape:一批数据有多少条、每条有多少特征;
  • dtype:数据是浮点数还是整数;
  • device:数据在 CPU 还是 GPU。

这三项是模型和数据之间最基本的契约。

这一课先记住什么

样本是一条记录,特征是输入信息,标签是要预测的答案。模型学习的是特征与标签之间的规律。

下一课会把一个完整数据集拆成 训练集、验证集和测试集

Discussion

留言讨论