本节你会学到
- 说清楚「特征、标签和数据集是什么?模型到底从什么里面学习」解决的核心问题
- 知道它在「AI 入门与 PyTorch 基础(1~20)」中的位置
- 把 监督学习、特征工程、机器学习 这些关键词联系起来
样本是一条完整记录,特征是提供给模型的信息,标签是监督学习希望模型预测的答案。
学习路线:AI 入门与 PyTorch 基础(1~20) · 第 5 课从 AI 基本概念、机器学习任务、深度学习直觉、PyTorch 入门到中文文本分类项目全貌。
学完本阶段你能做到:能说清 AI、机器学习、深度学习、PyTorch 训练流程和一个中文文本分类项目的大致链路。
推荐读法:零基础建议顺序阅读;已有基础的读者可以把它当作路线地图和查漏补缺清单。
查看完整阶段 · 20 篇先看目标,再带着问题读正文。读完后用练习确认自己真的理解了。
合格答案不是复述标题,而是说清它在“数据进入模型、模型学习、结果评估或项目落地”中的作用。
它应该为下一课「训练集、验证集和测试集分别做什么?」铺路:读完后要知道下一课为什么自然出现。
模型不会直接理解“用户”“房子”或“短信”。它看到的是被整理成数字、类别或文本表示的数据。
要读懂一份训练代码,先要分清样本、特征和标签。
假设我们要预测房价,每一套房子就是一个样本:
| 面积 | 房间数 | 距地铁距离 | 成交价 |
|---|---|---|---|
| 89 | 2 | 600 | 260 万 |
| 120 | 3 | 1100 | 315 万 |
一行通常代表一个样本,很多样本共同组成数据集。
面积、房间数和距地铁距离都是特征。它们是模型用来寻找规律的输入,通常写成 X。
好的特征应该与任务有关,并且在真实预测时能够获得。用不到、质量差或带有未来信息的特征,可能让模型学偏。
在深度学习里,模型可以自动学习更复杂的内部特征,但最初输入的数据仍然需要正确准备。
成交价是标签,也叫目标值,通常写成 y。
训练时,模型根据特征预测价格,再把预测价格和真实标签比较。分类任务的标签可能是类别编号,回归任务的标签通常是连续数值。
真正可训练的数据还包括:
这些信息不清楚,代码即使能够运行,训练结果也可能没有意义。
进入 PyTorch 后,需要额外关注:
Shape:一批数据有多少条、每条有多少特征;dtype:数据是浮点数还是整数;device:数据在 CPU 还是 GPU。这三项是模型和数据之间最基本的契约。
样本是一条记录,特征是输入信息,标签是要预测的答案。模型学习的是特征与标签之间的规律。
下一课会把一个完整数据集拆成 训练集、验证集和测试集。
留言讨论