本节你会学到
- 说清楚「过拟合、欠拟合和数据泄漏是什么?」解决的核心问题
- 知道它在「AI 入门与 PyTorch 基础(1~20)」中的位置
- 把 过拟合、训练集、验证集和测试集、机器学习 这些关键词联系起来
欠拟合是规律没学会,过拟合是只记住训练数据,数据泄漏则让模型提前看到了不该知道的信息。
学习路线:AI 入门与 PyTorch 基础(1~20) · 第 8 课从 AI 基本概念、机器学习任务、深度学习直觉、PyTorch 入门到中文文本分类项目全貌。
学完本阶段你能做到:能说清 AI、机器学习、深度学习、PyTorch 训练流程和一个中文文本分类项目的大致链路。
推荐读法:零基础建议顺序阅读;已有基础的读者可以把它当作路线地图和查漏补缺清单。
查看完整阶段 · 20 篇先看目标,再带着问题读正文。读完后用练习确认自己真的理解了。
合格答案不是复述标题,而是说清它在“数据进入模型、模型学习、结果评估或项目落地”中的作用。
它应该为下一课「神经网络到底是什么?一篇给 AI 初学者的入门解释」铺路:读完后要知道下一课为什么自然出现。
模型分数高不一定代表模型真的好。它可能没有学会规律,也可能只记住了训练样本,甚至可能提前看到了答案。
这对应三个必须分清的问题:欠拟合、过拟合和数据泄漏。
欠拟合时,模型在训练集和验证集上的表现都比较差。
常见原因包括:
解决欠拟合通常需要先检查数据与代码,再考虑增加模型能力或延长训练。
过拟合时,模型在训练集上表现很好,但在验证集或测试集上明显变差。
模型不仅学到了可以推广的规律,还记住了训练数据中的噪声和偶然细节。
常见改进方法包括:
数据泄漏是训练时使用了真实预测场景中不应该获得的信息。
例如预测用户是否会退订,却把“退订时间”作为输入特征;或者先用全部数据计算标准化参数,再划分训练集和测试集。
另一种常见泄漏是重复数据或同一用户的高度相似样本同时出现在训练集和测试集中。模型看似泛化得很好,其实只是在识别熟悉内容。
| 训练集表现 | 验证集表现 | 可能问题 |
|---|---|---|
| 差 | 差 | 欠拟合或数据问题 |
| 好 | 差 | 过拟合 |
| 异常地好 | 异常地好 | 检查数据泄漏 |
这只是初步线索,不能代替对数据、划分方式和代码流程的检查。
现在你已经知道 AI 的范围、任务类型、数据角色、数据集划分和评价方法。下一阶段可以进入 神经网络到底是什么,开始理解模型内部怎样从数据中学习。
留言讨论