AI 学习路线
先建立 AI 的整体地图,再理解模型怎样学习,最后把概念放进代码和项目。你不需要一次看懂所有公式,只需要沿着顺序把每个问题解决掉。
按阶段学习
每一阶段都要回答三个问题:为什么现在学、学完能做什么、下一步走向哪里。
AI 入门与 PyTorch 基础(1~20)
零基础从 AI 基本概念、机器学习任务、深度学习直觉、PyTorch 入门到中文文本分类项目全貌。
阶段定位:这是整条路线的入门底座。前 18 篇负责建立 AI、机器学习、深度学习和 PyTorch 训练流程的基本认知,第 19-20 篇负责让读者先看见一个中文文本分类项目怎样端到端跑起来。
学完本阶段你能做到:能说清 AI、机器学习、深度学习、PyTorch 训练流程和一个中文文本分类项目的大致链路。
推荐读法:零基础建议顺序阅读;已有基础的读者可以把它当作路线地图和查漏补缺清单。
- 1什么是人工智能?从机器会做什么开始理解 AI
AI 不是会思考的魔法,而是一类让机器完成感知、判断、生成和行动任务的方法与系统。
- 2AI、机器学习、深度学习和生成式 AI 有什么区别?
用一张由大到小的知识地图,讲清 AI、ML、DL 和生成式 AI 之间的包含与交叉关系。
- 3监督学习与无监督学习是什么?关键区别在有没有答案
监督学习用带答案的数据学习预测,无监督学习则从没有答案的数据中寻找结构和规律。
- 4分类和回归有什么区别?先看模型要预测什么
分类预测离散类别,回归预测连续数值。任务类型会直接决定输出层、损失函数和评价指标。
- 5特征、标签和数据集是什么?模型到底从什么里面学习
样本是一条完整记录,特征是提供给模型的信息,标签是监督学习希望模型预测的答案。
- 6训练集、验证集和测试集分别做什么?
训练集用于学习参数,验证集用于选择方案,测试集只在最后评估一次模型的真实泛化能力。
- 7准确率、精确率、召回率和 F1 到底怎么看?
从混淆矩阵出发理解四个分类指标,并根据漏判和误判的实际代价选择评价标准。
- 8过拟合、欠拟合和数据泄漏是什么?
欠拟合是规律没学会,过拟合是只记住训练数据,数据泄漏则让模型提前看到了不该知道的信息。
- 9神经网络到底是什么?一篇给 AI 初学者的入门解释
不从公式开始,而是从“机器怎样学会判断”这件事讲起,把神经网络、神经元、参数、训练和预测串成一条清楚的线。
- 10激活函数是什么?为什么神经网络不能没有它
激活函数让神经网络拥有非线性表达能力。没有它,再多层网络也可能只是一个更复杂的线性模型。
- 11损失函数是什么?模型为什么要算自己错多少
损失函数像训练过程里的成绩单,告诉模型预测结果和真实答案之间差了多少。
- 12梯度下降算法是什么?参数到底怎么一步步更新
梯度下降可以理解成沿着损失函数的坡度往低处走,目标是找到让模型错误更小的参数。
- 13CrossEntropyLoss 详解:分类任务为什么常用它
CrossEntropyLoss 常用于分类任务,它关注的不只是模型有没有猜对,还关注模型对正确类别有多自信。
- 14前向传播与反向传播到底在做什么?
用“预测、算错、追责、更新”串起一次神经网络训练,并用最小 PyTorch 代码看清 forward、backward 和 step 的分工。
- 15Tensor 是什么?PyTorch 里最重要的对象讲清楚
Tensor 可以理解成更通用的数组,它承载数据、参数和梯度,是 PyTorch 训练流程的基础。
- 16PyTorch 的 Linear 层详解:全连接层到底做了什么
Linear 层本质上是一次线性变换,它把输入特征通过权重矩阵和偏置映射到新的输出空间。
- 17DataLoader 详解:批量读取、打乱、并行加载有什么用
DataLoader 负责把数据按批次送进模型,并处理 shuffle、batch size 和多进程加载等训练细节。
- 18一个 PyTorch 模型训练的完整流程
从准备数据、定义模型、选择损失函数和优化器,到训练循环和验证评估,把 PyTorch 训练主线串起来。
- 19从垃圾短信识别项目里,我复盘了一个中文文本分类系统
一次从短信分类项目出发的复盘:从需求、流程到问题定位,再到后续可以继续优化的方向。
- 20我怎样把一个中文文本分类项目,从训练脚本一路做到了 API 和前端
从 jieba 分词、TF-IDF 和随机森林开始,到 Flask 接口和 Streamlit 页面,这是一条更完整的中文文本分类落地链路。
传统机器学习基础(21~34)
初级补齐文本分类项目背后的数据处理、算法、评估和模型选择知识。
阶段定位:前面 1-20 篇已经见过梯度下降、损失函数和训练流程。现在退一步,用最简单的模型把“数据 → 训练 → 评估 → 选择”这条主线彻底走通。这是回顾加深,不是突然倒车。
学完本阶段你能做到:拿到一份结构化表格数据,独立完成清洗、特征工程、建模、评估、模型选择和保存,并用规范流程比较多个算法。
推荐读法:建议系统读。做项目时遇到数据和模型选择问题,也可以按需回查。
- 21机器学习项目的完整流程:从原始数据到模型预测
一个机器学习项目不是从训练模型开始,而是从定义问题、整理数据、训练评估到上线预测的一整条链路。
- 22数据清洗第一课:缺失值、重复值和异常值怎么处理
数据清洗不是把数据改漂亮,而是识别缺失、重复、异常和格式问题,让模型拿到可靠的输入。
- 23Pandas 数据清洗实战:把混乱表格变成可训练数据
用一个小型表格案例串起读取数据、检查缺失、去重、处理异常值、编码类别特征和导出干净数据的流程。
- 24特征工程是什么?模型为什么不能直接理解原始数据
特征工程不是随便增加几列,而是把原始业务数据整理成模型能稳定学习的信号。
- 25类别特征如何处理:Label Encoding 与 One-Hot Encoding
Label Encoding 和 One-Hot Encoding 都能把类别变成数字,但它们表达的含义完全不同。
- 26数据标准化和归一化有什么区别
标准化和归一化都在处理数值尺度问题,但一个看均值方差,一个看最大最小值。
- 27线性回归:模型怎样用一条线预测连续数值
从房价预测出发,理解线性回归的输入、输出、误差和第一个 scikit-learn 实现。
- 28回归模型怎样评估:MAE、MSE、RMSE 和 R²
用同一组测试数据理解四个常用回归指标,并根据业务代价选择正确的评价方式。
- 29逻辑回归为什么叫回归,却用来做分类
理解线性分数、Sigmoid、概率和阈值,跑通第一个二分类逻辑回归示例。
- 30KNN 分类:让距离最近的样本帮忙投票
理解 K 近邻算法的核心思想、距离度量、K 值选择、特征缩放和 sklearn 训练流程。
- 31决策树是什么?模型怎样一步步做判断
从分支节点、叶节点、基尼系数、信息增益和 max_depth 入手,理解决策树分类模型。
- 32随机森林为什么比单棵树更稳
理解随机森林的 Bagging 思想、有放回抽样、随机特征选择、投票机制和常用参数。
- 33集成学习入门:Bagging、Boosting 到底在组合什么
从多个模型共同决策的直觉出发,理解 Bagging、Boosting、随机森林和梯度提升模型的基本区别。
- 34模型评估与交叉验证:不要只相信一次划分
理解训练集、验证集、测试集、交叉验证、平均分和波动,避免用一次随机划分误判模型能力。
文本分类项目(35~42)
项目实战重新拆解中文文本分类链路,从编码清洗、分词、向量化、评估、保存一路做到演示页面。
阶段定位:第 19-20 篇是端到端体验,本阶段是逐环节吃透。不是重讲,而是把中文文本分类的每个关键步骤拆开、讲透、能复用。
学完本阶段你能做到:从一份原始中文文本出发,独立完成清洗、分词、向量化、训练、评估、保存和演示页面,并能解释每个环节为什么这么做。
推荐读法:如果已经吃透第 19-20 课,可按薄弱环节跳读;否则建议顺序阅读。
- 35计算机怎样读取中文文本:编码、清洗与标准化
进入中文文本分类前,先理解文本文件编码、乱码、空白符、标点、大小写和基础清洗规则。
- 36中文分词与停用词:让模型先读懂文本边界
理解中文分词为什么重要,停用词应该怎么用,以及在文本分类项目里如何把句子切成可建模的词。
- 37词袋模型与 CountVectorizer:文本也可以做特征表
从词袋模型开始理解文本向量化,学习 CountVectorizer 如何把分词后的中文文本变成可训练的特征矩阵。
- 38TF-IDF 是什么?把中文文本变成模型能读的数字
从词频和逆文档频率出发,理解 TF-IDF 为什么适合文本分类,以及如何在 sklearn 中使用 TfidfVectorizer。
- 39训练中文文本分类 baseline:TF-IDF + 逻辑回归
用 TF-IDF 和 LogisticRegression 跑通一个中文文本分类基线模型,理解从分词、划分数据到训练预测的完整流程。
- 40文本分类模型评估:从混淆矩阵找到改进方向
学会用 classification_report、confusion_matrix 和错分样本分析文本分类模型,不只看准确率。
- 41保存与加载文本分类模型:让预测可以复用
学会保存完整 Pipeline、标签信息和项目元数据,让文本分类模型不只停留在 notebook 里。
- 42用 Streamlit 给文本分类模型做一个演示页面
把已经训练好的文本分类 Pipeline 接到 Streamlit 页面里,完成输入文本、预测类别和查看置信度的交互演示。
PyTorch 深度学习基础(43~58)
初级在前 20 篇 PyTorch 入门上继续深化,补齐张量操作、自动微分、优化器家族和训练排错能力。
阶段定位:本阶段补齐实际训练需要的张量操作、自动微分、优化器家族和训练排错能力。它决定你能不能独立读懂任何 PyTorch 训练脚本,并诊断常见训练问题。
学完本阶段你能做到:独立搭建一个 PyTorch 训练脚本,正确处理 Shape、device、梯度清空、优化器选择和学习率策略,并能根据 loss/accuracy 曲线诊断训练问题。
推荐读法:当前更新主线,建议跟更;每篇都要配合代码自检。
- 43Tensor 进阶:dtype、device、索引和切片
补齐 PyTorch 实际训练中最常用的 Tensor 操作:数据类型、设备迁移、索引、切片和布尔筛选。
- 44PyTorch 自动微分是什么?理解 requires_grad 和 backward
从一个最小例子理解 PyTorch 如何记录计算过程、自动求梯度,以及为什么训练前要清空梯度。
- 45计算图与梯度累积:为什么训练前必须清空梯度
你写了 optimizer.zero_grad() 却不知道为什么要写。这一篇把 PyTorch 的动态计算图、叶子节点和梯度累积机制讲透,让你彻底明白"清梯度"不是仪式,是物理必然。
- 46Shape 是深度学习最重要的数据契约
深度学习代码 80% 的报错都是 Shape 不匹配。但 Shape 不只是维度对齐,它是模型每一层之间的数据契约。这篇把 batch、特征、类别维度和常见的 Shape 流水线一次讲透。
- 47reshape、view、transpose 和广播机制怎么选:张量形状转换实战
reshape 和 view 看起来一样,transpose 和 permute 也像兄弟,广播机制报错信息又长又看不懂。这篇用最小代码讲清它们的区别,让你不再瞎试。
- 48自定义 Dataset:怎样封装自己的训练数据
PyTorch 内置数据集只够入门练手。真实项目里你的数据可能是 CSV、文件夹图片、JSON 文本——这时候必须自己写 Dataset。这篇把 __len__ 和 __getitem__ 讲透,附带三个真实场景。
- 49DataLoader 进阶:batch、shuffle 与并行加载怎样影响训练效率
第 17 篇你学了 DataLoader 的基本用法。但 batch_size 调多大、shuffle 为什么必须开、num_workers 设几、drop_last 有什么用——这些细节决定训练是 5 分钟还是 5 小时。
- 50nn.Module 详解:模型为什么要继承这个类
所有 PyTorch 模型都继承 nn.Module。但你可能不知道,它帮你做了参数注册、子模块管理、train/eval 切换、设备迁移四件大事。这篇把 nn.Module 的黑盒拆开。
- 51权重、偏置和参数初始化会怎样影响训练
把所有权重初始化成 0,模型直接学不动。初始化成太大的随机数,梯度爆炸。初始化是训练的起跑线,起跑线错了后面全白费。这篇讲清为什么初始化重要、常见方法怎么选。
- 52SGD 与 Momentum:最基础的优化器怎样更新参数
梯度下降是所有优化器的祖宗。SGD 是最朴素的实现,Momentum 加了惯性。搞懂这两个,才能理解后面 Adam 在"智能"什么。
- 53AdaGrad 与 RMSProp:学习率如何自动调整
SGD 给所有参数同一个学习率。但有些参数变化剧烈、有些几乎不动,统一步长不合理。AdaGrad 和 RMSProp 让每个参数有自己的自适应学习率。
- 54Adam 和 AdamW 为什么成为常用选择
Adam 把 Momentum 的"方向惯性"和 RMSProp 的"自适应步长"合体,开箱即用。AdamW 修复了 Adam 权重衰减的耦合 bug,成为 Transformer 的标配。
- 55学习率决定什么:衰减策略与训练曲线
学习率是训练里最敏感的超参数——太大 loss 爆炸,太小 loss 不动。这篇讲清怎么判断学习率过大过小,以及 StepLR、CosineAnnealing 等衰减策略怎么选。
- 56PyTorch GPU 训练:模型和数据如何放到同一设备
RuntimeError: Expected all tensors to be on the same device —— 这是你用 GPU 训练时最常遇到的报错。模型在 GPU、数据在 CPU,它们碰不到一起。这篇讲清设备迁移的完整流程。
- 57正则化、Dropout 与 Early Stopping:防止过拟合的方法地图
模型训练集准确率 99%,测试集只有 70%——这是过拟合。Weight Decay、Dropout、Early Stopping、数据增强怎么选?这篇建立完整的正则化方法地图。
- 58怎样根据 loss、accuracy 和梯度诊断训练问题
训练 loss 不降?降了又升?训练好测试差?这篇把前面所有训练知识串成一套系统化的诊断流程,让你看曲线就知道问题在哪。
深度学习项目
项目实战通过回归、二维分类、表格分类和图像分类项目,把 Dataset、模型、损失、优化器、评估和推理串起来。
阶段定位:前面阶段已经补齐 PyTorch 训练脚本和诊断能力。本阶段开始把知识放进完整项目里,让读者从数据到推理形成可复用的工程流程。
学完本阶段你能做到:能独立完成一个完整深度学习项目,从数据到推理全流程,并整理出可复用的项目目录结构。
推荐读法:建议顺序阅读并同步跑代码;每个项目都要形成可复用目录。
- 59PyTorch 线性回归项目:从造数据到预测
前面 14 篇学了原理,现在第一次完整跑一个深度学习项目——从造数据、建模型、训练到预测。用最简单的线性回归,把全流程跑通。
- 60从零搭建二维分类神经网络:模型到底怎么分开两类点
线性回归是连续预测,分类是离散判断。这篇从零搭建一个二分类神经网络,用二维数据让你能"看到"模型怎么把两类点分开。
- 61决策边界可视化:模型到底学出了什么
准确率 99% 但不知道模型怎么分的?这篇把分类模型的决策边界画出来,让你亲眼看到模型在二维空间画了一条什么形状的分界线。
- 62表格分类项目:从 CSV 到神经网络预测
前面用造的数据练手,这次用真实 CSV 表格数据。从读取、预处理、模型搭建到训练评估,走完表格分类的完整流程。
- 63模型保存、加载和批量推理实战
训练好的模型不能只活在内存里。这篇讲清怎么把模型存成文件、怎么加载回来预测、怎么做批量推理,以及断点续训的完整做法。
- 64CNN 入门:卷积和池化到底提取了什么
图像不能直接用全连接层处理——参数太多、丢失空间结构。CNN 用卷积提取局部特征,用池化压缩尺寸。这篇用最小代码讲清卷积核在做什么。
- 65图像数据怎样进入网络:通道、尺寸和批次
一张普通图片进入 PyTorch 后为什么会变成 [B, C, H, W]?这篇从 PIL、NumPy、Tensor、归一化和 DataLoader 出发,把图像送进 CNN 前的完整数据流讲清楚。
- 66第一个 CNN 图像分类训练项目
从数据增强、CNN、训练循环、验证指标到保存最佳权重,完整跑通一个 PyTorch 图像分类项目,并理解每一段代码为什么存在。
- 67图像分类错误分析:混淆矩阵与错误样本
准确率只能告诉你错了多少,混淆矩阵和错误样本才能告诉你错在哪里。这篇建立一套从类别指标、混淆矩阵到高置信度错误图的分析流程。
- 68深度学习项目标准模板:训练、验证、日志和配置
把散落在单文件里的 PyTorch 代码整理成可维护项目:配置、数据、模型、训练引擎、日志、检查点和推理各归其位,并保留可复现实验所需信息。
后续终局路线
当前更新主线之后,继续进入项目、NLP、Transformer、大模型、RAG、工作流、部署和毕业项目。
NLP 与序列模型
从文本编号进入 Embedding、FastText、RNN、LSTM 和文本生成,先理解序列模型的能力与局限。
第 69-78 篇学完能做到:能把中文文本处理成序列数据,用 FastText/RNN/LSTM 完成分类或字符级生成。
预告- Token 与词表
- Padding 与 Mask
- Embedding
- RNN/LSTM
Transformer 与 BERT
放慢 Attention 推导过程,从 RNN 的局限进入 Self-Attention、Transformer Encoder 和 BERT 分类。
第 79-90 篇学完能做到:能讲清 Self-Attention 的计算流程,并用 BERT 完成文本分类训练和推理。
预告- QKV
- Self-Attention
- Position Encoding
- BERT
大模型开发
从安全调用 API 开始,逐步掌握提示词、结构化输出、Few-shot、ReAct 和工具调用。
第 91-100 篇学完能做到:能写出稳定提示词模板,让模型按 JSON 返回结果,并实现一个能调用外部工具的对话助手。
预告- 模型 API
- 流式输出
- 结构化输出
- Tool Calling
RAG 与知识库
掌握从文档进入知识库到检索、重排、引用回答和评估的完整流程。
第 101-110 篇学完能做到:能从 PDF/Markdown 出发完成切分、向量化、检索、重排和带引用回答,并用测试集评估质量。
预告- Chunk
- Embedding
- 向量数据库
- RAG 评估
Dify / RAGFlow
围绕 AI 应用工程问题拆解工具,不写成按钮说明,而是解释工作流如何解决真实问题。
第 111-116 篇学完能做到:能设计 Dify 工作流,处理变量流和节点依赖,并配置知识检索减少无依据回答。
预告- 工作流
- 变量流
- 知识检索
- 权限与日志
部署与优化
先完成应用服务化,再用通俗方式理解模型压缩,最后把模型变成能给别人用的服务。
第 117-125 篇学完能做到:能把模型打包成 Docker API 服务,并根据设备和业务目标选择模型压缩方案。
预告- Streamlit/Flask
- Docker
- 量化
- 蒸馏
综合毕业项目
综合项目不无限拉长。每个项目都有毕业标准,完成 6 个方向中的任意 3 个,即视为整条路线毕业。
第 126+ 篇学完能做到:能交付至少 3 个完整 AI 项目作品,覆盖训练、评估、服务化、知识库或工作流自动化。
毕业项目- 中文文本分类系统
- BERT 服务
- 企业知识库
- Dify 工作流
综合毕业项目
路线不是无限追更。下面 6 个方向任选完成 3 个,即视为整条 AI 学习路线毕业。
从训练到部署的中文文本分类系统
3 篇完成训练、评估、保存、Flask API 与 Docker 部署,跑通测试集并输出指标报告。
BERT 文本分类、模型压缩与 API 服务
3 篇完成 BERT 训练、量化和 API 服务,对比压缩前后的延迟、显存与 F1。
带引用和评估的企业知识库问答系统
4 篇完成文档加载、切分、检索、重排、引用回答和评估,用至少 20 条测试集验证质量。
Dify + RAGFlow 法律知识助手
3 篇完成知识库配置、工作流编排、引用回答、密钥与日志,跑通真实法律问答场景。
简历评估与面试题生成工作流
2 篇完成简历输入、结构化抽取、岗位匹配和面试题生成,覆盖至少 3 个岗位模板。
音频转文字与内容整理工作流
2 篇完成音频输入、ASR、摘要和结构化输出,处理至少 3 种音频样本。
长期内容板块
学习路线负责先后顺序,内容板块负责长期归档和查找。
AI 从零开始
先认识 AI 的边界和基本地图,再决定从哪里开始学。
零基础机器学习基础
理解任务、数据、评价指标以及模型为什么会学偏。
零基础深度学习原理
从神经网络出发,理解激活、误差和参数更新。
初级PyTorch 入门
把概念放进代码,独立写出一条可以运行的训练流程。
初级传统机器学习基础
从项目流程、数据清洗、特征工程和数值缩放开始,补齐进入算法之前的数据基本功。
初级项目实战
用真实项目串起数据、模型、接口和复盘。
项目实战大模型与应用
沿着 RNN、Attention 和 Transformer 进入大模型应用。
进阶博客与学习记录
记录写作系统、博客建设和持续学习的方法。
持续更新接下来更新什么
这里只展示近期准备写的选题队列,不承诺固定日期;完成一篇后继续滚动调整。