从零开始,不跳步骤

AI 学习路线

先建立 AI 的整体地图,再理解模型怎样学习,最后把概念放进代码和项目。你不需要一次看懂所有公式,只需要沿着顺序把每个问题解决掉。

68篇已发布课程
5个当前学习阶段
8个长期内容板块

按阶段学习

每一阶段都要回答三个问题:为什么现在学、学完能做什么、下一步走向哪里。

阶段一

AI 入门与 PyTorch 基础(1~20)

零基础

从 AI 基本概念、机器学习任务、深度学习直觉、PyTorch 入门到中文文本分类项目全貌。

阶段定位:这是整条路线的入门底座。前 18 篇负责建立 AI、机器学习、深度学习和 PyTorch 训练流程的基本认知,第 19-20 篇负责让读者先看见一个中文文本分类项目怎样端到端跑起来。

学完本阶段你能做到:能说清 AI、机器学习、深度学习、PyTorch 训练流程和一个中文文本分类项目的大致链路。

推荐读法:零基础建议顺序阅读;已有基础的读者可以把它当作路线地图和查漏补缺清单。

已完成第 1-20 课
  1. 1
    什么是人工智能?从机器会做什么开始理解 AI

    AI 不是会思考的魔法,而是一类让机器完成感知、判断、生成和行动任务的方法与系统。

  2. 2
    AI、机器学习、深度学习和生成式 AI 有什么区别?

    用一张由大到小的知识地图,讲清 AI、ML、DL 和生成式 AI 之间的包含与交叉关系。

  3. 3
    监督学习与无监督学习是什么?关键区别在有没有答案

    监督学习用带答案的数据学习预测,无监督学习则从没有答案的数据中寻找结构和规律。

  4. 4
    分类和回归有什么区别?先看模型要预测什么

    分类预测离散类别,回归预测连续数值。任务类型会直接决定输出层、损失函数和评价指标。

  5. 5
    特征、标签和数据集是什么?模型到底从什么里面学习

    样本是一条完整记录,特征是提供给模型的信息,标签是监督学习希望模型预测的答案。

  6. 6
    训练集、验证集和测试集分别做什么?

    训练集用于学习参数,验证集用于选择方案,测试集只在最后评估一次模型的真实泛化能力。

  7. 7
    准确率、精确率、召回率和 F1 到底怎么看?

    从混淆矩阵出发理解四个分类指标,并根据漏判和误判的实际代价选择评价标准。

  8. 8
    过拟合、欠拟合和数据泄漏是什么?

    欠拟合是规律没学会,过拟合是只记住训练数据,数据泄漏则让模型提前看到了不该知道的信息。

  9. 9
    神经网络到底是什么?一篇给 AI 初学者的入门解释

    不从公式开始,而是从“机器怎样学会判断”这件事讲起,把神经网络、神经元、参数、训练和预测串成一条清楚的线。

  10. 10
    激活函数是什么?为什么神经网络不能没有它

    激活函数让神经网络拥有非线性表达能力。没有它,再多层网络也可能只是一个更复杂的线性模型。

  11. 11
    损失函数是什么?模型为什么要算自己错多少

    损失函数像训练过程里的成绩单,告诉模型预测结果和真实答案之间差了多少。

  12. 12
    梯度下降算法是什么?参数到底怎么一步步更新

    梯度下降可以理解成沿着损失函数的坡度往低处走,目标是找到让模型错误更小的参数。

  13. 13
    CrossEntropyLoss 详解:分类任务为什么常用它

    CrossEntropyLoss 常用于分类任务,它关注的不只是模型有没有猜对,还关注模型对正确类别有多自信。

  14. 14
    前向传播与反向传播到底在做什么?

    用“预测、算错、追责、更新”串起一次神经网络训练,并用最小 PyTorch 代码看清 forward、backward 和 step 的分工。

  15. 15
    Tensor 是什么?PyTorch 里最重要的对象讲清楚

    Tensor 可以理解成更通用的数组,它承载数据、参数和梯度,是 PyTorch 训练流程的基础。

  16. 16
    PyTorch 的 Linear 层详解:全连接层到底做了什么

    Linear 层本质上是一次线性变换,它把输入特征通过权重矩阵和偏置映射到新的输出空间。

  17. 17
    DataLoader 详解:批量读取、打乱、并行加载有什么用

    DataLoader 负责把数据按批次送进模型,并处理 shuffle、batch size 和多进程加载等训练细节。

  18. 18
    一个 PyTorch 模型训练的完整流程

    从准备数据、定义模型、选择损失函数和优化器,到训练循环和验证评估,把 PyTorch 训练主线串起来。

  19. 19
    从垃圾短信识别项目里,我复盘了一个中文文本分类系统

    一次从短信分类项目出发的复盘:从需求、流程到问题定位,再到后续可以继续优化的方向。

  20. 20
    我怎样把一个中文文本分类项目,从训练脚本一路做到了 API 和前端

    从 jieba 分词、TF-IDF 和随机森林开始,到 Flask 接口和 Streamlit 页面,这是一条更完整的中文文本分类落地链路。

阶段二

传统机器学习基础(21~34)

初级

补齐文本分类项目背后的数据处理、算法、评估和模型选择知识。

阶段定位:前面 1-20 篇已经见过梯度下降、损失函数和训练流程。现在退一步,用最简单的模型把“数据 → 训练 → 评估 → 选择”这条主线彻底走通。这是回顾加深,不是突然倒车。

学完本阶段你能做到:拿到一份结构化表格数据,独立完成清洗、特征工程、建模、评估、模型选择和保存,并用规范流程比较多个算法。

推荐读法:建议系统读。做项目时遇到数据和模型选择问题,也可以按需回查。

已完成第 21-34 课
  1. 21
    机器学习项目的完整流程:从原始数据到模型预测

    一个机器学习项目不是从训练模型开始,而是从定义问题、整理数据、训练评估到上线预测的一整条链路。

  2. 22
    数据清洗第一课:缺失值、重复值和异常值怎么处理

    数据清洗不是把数据改漂亮,而是识别缺失、重复、异常和格式问题,让模型拿到可靠的输入。

  3. 23
    Pandas 数据清洗实战:把混乱表格变成可训练数据

    用一个小型表格案例串起读取数据、检查缺失、去重、处理异常值、编码类别特征和导出干净数据的流程。

  4. 24
    特征工程是什么?模型为什么不能直接理解原始数据

    特征工程不是随便增加几列,而是把原始业务数据整理成模型能稳定学习的信号。

  5. 25
    类别特征如何处理:Label Encoding 与 One-Hot Encoding

    Label Encoding 和 One-Hot Encoding 都能把类别变成数字,但它们表达的含义完全不同。

  6. 26
    数据标准化和归一化有什么区别

    标准化和归一化都在处理数值尺度问题,但一个看均值方差,一个看最大最小值。

  7. 27
    线性回归:模型怎样用一条线预测连续数值

    从房价预测出发,理解线性回归的输入、输出、误差和第一个 scikit-learn 实现。

  8. 28
    回归模型怎样评估:MAE、MSE、RMSE 和 R²

    用同一组测试数据理解四个常用回归指标,并根据业务代价选择正确的评价方式。

  9. 29
    逻辑回归为什么叫回归,却用来做分类

    理解线性分数、Sigmoid、概率和阈值,跑通第一个二分类逻辑回归示例。

  10. 30
    KNN 分类:让距离最近的样本帮忙投票

    理解 K 近邻算法的核心思想、距离度量、K 值选择、特征缩放和 sklearn 训练流程。

  11. 31
    决策树是什么?模型怎样一步步做判断

    从分支节点、叶节点、基尼系数、信息增益和 max_depth 入手,理解决策树分类模型。

  12. 32
    随机森林为什么比单棵树更稳

    理解随机森林的 Bagging 思想、有放回抽样、随机特征选择、投票机制和常用参数。

  13. 33
    集成学习入门:Bagging、Boosting 到底在组合什么

    从多个模型共同决策的直觉出发,理解 Bagging、Boosting、随机森林和梯度提升模型的基本区别。

  14. 34
    模型评估与交叉验证:不要只相信一次划分

    理解训练集、验证集、测试集、交叉验证、平均分和波动,避免用一次随机划分误判模型能力。

阶段三

文本分类项目(35~42)

项目实战

重新拆解中文文本分类链路,从编码清洗、分词、向量化、评估、保存一路做到演示页面。

阶段定位:第 19-20 篇是端到端体验,本阶段是逐环节吃透。不是重讲,而是把中文文本分类的每个关键步骤拆开、讲透、能复用。

学完本阶段你能做到:从一份原始中文文本出发,独立完成清洗、分词、向量化、训练、评估、保存和演示页面,并能解释每个环节为什么这么做。

推荐读法:如果已经吃透第 19-20 课,可按薄弱环节跳读;否则建议顺序阅读。

已完成第 35-42 课
  1. 35
    计算机怎样读取中文文本:编码、清洗与标准化

    进入中文文本分类前,先理解文本文件编码、乱码、空白符、标点、大小写和基础清洗规则。

  2. 36
    中文分词与停用词:让模型先读懂文本边界

    理解中文分词为什么重要,停用词应该怎么用,以及在文本分类项目里如何把句子切成可建模的词。

  3. 37
    词袋模型与 CountVectorizer:文本也可以做特征表

    从词袋模型开始理解文本向量化,学习 CountVectorizer 如何把分词后的中文文本变成可训练的特征矩阵。

  4. 38
    TF-IDF 是什么?把中文文本变成模型能读的数字

    从词频和逆文档频率出发,理解 TF-IDF 为什么适合文本分类,以及如何在 sklearn 中使用 TfidfVectorizer。

  5. 39
    训练中文文本分类 baseline:TF-IDF + 逻辑回归

    用 TF-IDF 和 LogisticRegression 跑通一个中文文本分类基线模型,理解从分词、划分数据到训练预测的完整流程。

  6. 40
    文本分类模型评估:从混淆矩阵找到改进方向

    学会用 classification_report、confusion_matrix 和错分样本分析文本分类模型,不只看准确率。

  7. 41
    保存与加载文本分类模型:让预测可以复用

    学会保存完整 Pipeline、标签信息和项目元数据,让文本分类模型不只停留在 notebook 里。

  8. 42
    用 Streamlit 给文本分类模型做一个演示页面

    把已经训练好的文本分类 Pipeline 接到 Streamlit 页面里,完成输入文本、预测类别和查看置信度的交互演示。

阶段四

PyTorch 深度学习基础(43~58)

初级

在前 20 篇 PyTorch 入门上继续深化,补齐张量操作、自动微分、优化器家族和训练排错能力。

阶段定位:本阶段补齐实际训练需要的张量操作、自动微分、优化器家族和训练排错能力。它决定你能不能独立读懂任何 PyTorch 训练脚本,并诊断常见训练问题。

学完本阶段你能做到:独立搭建一个 PyTorch 训练脚本,正确处理 Shape、device、梯度清空、优化器选择和学习率策略,并能根据 loss/accuracy 曲线诊断训练问题。

推荐读法:当前更新主线,建议跟更;每篇都要配合代码自检。

已完成第 43-58 课
  1. 43
    Tensor 进阶:dtype、device、索引和切片

    补齐 PyTorch 实际训练中最常用的 Tensor 操作:数据类型、设备迁移、索引、切片和布尔筛选。

  2. 44
    PyTorch 自动微分是什么?理解 requires_grad 和 backward

    从一个最小例子理解 PyTorch 如何记录计算过程、自动求梯度,以及为什么训练前要清空梯度。

  3. 45
    计算图与梯度累积:为什么训练前必须清空梯度

    你写了 optimizer.zero_grad() 却不知道为什么要写。这一篇把 PyTorch 的动态计算图、叶子节点和梯度累积机制讲透,让你彻底明白"清梯度"不是仪式,是物理必然。

  4. 46
    Shape 是深度学习最重要的数据契约

    深度学习代码 80% 的报错都是 Shape 不匹配。但 Shape 不只是维度对齐,它是模型每一层之间的数据契约。这篇把 batch、特征、类别维度和常见的 Shape 流水线一次讲透。

  5. 47
    reshape、view、transpose 和广播机制怎么选:张量形状转换实战

    reshape 和 view 看起来一样,transpose 和 permute 也像兄弟,广播机制报错信息又长又看不懂。这篇用最小代码讲清它们的区别,让你不再瞎试。

  6. 48
    自定义 Dataset:怎样封装自己的训练数据

    PyTorch 内置数据集只够入门练手。真实项目里你的数据可能是 CSV、文件夹图片、JSON 文本——这时候必须自己写 Dataset。这篇把 __len__ 和 __getitem__ 讲透,附带三个真实场景。

  7. 49
    DataLoader 进阶:batch、shuffle 与并行加载怎样影响训练效率

    第 17 篇你学了 DataLoader 的基本用法。但 batch_size 调多大、shuffle 为什么必须开、num_workers 设几、drop_last 有什么用——这些细节决定训练是 5 分钟还是 5 小时。

  8. 50
    nn.Module 详解:模型为什么要继承这个类

    所有 PyTorch 模型都继承 nn.Module。但你可能不知道,它帮你做了参数注册、子模块管理、train/eval 切换、设备迁移四件大事。这篇把 nn.Module 的黑盒拆开。

  9. 51
    权重、偏置和参数初始化会怎样影响训练

    把所有权重初始化成 0,模型直接学不动。初始化成太大的随机数,梯度爆炸。初始化是训练的起跑线,起跑线错了后面全白费。这篇讲清为什么初始化重要、常见方法怎么选。

  10. 52
    SGD 与 Momentum:最基础的优化器怎样更新参数

    梯度下降是所有优化器的祖宗。SGD 是最朴素的实现,Momentum 加了惯性。搞懂这两个,才能理解后面 Adam 在"智能"什么。

  11. 53
    AdaGrad 与 RMSProp:学习率如何自动调整

    SGD 给所有参数同一个学习率。但有些参数变化剧烈、有些几乎不动,统一步长不合理。AdaGrad 和 RMSProp 让每个参数有自己的自适应学习率。

  12. 54
    Adam 和 AdamW 为什么成为常用选择

    Adam 把 Momentum 的"方向惯性"和 RMSProp 的"自适应步长"合体,开箱即用。AdamW 修复了 Adam 权重衰减的耦合 bug,成为 Transformer 的标配。

  13. 55
    学习率决定什么:衰减策略与训练曲线

    学习率是训练里最敏感的超参数——太大 loss 爆炸,太小 loss 不动。这篇讲清怎么判断学习率过大过小,以及 StepLR、CosineAnnealing 等衰减策略怎么选。

  14. 56
    PyTorch GPU 训练:模型和数据如何放到同一设备

    RuntimeError: Expected all tensors to be on the same device —— 这是你用 GPU 训练时最常遇到的报错。模型在 GPU、数据在 CPU,它们碰不到一起。这篇讲清设备迁移的完整流程。

  15. 57
    正则化、Dropout 与 Early Stopping:防止过拟合的方法地图

    模型训练集准确率 99%,测试集只有 70%——这是过拟合。Weight Decay、Dropout、Early Stopping、数据增强怎么选?这篇建立完整的正则化方法地图。

  16. 58
    怎样根据 loss、accuracy 和梯度诊断训练问题

    训练 loss 不降?降了又升?训练好测试差?这篇把前面所有训练知识串成一套系统化的诊断流程,让你看曲线就知道问题在哪。

阶段五

深度学习项目

项目实战

通过回归、二维分类、表格分类和图像分类项目,把 Dataset、模型、损失、优化器、评估和推理串起来。

阶段定位:前面阶段已经补齐 PyTorch 训练脚本和诊断能力。本阶段开始把知识放进完整项目里,让读者从数据到推理形成可复用的工程流程。

学完本阶段你能做到:能独立完成一个完整深度学习项目,从数据到推理全流程,并整理出可复用的项目目录结构。

推荐读法:建议顺序阅读并同步跑代码;每个项目都要形成可复用目录。

更新中第 59-68 课
  1. 59
    PyTorch 线性回归项目:从造数据到预测

    前面 14 篇学了原理,现在第一次完整跑一个深度学习项目——从造数据、建模型、训练到预测。用最简单的线性回归,把全流程跑通。

  2. 60
    从零搭建二维分类神经网络:模型到底怎么分开两类点

    线性回归是连续预测,分类是离散判断。这篇从零搭建一个二分类神经网络,用二维数据让你能"看到"模型怎么把两类点分开。

  3. 61
    决策边界可视化:模型到底学出了什么

    准确率 99% 但不知道模型怎么分的?这篇把分类模型的决策边界画出来,让你亲眼看到模型在二维空间画了一条什么形状的分界线。

  4. 62
    表格分类项目:从 CSV 到神经网络预测

    前面用造的数据练手,这次用真实 CSV 表格数据。从读取、预处理、模型搭建到训练评估,走完表格分类的完整流程。

  5. 63
    模型保存、加载和批量推理实战

    训练好的模型不能只活在内存里。这篇讲清怎么把模型存成文件、怎么加载回来预测、怎么做批量推理,以及断点续训的完整做法。

  6. 64
    CNN 入门:卷积和池化到底提取了什么

    图像不能直接用全连接层处理——参数太多、丢失空间结构。CNN 用卷积提取局部特征,用池化压缩尺寸。这篇用最小代码讲清卷积核在做什么。

  7. 65
    图像数据怎样进入网络:通道、尺寸和批次

    一张普通图片进入 PyTorch 后为什么会变成 [B, C, H, W]?这篇从 PIL、NumPy、Tensor、归一化和 DataLoader 出发,把图像送进 CNN 前的完整数据流讲清楚。

  8. 66
    第一个 CNN 图像分类训练项目

    从数据增强、CNN、训练循环、验证指标到保存最佳权重,完整跑通一个 PyTorch 图像分类项目,并理解每一段代码为什么存在。

  9. 67
    图像分类错误分析:混淆矩阵与错误样本

    准确率只能告诉你错了多少,混淆矩阵和错误样本才能告诉你错在哪里。这篇建立一套从类别指标、混淆矩阵到高置信度错误图的分析流程。

  10. 68
    深度学习项目标准模板:训练、验证、日志和配置

    把散落在单文件里的 PyTorch 代码整理成可维护项目:配置、数据、模型、训练引擎、日志、检查点和推理各归其位,并保留可复现实验所需信息。

复盘

每完成一个阶段,都用阶段总结、概念地图和自检练习做一次回收,避免一路学一路忘。

查看阶段总结

后续终局路线

当前更新主线之后,继续进入项目、NLP、Transformer、大模型、RAG、工作流、部署和毕业项目。

阶段六

NLP 与序列模型

从文本编号进入 Embedding、FastText、RNN、LSTM 和文本生成,先理解序列模型的能力与局限。

第 69-78 篇

学完能做到:能把中文文本处理成序列数据,用 FastText/RNN/LSTM 完成分类或字符级生成。

预告
  • Token 与词表
  • Padding 与 Mask
  • Embedding
  • RNN/LSTM
阶段七

Transformer 与 BERT

放慢 Attention 推导过程,从 RNN 的局限进入 Self-Attention、Transformer Encoder 和 BERT 分类。

第 79-90 篇

学完能做到:能讲清 Self-Attention 的计算流程,并用 BERT 完成文本分类训练和推理。

预告
  • QKV
  • Self-Attention
  • Position Encoding
  • BERT
阶段八

大模型开发

从安全调用 API 开始,逐步掌握提示词、结构化输出、Few-shot、ReAct 和工具调用。

第 91-100 篇

学完能做到:能写出稳定提示词模板,让模型按 JSON 返回结果,并实现一个能调用外部工具的对话助手。

预告
  • 模型 API
  • 流式输出
  • 结构化输出
  • Tool Calling
阶段九

RAG 与知识库

掌握从文档进入知识库到检索、重排、引用回答和评估的完整流程。

第 101-110 篇

学完能做到:能从 PDF/Markdown 出发完成切分、向量化、检索、重排和带引用回答,并用测试集评估质量。

预告
  • Chunk
  • Embedding
  • 向量数据库
  • RAG 评估
阶段十

Dify / RAGFlow

围绕 AI 应用工程问题拆解工具,不写成按钮说明,而是解释工作流如何解决真实问题。

第 111-116 篇

学完能做到:能设计 Dify 工作流,处理变量流和节点依赖,并配置知识检索减少无依据回答。

预告
  • 工作流
  • 变量流
  • 知识检索
  • 权限与日志
阶段十一

部署与优化

先完成应用服务化,再用通俗方式理解模型压缩,最后把模型变成能给别人用的服务。

第 117-125 篇

学完能做到:能把模型打包成 Docker API 服务,并根据设备和业务目标选择模型压缩方案。

预告
  • Streamlit/Flask
  • Docker
  • 量化
  • 蒸馏
阶段十二

综合毕业项目

综合项目不无限拉长。每个项目都有毕业标准,完成 6 个方向中的任意 3 个,即视为整条路线毕业。

第 126+ 篇

学完能做到:能交付至少 3 个完整 AI 项目作品,覆盖训练、评估、服务化、知识库或工作流自动化。

毕业项目
  • 中文文本分类系统
  • BERT 服务
  • 企业知识库
  • Dify 工作流

综合毕业项目

路线不是无限追更。下面 6 个方向任选完成 3 个,即视为整条 AI 学习路线毕业。

01

从训练到部署的中文文本分类系统

3 篇

完成训练、评估、保存、Flask API 与 Docker 部署,跑通测试集并输出指标报告。

02

BERT 文本分类、模型压缩与 API 服务

3 篇

完成 BERT 训练、量化和 API 服务,对比压缩前后的延迟、显存与 F1。

03

带引用和评估的企业知识库问答系统

4 篇

完成文档加载、切分、检索、重排、引用回答和评估,用至少 20 条测试集验证质量。

04

Dify + RAGFlow 法律知识助手

3 篇

完成知识库配置、工作流编排、引用回答、密钥与日志,跑通真实法律问答场景。

05

简历评估与面试题生成工作流

2 篇

完成简历输入、结构化抽取、岗位匹配和面试题生成,覆盖至少 3 个岗位模板。

06

音频转文字与内容整理工作流

2 篇

完成音频输入、ASR、摘要和结构化输出,处理至少 3 种音频样本。

长期内容板块

学习路线负责先后顺序,内容板块负责长期归档和查找。

按板块看文章
01

AI 从零开始

先认识 AI 的边界和基本地图,再决定从哪里开始学。

零基础
02

机器学习基础

理解任务、数据、评价指标以及模型为什么会学偏。

零基础
03

深度学习原理

从神经网络出发,理解激活、误差和参数更新。

初级
04

PyTorch 入门

把概念放进代码,独立写出一条可以运行的训练流程。

初级
05

传统机器学习基础

从项目流程、数据清洗、特征工程和数值缩放开始,补齐进入算法之前的数据基本功。

初级
06

项目实战

用真实项目串起数据、模型、接口和复盘。

项目实战
07

大模型与应用

沿着 RNN、Attention 和 Transformer 进入大模型应用。

进阶
08

博客与学习记录

记录写作系统、博客建设和持续学习的方法。

持续更新

接下来更新什么

这里只展示近期准备写的选题队列,不承诺固定日期;完成一篇后继续滚动调整。

下一篇

文本怎样变成编号:语料、Token 和词表

阶段六:NLP 与序列模型
后续

从词到 ID:构建词表映射和未知词机制

阶段六:NLP 与序列模型
规划中

变长文本怎样组成 batch:Padding、截断与 Mask

阶段六:NLP 与序列模型