
用 Streamlit 给文本分类模型做一个演示页面
把已经训练好的文本分类 Pipeline 接到 Streamlit 页面里,完成输入文本、预测类别和查看置信度的交互演示。
和「机器学习」相关的文章都收在这里,方便沿着同一个主题继续读下去。
同一主题下的内容,会更容易看出思路是怎么慢慢长出来的。

把已经训练好的文本分类 Pipeline 接到 Streamlit 页面里,完成输入文本、预测类别和查看置信度的交互演示。

从多个模型共同决策的直觉出发,理解 Bagging、Boosting、随机森林和梯度提升模型的基本区别。

学会保存完整 Pipeline、标签信息和项目元数据,让文本分类模型不只停留在 notebook 里。

学会用 classification_report、confusion_matrix 和错分样本分析文本分类模型,不只看准确率。

用 TF-IDF 和 LogisticRegression 跑通一个中文文本分类基线模型,理解从分词、划分数据到训练预测的完整流程。

从词袋模型开始理解文本向量化,学习 CountVectorizer 如何把分词后的中文文本变成可训练的特征矩阵。

从词频和逆文档频率出发,理解 TF-IDF 为什么适合文本分类,以及如何在 sklearn 中使用 TfidfVectorizer。

理解中文分词为什么重要,停用词应该怎么用,以及在文本分类项目里如何把句子切成可建模的词。

理解训练集、验证集、测试集、交叉验证、平均分和波动,避免用一次随机划分误判模型能力。

理解随机森林的 Bagging 思想、有放回抽样、随机特征选择、投票机制和常用参数。

从分支节点、叶节点、基尼系数、信息增益和 max_depth 入手,理解决策树分类模型。

理解 K 近邻算法的核心思想、距离度量、K 值选择、特征缩放和 sklearn 训练流程。

理解线性分数、Sigmoid、概率和阈值,跑通第一个二分类逻辑回归示例。

用同一组测试数据理解四个常用回归指标,并根据业务代价选择正确的评价方式。

从房价预测出发,理解线性回归的输入、输出、误差和第一个 scikit-learn 实现。

标准化和归一化都在处理数值尺度问题,但一个看均值方差,一个看最大最小值。

Label Encoding 和 One-Hot Encoding 都能把类别变成数字,但它们表达的含义完全不同。

特征工程不是随便增加几列,而是把原始业务数据整理成模型能稳定学习的信号。

数据清洗不是把数据改漂亮,而是识别缺失、重复、异常和格式问题,让模型拿到可靠的输入。

一个机器学习项目不是从训练模型开始,而是从定义问题、整理数据、训练评估到上线预测的一整条链路。

用一张由大到小的知识地图,讲清 AI、ML、DL 和生成式 AI 之间的包含与交叉关系。

监督学习用带答案的数据学习预测,无监督学习则从没有答案的数据中寻找结构和规律。

分类预测离散类别,回归预测连续数值。任务类型会直接决定输出层、损失函数和评价指标。

样本是一条完整记录,特征是提供给模型的信息,标签是监督学习希望模型预测的答案。

训练集用于学习参数,验证集用于选择方案,测试集只在最后评估一次模型的真实泛化能力。

从混淆矩阵出发理解四个分类指标,并根据漏判和误判的实际代价选择评价标准。

欠拟合是规律没学会,过拟合是只记住训练数据,数据泄漏则让模型提前看到了不该知道的信息。