
用 Streamlit 给文本分类模型做一个演示页面
把已经训练好的文本分类 Pipeline 接到 Streamlit 页面里,完成输入文本、预测类别和查看置信度的交互演示。
和「NLP」相关的文章都收在这里,方便沿着同一个主题继续读下去。
同一主题下的内容,会更容易看出思路是怎么慢慢长出来的。

把已经训练好的文本分类 Pipeline 接到 Streamlit 页面里,完成输入文本、预测类别和查看置信度的交互演示。

进入中文文本分类前,先理解文本文件编码、乱码、空白符、标点、大小写和基础清洗规则。

学会保存完整 Pipeline、标签信息和项目元数据,让文本分类模型不只停留在 notebook 里。

学会用 classification_report、confusion_matrix 和错分样本分析文本分类模型,不只看准确率。

用 TF-IDF 和 LogisticRegression 跑通一个中文文本分类基线模型,理解从分词、划分数据到训练预测的完整流程。

从词袋模型开始理解文本向量化,学习 CountVectorizer 如何把分词后的中文文本变成可训练的特征矩阵。

从词频和逆文档频率出发,理解 TF-IDF 为什么适合文本分类,以及如何在 sklearn 中使用 TfidfVectorizer。

理解中文分词为什么重要,停用词应该怎么用,以及在文本分类项目里如何把句子切成可建模的词。

从 jieba 分词、TF-IDF 和随机森林开始,到 Flask 接口和 Streamlit 页面,这是一条更完整的中文文本分类落地链路。

一次从短信分类项目出发的复盘:从需求、流程到问题定位,再到后续可以继续优化的方向。