保存与加载文本分类模型:让预测可以复用

学会保存完整 Pipeline、标签信息和项目元数据,让文本分类模型不只停留在 notebook 里。

学习路线:文本分类项目(35~42) · 第 41 课
第 41 课训练好的文本分类 Pipeline 被保存成模型文件,再加载用于新文本预测。
Learning Path

文本分类项目(35~42)

重新拆解中文文本分类链路,从编码清洗、分词、向量化、评估、保存一路做到演示页面。

学完本阶段你能做到:从一份原始中文文本出发,独立完成清洗、分词、向量化、训练、评估、保存和演示页面,并能解释每个环节为什么这么做。

推荐读法:如果已经吃透第 19-20 课,可按薄弱环节跳读;否则建议顺序阅读。

查看完整阶段 · 8 篇
Lesson Guide

这一课怎么学

先看目标,再带着问题读正文。读完后用练习确认自己真的理解了。

本节你会学到

  • 说清楚「保存与加载文本分类模型:让预测可以复用」解决的核心问题
  • 知道它在「文本分类项目(35~42)」中的位置
  • 把 Pipeline、分类与回归、机器学习 这些关键词联系起来

前置知识

  • 建议先读完上一篇:文本分类模型评估:从混淆矩阵找到改进方向
  • 能区分输入、输出、数据和模型目标。

概念回顾

  • 【Pipeline】Pipeline 让项目不再散落成一堆临时代码,也能减少训练和预测时步骤不一致的问题。 前面或后面会反复用到它。
  • 【分类与回归】判断邮件是不是垃圾邮件是分类,预测房价是多少是回归。 前面或后面会反复用到它。
  • 【机器学习】机器学习的重点不是手写所有规则,而是准备数据、定义目标,让模型自己找到可复用的模式。 前面或后面会反复用到它。
  • 【监督学习】如果训练数据里有“题目”和“答案”,模型学会以后再给它新题目,它就尝试给出答案。 前面或后面会反复用到它。

常见误区

  • 不要只记定义,要追问它解决了什么问题。
  • 不要把概念孤立背下来,要放回数据到结果的完整链路里。

课后练习

  • 用 3 句话向一个零基础朋友解释「保存与加载文本分类模型:让预测可以复用」。
  • 打开概念库里的「Pipeline」,补一遍它和本文的关系。
  • 读下一课「用 Streamlit 给文本分类模型做一个演示页面」前,先写下你认为它会解决的问题。

自检练习与参考答案

1. 这个环节的输入和输出分别是什么?

项目文要先说清数据流。输入通常是原始数据或上一步结果,输出必须能被下一步稳定复用。

2. 如果训练和预测效果对不上,优先排查哪件事?

优先排查预处理是否一致,例如分词、TF-IDF 词表、标签映射、标准化器是否沿用训练阶段的同一套对象。

3. 为什么项目文章不能只看最终分数?

因为真实项目还要看数据质量、错误样本、部署入口、复用方式和失败边界。

下一步建议读「用 Streamlit 给文本分类模型做一个演示页面」。

模型训练出来以后,如果每次预测都要重新训练一遍,就还没有进入真实项目状态。

真实项目更常见的流程是:训练一次,保存下来;下次启动程序时加载模型,直接对新文本做预测。

第 41 课视频 · 保存与加载文本分类模型:让预测可以复用

要保存什么

文本分类项目里,最容易犯的错误是只保存分类器:

joblib.dump(model, "model.joblib")

这通常不够。因为模型依赖前面的 TF-IDF 词表和 IDF 权重。

更稳的做法是保存完整 Pipeline:

TfidfVectorizer
  + LogisticRegression
  = text_classifier_pipeline.joblib

这样加载后,模型知道应该用哪套词表、哪套参数、哪种特征空间。

保存完整 Pipeline

假设上一课已经训练好了 pipe

import joblib

joblib.dump(pipe, "text_classifier_pipeline.joblib")

保存成功后,会得到一个模型文件。它里面包含:

  1. TF-IDF 的词表;
  2. IDF 权重;
  3. 模型参数;
  4. Pipeline 步骤顺序。

这比把向量化器和模型分开保存更不容易出错。

加载模型并预测

加载时很简单:

loaded_pipe = joblib.load("text_classifier_pipeline.joblib")

然后对新文本预测:

new_texts = [
    cut_text("这篇文章讲得很清楚"),
    cut_text("软件一直闪退,完全没法用"),
]

pred = loaded_pipe.predict(new_texts)
print(pred)

这里仍然要注意:如果训练阶段输入的是分词后的文本,预测阶段也要先分词。

封装成可复用函数

可以把加载和预测写成函数:

import joblib

MODEL_PATH = "text_classifier_pipeline.joblib"

def load_model():
    return joblib.load(MODEL_PATH)

def predict_texts(model, texts):
    cut_texts = [cut_text(text) for text in texts]
    return model.predict(cut_texts)

model = load_model()
labels = predict_texts(model, ["这个功能很好用"])
print(labels)

这样以后无论是命令行、网页接口,还是 Streamlit 页面,都可以复用这套逻辑。

如果想输出置信度

很多分类器支持 predict_proba()

proba = loaded_pipe.predict_proba(new_texts)
print(proba)

它会输出每个类别的概率估计。

不过要记住:概率不一定等于真实可信度。尤其是数据少、类别不平衡、模型没校准时,概率只能作为参考。

保存标签和元数据

除了模型文件,建议额外保存一份元数据:

import json

meta = {
    "model_name": "tfidf_logistic_regression",
    "version": "v1.0",
    "labels": list(loaded_pipe.classes_),
    "created_at": "2026-07-01",
    "text_format": "jieba_cut_with_space",
}

with open("model_meta.json", "w", encoding="utf-8") as f:
    json.dump(meta, f, ensure_ascii=False, indent=2)

元数据能帮你在几个月后快速知道:这个模型是谁训练的、用的什么输入格式、支持哪些标签。

常见踩坑

只保存模型,没保存向量化器

预测时会丢失词表,导致新文本无法转成和训练时一致的特征。

训练和预测分词规则不同

训练时用 jieba,预测时直接传原句,模型效果会明显不稳定。

路径写死

本地能跑,部署到服务器后找不到文件。建议统一使用配置项或相对项目根目录的路径。

依赖版本变化

joblib 保存的是 Python 对象。跨环境加载时,最好记录 scikit-learn、jieba、Python 的版本。

import sklearn
import jieba
import sys

print(sys.version)
print(sklearn.__version__)

一个最小目录结构

实际项目可以这样组织:

text-classifier/
  train.py
  predict.py
  models/
    text_classifier_pipeline.joblib
    model_meta.json

train.py 负责训练并保存模型,predict.py 负责加载模型并预测。

这样代码职责会更清楚。

这一课先记住

文本分类模型要能复用,保存的重点不是“分类器对象”,而是“完整预测链路”。

更稳的顺序是:

训练 Pipeline
  -> 评估效果
  -> 保存完整 Pipeline
  -> 保存标签和元数据
  -> 加载模型
  -> 对新文本预测

到这里,中文文本分类项目已经形成闭环。下一阶段我们回到 PyTorch,理解模型训练背后的自动微分机制。

Discussion

留言讨论