
计算机怎样读取中文文本:编码、清洗与标准化
进入中文文本分类前,先理解文本文件编码、乱码、空白符、标点、大小写和基础清洗规则。
和「数据清洗」相关的文章都收在这里,方便沿着同一个主题继续读下去。
同一主题下的内容,会更容易看出思路是怎么慢慢长出来的。

进入中文文本分类前,先理解文本文件编码、乱码、空白符、标点、大小写和基础清洗规则。

标准化和归一化都在处理数值尺度问题,但一个看均值方差,一个看最大最小值。

用一个小型表格案例串起读取数据、检查缺失、去重、处理异常值、编码类别特征和导出干净数据的流程。

数据清洗不是把数据改漂亮,而是识别缺失、重复、异常和格式问题,让模型拿到可靠的输入。