
集成学习入门:Bagging、Boosting 到底在组合什么
从多个模型共同决策的直觉出发,理解 Bagging、Boosting、随机森林和梯度提升模型的基本区别。
和「scikit-learn」相关的文章都收在这里,方便沿着同一个主题继续读下去。
同一主题下的内容,会更容易看出思路是怎么慢慢长出来的。

从多个模型共同决策的直觉出发,理解 Bagging、Boosting、随机森林和梯度提升模型的基本区别。

从词频和逆文档频率出发,理解 TF-IDF 为什么适合文本分类,以及如何在 sklearn 中使用 TfidfVectorizer。

理解训练集、验证集、测试集、交叉验证、平均分和波动,避免用一次随机划分误判模型能力。

理解随机森林的 Bagging 思想、有放回抽样、随机特征选择、投票机制和常用参数。

从分支节点、叶节点、基尼系数、信息增益和 max_depth 入手,理解决策树分类模型。

理解 K 近邻算法的核心思想、距离度量、K 值选择、特征缩放和 sklearn 训练流程。

理解线性分数、Sigmoid、概率和阈值,跑通第一个二分类逻辑回归示例。

用同一组测试数据理解四个常用回归指标,并根据业务代价选择正确的评价方式。

从房价预测出发,理解线性回归的输入、输出、误差和第一个 scikit-learn 实现。