ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

《随机森林》知识点总结

《随机森林》知识点总结 一、基本定义随机森林是Bagging自助聚合框架下的集成监督学习算法可完成分类、回归任务结构化/图像、文本等非结构化数据集都适用。核心思路不依赖单个模型训练大量决策树基学习器/弱模型共同预测结果。分类任务所有树投票选出最终类别回归任务所有树输出结果取平均值二、训练核心步骤1、有放回采样Bootstrap 自助采样从原始数据集中有放回抽样生成多个独立的数据子集分别用来训练每一棵决策树。目的保证基学习器之间既有一部分公共知识又拥有差异性多样性。额外增加随机特征选择每棵树再随机挑选部分特征训练进一步提升树之间的差异化。集成效果前提单个弱学习器准确率只需要大于 0.5 即可不是要求单棵树精度极高。2、为什么多棵树组合之后整体性能会变好不同决策树对噪声、异常样本敏感度不一样可以互相抵消一部分错误提升鲁棒性。每一棵树会学到数据集里面不一样的特征和内在模式多个模型融合覆盖更多情况。举例单棵树准确率 0.6。3棵树至少2棵预测正确 →整体准确率0.6485棵树至少3棵预测正确 →整体准确率0.6837棵树至少4棵预测正确 →整体准确率0.710树不是越多越好数量过大容易造成过拟合模型学习到噪声。三、OOB袋外估计Out‑of‑Bag定义自助有放回采样的时候原始训练集里面一部分样本不会被抽到这部分样本叫做袋外样本。可以直接拿袋外样本评估当前树的泛化性能。优点不需要单独划分验证集就能大致评估模型泛化能力。局限性只是近似估计不能完全代替独立验证集。注意细节1. 样本没有出现在某一棵树 OOB 集仍然能够参与整体 OOB 得分运算2. 基学习器太少部分样本无法参与 OOB 评分计算。四、整体流程速记原始数据集 →自助采样生成多个子集 随机选特征 →训练一堆独立决策树 →预测阶段投票/平均输出结果 →OOB 样本评估模型效果
返回列表