一、摘要:非常清楚作者针对问题二做了什么?,如何进行?为什么?很详细
二、告诉评委我们使用Boosting算法的原因
这里我作为一名小白,拿到他的论文,第一眼我就知道他要什么,这是一个十分加分的做法,问题重述也简化了,简明扼要就是告诉评委我解决的问题。(这里加上问题背景,也很好)
再在问题分析,给出做法:
我以评委的视角,来读这一段,脑子里很清晰,他就是要用Boosting算法来对因素的影响进行分析。
三、给出梯度决策树(GBDT)的概念
四、两种算法解释较为完整,并不是直接使用,而是适当的进行讲述
五、给出XGBoost、LightGBM训练和参数优化过程
证明代码是自己跑出来的,是可以进行推敲的。这里拒绝AI一趟跑完,一定减分。记住AI跑出来的不是你的,但经过你的调整,更好更完整,它就是你的!
针对XGBoost的调整:
1、作者首先对这个值为树的最大深度以及最小叶子节点样本权重和这个组合进行调整。
最大深度控 制了树的结构,最小叶子节点样本权重这个参数用于避免过拟合。当它的值较大时,可以避免模 型学习到局部的特殊样本。但是如果这个值过高,会导致欠拟合。
这里看到文章中给出代码:遍历max_depth:3,5,7,9.min_child_weight:2,4,6.
2、对gamma进行调整,对树的保守程度测试。
3、对参数 subsample 和 colsample_bytree 进行调整。
subsample 控制对于每棵树的随机采样的 比例。减小这个参数的值,算法会更加保守,避免过拟合。但是,如果这个值设置得过小,它可 能会导致欠拟合。colsample_bytree 用来控制每棵随机采样的列数的占比(每一列是一个特征)。
4、对L1正则化系数reg_alpha进行调整
原因:防止出现过拟合。
搞笑的是他这里写错了,reg_alpha写成了gamma
5、最后进行学习速率的调整,选择最优的学习速率最终确定适合的模型。
LightGBM优化同理
六、将主流的GBDT优化模型(XGBoost,LightGBM)进行对比,而不是直接选用XGBoost或者LightGBM,并给出原因
XGBoost:
- 运用 XGBoost 算法对催化剂和温度对于乙醇转化率的影响的最优模型
- 运用 XGBoost 算法对催化剂和温度对于C4 烯烃选择性的影响的最优模型
LightGBM:
- 运用 lightGBM 算法对催化剂和温度对于乙醇转化率的影响的最优模型
- 运用 lightGBM 算法对催化剂和温度对于C4 烯烃选择性的影响的最优模型
给出比较方法:
最终选择:
- XGBoost对催化剂和温度对于乙醇转化率的影响的模型更好
- lightGBM 对催化剂和温度对于C4 烯烃选择性的影响的模型更好
结束:
用两个模型给出答案:
文件附录:
https://gitee.com/miao-zhou/xgboost/blob/master/2021%E5%9B%BD%E8%B5%9BB%E9%A2%98%E8%AE%BA%E6%96%87.pdf