2016年-世界发展银行全球_Retooling_Poverty_Targeting_Using_Out-of-Sample_Validation_and_Machine_Learning_43页_710kb
报告摘要
总结:利用交叉验证和机器学习重新设计贫困瞄准工具
核心内容
本文探讨了如何通过交叉验证和机器学习方法改进贫困瞄准工具(PMT)的外推准确性。传统的PMT工具开发主要依赖于最小化样本内预测误差,但本文强调,由于PMT工具的目标是外推预测,因此应优先考虑其外推性能。通过引入随机森林和分位数回归森林等随机集成方法,可以显著提高PMT工具的外推准确性,同时减少对传统逐步回归方法的依赖。
主要观点
-
贫困瞄准的重要性
准确的贫困瞄准是有效和高效的食品安全或社会安全网干预的关键组成部分,目标是减少漏出(不需援助的受益人)和覆盖率不足(需援助的未被识别)。 -
传统PMT工具的局限性
- 传统方法主要基于回归或主成分分析(PCA)来选择权重,通常优先考虑样本内预测误差。
- 但样本内误差不能准确反映外推性能,导致工具在新样本中表现不佳。
-
改进方法
- 本文提出两种改进方法:基于交叉验证的模型选择和使用随机集成方法(如随机森林和分位数回归森林)。
- 随机集成方法通过减少偏差和方差,提高外推预测的准确性。
- 分位数回归森林特别适用于识别收入分布底部的贫困家庭,因为这些家庭的特征与条件均值存在显著偏差。
-
评估标准
- 本文采用多种评估指标,包括总准确性(TA)、贫困准确性(PA)、覆盖率不足率(UC)、漏出率(LE)和平衡贫困准确性标准(BPAC)。
- BPAC 是 IRIS 中心提出的新指标,用于在满足国会要求的同时权衡工具的实际效果。
-
外推假设
- 随机森林和分位数回归森林方法依赖于数据生成过程保持不变的假设,即模型在训练数据和测试数据中应基于相同的机制生成。
关键信息
1. 传统PMT工具开发方法
- 基于回归或PCA选择权重。
- 通常使用样本内预测误差作为选择依据。
- 部分工具会进行外推验证,但不是普遍做法。
2. 新方法:随机集成方法
- 随机森林:通过随机选择特征和分割点,减少树之间的相关性,从而降低方差。
- 分位数回归森林:不仅估计条件均值,还估计整个条件分布,适用于识别收入分布底部的贫困家庭。
- 这些方法通过外袋(OOB)误差进行内置交叉验证,提供更准确的外推评估。
3. 工具开发与评估
- 本文使用美国国际开发署(USAID)的贫困评估工具(PAT)作为案例。
- IRIS 中心为38个国家开发了PAT工具,基于LSMS数据和自身调查数据。
- 本文复制了IRIS的开发过程,并通过外推测试评估新方法的效果。
4. 实证数据与结果
- 选取了玻利维亚、东帝汶和马拉维的公开数据集进行分析。
- 对每个数据集进行随机抽样,分为训练集和测试集。
- 使用三折交叉验证选择最优模型,基于BPAC指标评估外推性能。
- 结果显示,使用随机集成方法可以显著提升PMT工具的外推准确性。
方法比较与结论
- 传统方法:依赖逐步回归和样本内性能,外推性能较差。
- 新方法:通过交叉验证和随机集成方法(如随机森林和分位数回归森林)提升外推准确性。
- 结论:本文建议在PMT工具开发中广泛采用这些机器学习方法,以提高贫困识别的准确性与效率。
附录信息
- 文中提供了详细的数据集描述(见表3)。
- 对每个国家的样本内和外推性能进行了对比(见附录表A1)。
- 玻利维亚的复制结果略差于IRIS的原始方法,但这是由于IRIS使用的是随机子集进行建模。
- 东帝汶和马拉维的复制结果与IRIS报告接近,表明新方法具有较好的适用性。
方法适用性
- 提出的方法不仅适用于PMT工具开发,也适用于其他贫困瞄准工具。
- 通过机器学习方法,可以更高效地选择变量和参数,避免繁琐的逐步回归过程。
- 虽然这些方法依赖于数据生成过程不变的假设,但它们在实际应用中仍能显著提高外推性能。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载