【世界银行】产生见解:机器学习驱动的填补农业数据空白的方法-2024.11_52页_609kb
报告摘要
本研究探讨了利用机器学习插补方法填补大规模农业调查中作物产量数据缺失的可行性。作物收割法是产量测量的准确方法,但成本高,农民自报产量(SR)虽常见却存在系统性高估问题,尤其在小规模耕地中更为显著。研究基于马里国家农业调查数据(2017-2018年两个农业季),通过整合地理空间变量(GPS数据)与农业变量,构建机器学习模型(随机森林)进行产量预测,验证了不同插补框架的有效性。
核心结论包括:
-
预测变量分析
- SR产量和地理空间变量(如降雨量、土壤肥力、地形特征)均对模型有显著贡献,但地理变量的预测效力更优,尤其在玉米、水稻等商业化程度高的作物中。
- 作物的间作率影响预测效果,非间作作物(如豆类)因地理变量关联性较低,需结合SR数据提升精度。
-
插补框架的差异
- 同调查插补:在样本中使用约三分之一的作物收割数据(CC)作为训练集时,模型预测准确度较高(R²整体达0.35-0.91),且能有效减少偏差。
- 跨调查插补:因不同年代数据特征差异(如种植时间、降雨数据采集行为),预测偏差更大,尤其在细分区域层面,准确度低于同调查模式。
-
样本规模与成本效益
- 训练样本占比达50%时,能实现成本与准确度的最优平衡,而超过三分之一后,准确度提升有限,建议根据具体需求调整采样比例。
- 零值数据(如未产作物)占比低(整体5%,部分作物达13%),对结果影响可忽略,说明数据可靠性较高。
-
方法局限
- 跨调查插补需考虑数据采集误差和标准化问题,如2017年未采集播种日期等关键变量,影响2018年预测的准确性。
- 地理变量的匿名化处理可能引入误差,需结合遥感数据产品选择优化模型性能。
研究为农业调查的数据采集策略与插补方法提供了参考,证明机器学习可有效降低成本,但需注意数据代表性和模型适应性。同调查插补更可靠,跨调查应用需谨慎处理变量异质性问题,并建议未来研究关注分销尾部预测和进一步方法优化。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载