2024-11-17-世界银行-产生见解_机器学习驱动的填补农业数据空白的方法(英)_52页_584kb
报告摘要
报告总结:机器学习方法填补农业数据缺口
研究问题
本研究旨在填补农作物产量数据缺口,尤其是当作物切割(Crop Cutting, CC)测量成本较高,难以在所有地块开展时的有效方法。研究采用机器学习驱动的多重填补技术,分析马里农业调查数据,探讨以下问题:
- 数据缺失模式:部分缺失(同一调查内)与完全缺失(跨调查)的处理方法。
- 填补准确性:评估在单次调查内和跨调查情况下,机器学习填补方法的准确性。
- 影响因素:哪些预测变量(如农民报告数据、地理变量)对填补最有效。
- 训练样本量:确定可靠的预测所需的最小样本量。
主要发现
-
预测变量的重要性:
- 农民报告的产量(SR)是重要的预测变量,尤其对大部分作物的水平预测和小部分作物的日志预测。
- 融合地理空间变量显著提高了机器学习模型的预测精度,这些变量通常优于主观报告数据。
- 结合SR产量和地理空间变量的方法,在大多数作物上提供了最佳的预测精度。
-
预测准确性(ML vs. CC):
- 在单次调查内部的填补框架下(即“Within-Survey”),当使用约三分之一的作物切割数据训练模型时,机器学习填补的均值在频数上与真实CC均值一致,且机器学习填补的均值比SR均值更接近CC值,具有更高的精度和可靠性。
- 在跨调查年份的填补框架下(即“Survey-to-Survey”),精度显著降低。主要原因是两种调查年份的调查问卷存在差异(如未在较新的调查中收集播种日期),导致模型泛化能力受损,尽管机器学习填补仍略优于SR填补,但整体效果不佳,尤其在子区域级别。
-
作物差异性:
- 机器学习预测精度在不同作物间存在显著差异。
- 地块间作率高、商业化程度低的作物(如豇豆)预测精度较低。
- 精确的地块级产量测量对提高不确定性较大的作物的预测至关重要。
-
成本效益:在“Within-Survey”框架下,仅为三分之一地块进行作物切割测量,然后使用机器学习模型对这些数据进行训练和交叉验证,可以在保持较低成本的同时实现可靠的预测精度,进而指导减轻田野调查负担。
-
局限性:子区域级别统计数据难以通过机器学习填补得出,方法在变化的调查设计和问卷模式下稳健性较低。
结论
- 农户问卷数据和地理空间变量的结合是对抗农业评估中产量数据缺口的有效策略。
- 马尔可夫链方法在单次调查内的数据填补有效性已被验证。
- 跨调查填补的有效性显然较低,尤其是在子区域和年份变化情境下。
- 对于有限资源的国家和易受冲突影响地区的数据收集具有重要意义,可提供一种低成本的替代方案。
- 对于详细和可靠的预测,仍需采集和整合高质量的地理变量和农艺信息。
研究贡献
本研究为优化农业领域的数据收集方法提供了实证证据,特别是在成本敏感性和数据完备性之间的平衡,从而有助于加强小农农业领域的政策讨论和研究。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载