互联网行业_格陵达遥感与随机森林技术在加纳的网格化劳动力市场数据分析_44页_2mb
报告摘要
格陵达遥感与随机森林技术在加纳的网格化劳动力市场数据分析总结
核心内容
本研究利用高分辨率(0.005度)的遥感技术和随机森林算法,对加纳2021年住房与人口普查的区级劳动力市场数据进行降尺度处理,生成了17个就业类别(包括年龄、性别、技能、状态、部门、失业和NEET)的网格化劳动力市场地图。该方法不仅填补了劳动力市场数据空间分解的空白,还通过整合64个辅助变量(如土地覆盖、夜间灯光、基础设施和兴趣点)来捕捉人口、经济和参与因素,从而实现对劳动力市场复杂性的全面刻画。
主要观点
- 高分辨率劳动力市场地图:研究首次生成了高分辨率(0.005度)的劳动力市场数据,揭示了显著的空间异质性,就业率在像素间从10%到98%不等。
- 模型精度高:大多数就业类别的R²值超过90%,表明模型具有较高的预测能力。
- 变量重要性分析:建成区、夜间灯光、道路密度和植被健康状况是预测就业模式的关键因素,且在不同就业类别中表现出特异性。
- 城乡与南北差异:研究结果突出了加纳城乡之间以及南北之间的就业差异,显示了城市中心与农村地区在就业分布上的显著不同。
- 行业集中性:服务业在加纳劳动力市场中占据主导地位,而制造业和工业虽然在整体上占比不大,但在某些城市中心表现出专业化特征。
关键信息
数据来源与处理
- 研究区域:加纳,由16个地区和261个区组成,总人口约3080万,劳动年龄人口约1990万。
- 数据类型:
- 因变量:加纳统计局提供的区级人口和劳动力市场数据。
- 自变量:64个辅助变量,包括土地覆盖、夜间灯光、基础设施、兴趣点等。
- 辅助数据处理:
- 土地覆盖:使用ESA-WorldCover数据,分辨率10米。
- 数字高程模型(DEM):分辨率30米,提取了坡度、崎岖度等指标。
- 植被指数:包括EVI、NDVI、NIRv,分辨率500米。
- 地表温度:分辨率1公里×1公里,来自MODIS MYD11A1.061。
- 净初级生产力(NPP):年度数据,分辨率0.05度。
- 降雨量:来自CHIRPS全球数据,分辨率0.05度。
- 水体数据:使用HydroRIVERS和HydroLakes数据库,计算河流和湖泊的密度与距离。
- 建筑数据:Open Buildings 2.5D时间数据集,分辨率0.5米。
- 夜间灯光数据:来自黑玛瑙,分辨率15弧秒,用于估计经济活动水平。
- 兴趣点(POI):来自OpenStreetMap,分为15类,用于计算密度。
方法论
- 缩放方法:使用随机森林模型对区级劳动力市场数据进行降尺度处理,生成0.005度分辨率的网格化数据。
- 模型训练与验证:
- 使用区级数据训练模型,并将其应用于0.005度分辨率的辅助数据。
- 采用k折交叉验证优化模型参数,如
mtry(随机选择的特征数量)和ntree(树的数量)。 - 模型参数调整以最小化均方根误差(RMSE)为目标,不同就业类别的参数值有所不同。
模型评估
- 评估指标:均方根误差(RMSE)和解释的变异百分比。
- 结果:
- 总就业、失业、低技能就业等类别的RMSE较低,解释的变异百分比超过90%。
- 农业和矿业的R²值较低(分别为68%和67%),可能与辅助数据的不充分有关。
- 高技能就业的R²值较高,表明模型在捕捉高技能就业分布方面表现良好。
网格化劳动力市场地图
- 就业分布:就业高度集中在南部城市(如阿克拉和库马西)以及沿海和交通基础设施沿线。
- 城乡差异:北部地区的就业率较低,主要集中在少数城市中心。
- 行业分布:服务业占据主导地位,制造业和工业在某些城市中心表现出专业化特征。
应用
- 就业率与行业百分比:
- 全国就业率为48%,地区间差异显著(最低16.5%,最高64.7%)。
- 高技能就业集中在城市地区,制造业和工业就业在部分城市中心比例较高。
- 城市劳动力市场分析:
- 网格化数据可用于分析城市内部的就业分布,区分市中心与城市边缘。
- 五个最大城市聚集区(阿克拉、库马西、塔马利、塔科腊迪和科佛里杜亚)占总就业的38%,其中高技能就业占53%。
变量重要性分析
- 关键变量:
- 建成区:反映人口密度与就业供给。
- 夜间灯光:与经济活动和就业需求相关。
- 道路密度:反映基础设施和交通便利性。
- 植被健康状况:对农业就业影响显著。
- 行业特异性:
- 农业就业与植被指数密切相关。
- 制造业和工业就业与基础设施密度相关。
- 服务业就业与城市中心的聚集效应相关。
模型在粗分辨率下的表现
- 粗分辨率:0.05度(约5公里×5公里)。
- 结果:
- 模型在粗分辨率下仍具有较高精度,但平均平方残差(MSR)和解释的变异百分比均有所下降。
- 制造业、工业和服务业的MSR增加显著,表明高分辨率数据在这些类别中更具信息量。
结论
- 本研究提供了一种新的方法,用于在数据稀缺的环境中生成高分辨率劳动力市场数据。
- 该方法结合了遥感技术和机器学习模型,能够更全面地反映劳动力市场的复杂性。
- 未来研究可以进一步优化辅助数据的选择,探索其他机器学习技术(如XGBoost、Res-FuseNet)和更高分辨率的行政区划,以提高模型的准确性。
- 网格化劳动力市场数据可为政策制定者提供重要的决策支持,帮助设计更精准的干预措施,促进包容性经济增长。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载