2018年-世界发展银行全球_The_Roots_of_Inequality___Estimating_Inequality_of_Opportunity_from_Regression_Trees_35页_1mb
报告摘要
文档总结:基于回归树的不平等机会估计方法
核心内容
本文提出了一种新的方法,利用条件推断回归树(Conditional Inference Trees)和条件推断森林(Conditional Inference Forests)来估计机会不平等。该方法旨在克服现有方法在模型选择上的随意性和偏差问题,同时提高估计结果的可解释性和可比性。
主要观点
-
机会不平等的定义
- 机会不平等指的是由于个体无法控制的背景因素(circumstances)造成的不同群体之间在结果上的差异。
- 机会平等意味着在相同背景条件下,个体的努力(effort)差异不会影响结果的公平性。
-
现有方法的局限性
- 现有方法通常依赖于研究者主观选择的变量和模型形式,导致估计结果容易受到模型选择的影响。
- 非参数方法(如Van de gaer和Checchi & Peragine的模型)需要对变量进行离散化处理,可能引入偏差或信息损失。
- 参数方法(如Mincerian回归)假设变量间线性关系,忽略了非线性和交互效应,容易导致模型过度简化或过拟合。
-
回归树方法的优势
- 减少模型选择的随意性:通过算法自动选择变量和分割点,避免人为干预。
- 平衡偏差:通过统计检验控制模型的过拟合,减少向上和向下的偏差。
- 提高可解释性:树结构直观,便于展示机会不平等的分布和来源。
- 适应性更强:可以处理非线性关系和变量交互,适用于更复杂的数据集。
-
条件推断回归树与森林
- 条件推断回归树通过置换检验(permutation tests)进行变量选择,确保分割的统计显著性。
- 条件推断森林是多个回归树的集成方法,能够提高预测精度并减少估计误差。
- 与传统方法相比,这些方法在样本量不同的情况下,更适用于跨时间、跨国家的比较分析。
关键信息
- 数据来源:本文使用了2011年欧洲联盟收入与生活状况调查(EU SILC)数据进行实证分析。
- 模型选择:通过调整显著性水平α来控制模型的复杂度和偏差,α越小,分割越严格,模型越简洁。
- 实证应用:在实证部分,作者展示了条件推断森林在预测准确性上的优势,优于传统非参数和参数方法。
- 方法推广:该方法不仅适用于收入数据,也可用于其他非连续结果,如健康和教育等。
方法结构
1. 机会不平等的理论基础
- 机会不平等的测量基于John Roemer(1998)提出的理论框架,将影响结果的因素分为两类:努力(effort) 和 背景条件(circumstances)。
- 机会平等意味着在相同背景条件下,所有个体应具有相同的起跑线。
2. 现有方法的比较
- 非参数方法:通过分割变量构造类型,但可能因样本量不足或分割粗略而引入偏差。
- 参数方法:假设变量间线性关系,忽略非线性和交互效应,容易导致模型不准确。
- 两种方法的共同问题:都依赖研究者主观选择变量和分割方式,容易产生偏差。
3. 回归树方法的应用
- 条件推断回归树:通过统计检验选择分割变量,自动构造类型,减少人为干预。
- 条件推断森林:由多个条件推断树组成,提高预测准确性和稳定性,适合处理更复杂的数据。
4. 算法流程**
- 步骤1:对每个输入变量进行独立性检验,计算p值。
- 步骤2:选择p值最小的变量作为分割变量。
- 步骤3:根据该变量的分割点,将样本划分为两个子样本。
- 步骤4:递归地对每个子样本重复上述过程,直到达到预设的显著性水平α或无法进一步分割。
结论
本文通过引入条件推断回归树和森林方法,为机会不平等的测量提供了一种更系统、更可靠、更易解释的工具。该方法减少了模型选择的主观性,提高了估计结果的稳健性和可比性,为发展政策讨论提供了更精确的实证依据。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载