2011年-世界发展银行全球_Beyond_Baseline_and_Follow-up___The_Case_for_More_T_in_Experiments_36页_1mb
报告摘要
总结:Beyond Baseline and Follow-up: The Case for More T in Experiments
核心内容
本论文探讨了在经济学随机实验中,增加测量轮次(T)对提升统计功效的重要性。传统上,大多数实验仅采用一次基线和一次随访测量,但作者指出,对于某些经济变量(如企业利润、家庭收入和支出),这种设计可能并非最优。通过多次测量并平均处理,可以有效减少噪声,提高实验的统计效力。
主要观点
-
单次基线和随访的局限性
- 对于高度自相关且测量精确的变量(如健康和教育指标),单次基线和随访是合适的。
- 但对于低自相关、高波动的经济变量(如企业利润、家庭收入),多次测量是更优的选择。
- 在自相关为零的情况下,忽略基线数据的“后测”估计方法比差分法(difference-in-differences)更有效。
-
ANCOVA 优于差分法
- ANCOVA(协方差分析)方法在低自相关数据中比差分法更有效,因为它可以更灵活地调整基线差异。
- 当自相关为零时,ANCOVA 估计方法等价于“后测”方法,而差分法则需要更大的样本量才能达到相同的统计效力。
-
多轮测量的优化策略
- 在固定总测量轮次 T 的情况下,最优的策略是将 T 轮次平均分配在干预前后,即 $ r = T / 2 $ 和 $ m = T / 2 $。
- 如果 T 是奇数,将额外的一轮分配到干预前或干预后对统计效力没有显著影响。
-
实际自相关分析
- 多数经济变量的自相关通常在 0.2 到 0.5 之间,尤其是在低收入群体中,收入和支出波动较大。
- 通过实验数据(如斯里兰卡和加纳的微型企业利润、家庭支出)表明,自相关在不同时间点上大致保持稳定,因此可以合理地使用平均自相关值进行统计功效计算。
-
设计建议
- 研究者应考虑在实验设计中采用多轮测量,以提高统计效力。
- 在某些情况下,完全不进行基线测量可能比进行一次基线和一次随访更有效。
- 多轮测量不仅适用于实验设计,也适用于非实验的因果推断方法,如匹配的差分法。
关键信息
-
变量类型:
- 高自相关变量(如健康和教育指标)适合单次基线和随访。
- 低自相关变量(如企业利润、家庭收入和支出)适合多轮测量。
-
统计方法:
- 差分法(Difference-in-Differences):适用于有基线和随访的数据,但其统计效力依赖于自相关水平。
- ANCOVA(Analysis of Covariance):在低自相关数据中更具优势,因为它可以更有效地利用基线信息。
-
自相关与统计功效的关系:
- 当自相关 $ \rho $ 为零时,差分法需要两倍于 ANCOVA 的样本量才能达到相同的统计效力。
- 当 $ \rho = 0.25 $ 时,差分法仍需比 ANCOVA 高出约 60% 的样本量。
-
测量轮次分配:
- 对于固定总轮次 T,最优策略是将其均分于干预前后。
- 若 T 为奇数,额外轮次分配在干预前或干预后对统计效力无显著影响。
-
数据应用实例:
- 斯里兰卡微型企业利润的自相关在 0.38 左右。
- 加纳家庭支出的自相关在 0.20 左右。
- 低收入家庭的收入和支出波动较大,自相关较低。
实践建议
- 研究者应根据变量的自相关水平来决定是否使用基线数据以及使用多少轮次的测量。
- 对于低自相关变量,采用 ANCOVA 方法比差分法更有效。
- 在设计实验时,应考虑增加随访轮次,以提高统计功效,尤其是在短期和中期效应评估中。
- 若变量自相关不恒定,使用平均自相关值进行统计功效计算是合理的,但需注意保守估计。
结论
本论文强调,增加测量轮次(T)在经济学实验中具有重要价值,尤其是在处理低自相关、高波动的经济变量时。通过合理分配测量轮次并采用 ANCOVA 方法,研究者可以显著提高实验的统计效力,从而更准确地评估干预效果。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载