NBER美国国民经济研究局-NBER-Design-and-Analysis-of-Cluster_66页_853kb
报告摘要
总结:Cluster-Randomized Field Experiments in Panel Data Settings
核心内容
本文探讨了在面板数据设置中,如何设计和分析集群随机化现场实验,重点在于评估不同方法对单位层面处理效应估计的统计功效和置信区间覆盖率。研究通过蒙特卡洛模拟,比较了单位层面和集群层面的估计方法,并结合实际案例(Uber的打车小费实验)验证了这些方法的有效性。
主要观点
-
单位层面估计与集群层面估计的比较
在大多数情况下,使用单位固定效应的单位层面估计,以及按单位数量加权的集群层面估计,相较于未加权的集群层面估计,能够提供更高的统计功效,同时保持置信区间的正确覆盖率。 -
处理效应异质性与集群大小的影响
当集群间存在处理效应异质性且与集群大小相关时,加权的集群层面估计能够更有效地减少估计误差,提高统计效率。未加权的集群层面估计则可能导致标准误差低估,从而影响覆盖率。 -
固定效应与标准误差的结合
在面板数据中,包含集群固定效应可以显著改善估计的覆盖率和功效。特别是当处理发生在某一时间点之后时,使用固定效应模型能够更好地控制集群内部的个体相关性。 -
标准误差的正确计算至关重要
单纯的集群标准误差(CRSE)不足以应对复杂的误差结构,特别是在存在空间或时间相关性的情况下。使用Eicker-Huber-White(EHW)标准误差或加权最小二乘法(WLS)可以提升估计的准确性。 -
异质性处理效应与模型选择
当处理效应在集群层面异质时,使用单位层面模型并加入集群固定效应能够更准确地捕捉处理效应的变化,从而提高统计检验的效力。
关键信息
-
实验设计:本文以Uber的打车小费实验为案例,分析了在209个美国和加拿大城市中,小费功能对司机行为的影响。实验采用集群随机化方法,将一半城市设为处理组,另一半设为对照组。
-
数据结构:实验数据为短面板数据(short panel data),即时间周期较少,但集群数量较多。这种结构在处理效应估计中带来了独特的挑战。
-
模拟设置:研究构建了多种数据生成过程(DGP),包括:
- 单一时间点的处理效应模型;
- 处理效应在集群层面异质的模型;
- 误差项具有空间或时间相关性的复杂模型。
-
估计方法:
- 单位层面回归(包含单位固定效应);
- 集群层面回归(含或不含固定效应);
- 加权最小二乘法(WLS);
- EHW标准误差;
- 分层标准误差。
-
模拟结果:
- 在处理效应异质且集群大小不一致的情况下,加权的集群层面估计和单位层面估计在统计功效上表现更好。
- 单纯的集群层面估计在处理效应异质的情况下可能导致标准误差低估,从而影响结果的可信度。
- 包含固定效应的单位层面模型在处理效应异质时,能提供更准确的估计和更好的覆盖率。
- 对于复杂误差结构(如空间或时间相关性),仅使用集群标准误差不足以正确估计标准误差,需要结合其他方法(如WLS和EHW)。
-
实证发现:
- Uber小费实验中,尽管主要结果在传统显著性水平下不显著,但采用优化估计方法后,点估计的精度得到了显著提升。
- 实验显示,小费功能可能在短期内增加司机供给,降低需求和利用率,以及减少每小时收入。
结论
本文的主要贡献在于提出了一套适用于短面板数据的集群随机化现场实验的分析方法,强调了单位层面估计和加权集群层面估计在处理效应估计中的优势。同时,研究指出在处理效应异质和复杂误差结构下,正确计算标准误差和使用固定效应模型对于提高估计的准确性和统计功效至关重要。
试读结束,高清完整版pdf/doc/ppt,请点下载