NBER美国国民经济研究局-NBER-Factorial-Designs-Model-Selection-and-_Incorrect_-Inference-in-Randomized-Experiments_73页_821kb
报告摘要
总结:Factorial Designs, Model Selection, and (Incorrect) Inference in Randomized Experiments
核心内容
本文探讨了在随机化实验中使用因子设计(factorial designs)时,忽略交互项(interactions)对主效应(main treatment effects)估计和推断的影响。作者指出,尽管“长模型”(包括所有交互项)在统计推断上总是正确的,但“短模型”(忽略交互项)在交互项为零时具有更高的检验功效,但在交互项不为零时会导致错误的推断。研究基于对2006–2017年间发表在顶级经济学期刊上的27项因子实验的重新分析,发现其中19项未包含所有交互项,重新加入交互项后,超过一半的结果不再显著。
主要观点
-
长模型 vs 短模型:
- 长模型包括主效应和交互项,能够提供一致的估计和正确的推断。
- 短模型忽略交互项,仅估计主效应,具有更高的有限样本功效,但仅在交互项为零时成立。
- 如果交互项不为零,短模型会导致错误的推断,尤其是显著性结果的变化。
-
交互项的重要性:
- 交互项在实验中可能具有实质性影响,其绝对值中位数约为主效应的37%。
- 由于实验设计通常缺乏足够的统计功效来检测交互项,许多研究者误将“无显著交互项”视为“无交互项”。
-
推断问题:
- 使用短模型进行推断可能会导致显著性结果的误判,从而影响政策制定。
- 交互项的存在会改变主效应的解释,将其视为加权平均效应,而非直接针对“常规业务”(business-as-usual)反事实的效应。
-
模型选择的挑战:
- 研究者常采用两步法:先用长模型检验交互项是否显著,若不显著则使用短模型。
- 这种方法在统计推断上并不总是有效,因为交互项的检验结果可能不准确,且交互项的分布复杂,导致t统计量误导。
-
建议:
- 所有因子设计实验应报告基于长模型的t检验结果,以确保推断的正确性。
- 如果研究者希望使用短模型,应明确说明主效应是加权平均效应,并在预分析计划中说明感兴趣的估计量。
- 如果不关心交互项,应避免使用因子设计,或通过调整实验设计(如减少交互单元数量)来提高主效应的统计功效。
关键信息
- 实验样本:27项因子设计实验中,19项未包含所有交互项。
- 结果变化:加入交互项后,53%的主效应显著性结果不再显著,26%的估计值符号发生变化。
- 统计功效:短模型在交互项为零时具有更高功效,但当交互项不为零时,其推断是错误的。
- 模型选择:长模型是统一最优无偏检验,但短模型在某些情况下可能更有效。
- 实验设计建议:若不关心交互项,应避免使用因子设计;若关心交互项,应确保实验设计有足够统计功效来检测其存在。
实践建议
- 透明度:应明确说明主效应是基于哪种模型估计的,并解释其含义。
- 预分析计划:在进行因子设计实验时,应预先说明感兴趣的估计量,以避免事后模型选择带来的偏差。
- 样本调整:若不关心交互项,可通过减少交互单元数量,提高主效应的统计功效。
- 推断方法:使用长模型进行推断是更稳健的选择,尤其在政策实验中,其结果更符合实际反事实情境。
结论
因子设计在实验中广泛使用,但忽略交互项可能导致错误的推断。本文强调了长模型在保证统计正确性方面的必要性,并建议在政策实验中始终使用长模型进行分析。此外,本文为因子设计的统计分析提供了新的方法和视角,有助于提高实验结果的可靠性和解释性。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载