2013年-世界发展银行全球_Cost-effective_Estimation_of_the_Population_Mean_Using_Prediction_Estimators_38页_524kb
报告摘要
总结:使用预测估计量进行人口均值的有效估计
核心内容
本文探讨了使用预测估计量来有效估计人口均值的方法。在许多实际研究中,目标变量(outcome variable)的观测成本较高,而协变量(covariates)的观测成本相对较低。因此,预测估计量提供了一种利用协变量信息来提高估计效率的替代方法。
主要观点
-
预测估计量的优势:
- 预测估计量通过使用协变量信息来估计人口均值,通常比直接使用样本均值更高效。
- 在某些情况下,如目标变量是二元变量时,预测估计量可以显著提高效率。
-
一般化方法:
- 本文扩展了Matloff (1981)的研究,将预测估计量应用于更一般的模型中,包括基于广义矩估计(GMM)的估计方法。
- 在使用GMM估计量的情况下,预测估计量至少与样本均值一样高效,前提是满足特定的矩条件。
-
效率条件:
- 预测估计量的效率取决于是否满足一个矩条件(eq. 5),即 $M_g = - M_m^T V_m^{-1} E[m_i Y_i]$。
- 在最小二乘(LS)或最大似然(ML)估计量的情况下,这一矩条件通常自动满足。
-
二元结果变量的特殊情况:
- 当目标变量是二元变量时,预测估计量的效率与分布无关,只要使用最大似然估计(MLE)。
- 在特定分布(如标准正态分布)下,预测估计量与样本均值相同,效率也一致。
-
成本效益分析:
- 在双阶段抽样(double sampling)中,预测估计量可以帮助在预算限制下最大化统计精度,或在精度要求下最小化成本。
- 本文提出了一种优化方法,用于在给定预算下选择最优的样本比例 $r$。
关键信息
- 预测估计量的定义:预测估计量通过使用协变量信息预测目标变量的均值,其形式为 $\hat{\mu}(\hat{\theta}) \equiv N^{-1} \sum_{i} g(x_i, \hat{\theta})$。
- 效率条件:预测估计量的效率取决于是否满足矩条件 $M_g = - M_m^T V_m^{-1} E[m_i Y_i]$。
- 不同估计方法的比较:
- OLS:在误差服从正态分布时,与MLC一致。
- MLB:仅使用二元结果变量是否高于某个阈值的信息。
- MLC:使用连续状态变量作为因变量进行最大似然估计,通常效率最高。
- 双阶段抽样应用:
- 在双阶段抽样中,协变量被所有样本观测,而目标变量仅在子样本中观测。
- 通过选择适当的样本比例 $r$,可以实现成本效益最大化。
结构与方法
- 假设条件:
- $(x_i, u_i)$ 独立同分布。
- 协变量与误差项独立。
- 模型参数估计满足一致性与渐近正态性。
- 数学推导:
- 推导了预测估计量的渐近性质,包括一致性与渐近方差。
- 通过矩条件和不同估计方法(如OLS、MLB、MLC)比较了预测估计量的效率。
结论
本文不仅扩展了Matloff (1981)的研究,还为双阶段抽样方法提供了新的理论支持。通过使用预测估计量,可以在成本与精度之间取得更好的平衡,尤其适用于目标变量观测成本较高的情况。此外,本文还强调了在不同模型设定下预测估计量的表现差异,为实际应用提供了理论依据。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载