NBER美国国民经济研究局-NBER-Imputing-Missing-Values-in-the-US-Census-Bureaus-County-Business-Patterns_39页_1mb
报告摘要
总结:NBER Working Paper 26632 - Imputing Missing Values in the US Census Bureau's County Business Patterns
核心内容
本研究探讨了美国人口普查局发布的县企业模式(County Business Patterns, CBP)数据中存在的两个主要问题:数据缺失(由于保密原因部分单元数据被压制)和行业分类变化(SIC系统与NAICS系统的交替使用)。研究提出了一种新的方法,利用线性规划技术结合行业和地理层级约束,对缺失数据进行填补,并提供行业对照表以实现数据的一致性。
主要观点
-
CBP数据的局限性
- 大部分县-行业单元的数据被压制,以保护企业隐私。
- 行业分类系统随时间变化,SIC(1946-1997)和NAICS(1998-2016)交替使用,导致跨年度分析困难。
-
填补缺失数据的方法
- 研究开发了一种基于线性规划的填补方法,利用行业和地理层级的“加总约束”(adding-up constraints)来估算被压制单元的就业数据。
- 填补值选择最接近被压制单元上下限中点的数值,同时满足所有层级的加总要求。
- 该方法是首次全面遵守所有层级约束的填补方法,且可识别并修正原始CBP文件中上下限的不一致。
-
行业分类系统的转换
- 行业代码从SIC转换为NAICS,提供了更详细的分类。
- 行业对照表被构建,以将SIC分类的数据重新归类为NAICS分类,确保时间序列数据的一致性。
- NAICS系统比SIC更透明,因为它基于企业实际活动进行分类,而SIC则基于多种不同概念。
-
数据压制与噪声注入
- 数据压制依据就业数量的范围,不同压制标志(如A、B、C等)代表不同的就业范围。
- 自2007年起,Census引入“噪声注入”(noise infusion)技术,对未被压制的单元添加随机噪声,以保护隐私。
- 噪声注入标志(如G、H、D、S)用于标识数据的扰动程度。
-
数据的地理结构
- 地理层级为县、州、国家三级,每一级的就业数据必须与下一级数据相加。
- 行业层级同样具有加总结构,如四或六位数的行业代码,其父级代码(root)包含所有子级代码(child)的就业总和。
关键信息
- 数据来源:CBP数据源自美国人口普查局的Business Register(BR),基于行政税收记录。
- 数据时间范围:1946至2016年,部分年份数据不完整(如1946-1962年为间断发布)。
- 数据压制比例:在1977至2016年间,约55%至70%的县-行业单元被压制。
- 数据填补范围:当前填补方法适用于1977至2016年的CBP数据,未来计划扩展至1946年。
- 行业代码结构:
- SIC系统:最多4位数字,分属10个经济部门。
- NAICS系统:最多6位数字,分属20个经济部门。
- 数据可用性:所有数据、填补结果、行业对照表和代码均可在作者提供的数据附录中找到(www.fpeckert.me/cbp)。
方法与创新
- 填补方法:基于线性规划,利用行业和地理层级的加总约束,填补被压制单元的就业数据。
- 行业对照表:用于将SIC代码转换为NAICS代码,确保时间序列分析的连贯性。
- 填补精度:填补值基于上下限中点,并通过约束优化确保其符合整体加总关系。
- 填补扩展性:方法可应用于不同年份和不同层级的行业与地理单元,包括“部分代码”(partial codes)。
结论
本研究通过填补缺失数据和统一行业分类,显著提升了CBP数据的可用性与一致性,为后续的经济研究提供了更完整、可比的数据集。研究结果可应用于国际贸易、城市经济和宏观经济学等领域,有助于更准确地分析区域经济结构的变化。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载