海外文献推荐系列之一百五十七:西学东渐-20231026-兴业证券-23页_2mb
报告摘要
分析师盈利预测中的缺失值估计与盈利预测研究总结
核心内容
本文研究了分析师盈利预测数据中的缺失值问题,并探讨了如何通过估计缺失值来提升盈利预测的准确性。研究发现,缺失值的估计在提高预测效果方面具有重要意义,并提出了一种基于矩阵分解的估计方法(MF和CMF),并结合机器学习模型(如XGBoost、LASSO和SVR)进行盈利预测,结果表明该方法在预测精度上优于传统方法(如均值估计)。
主要观点
- 缺失值的重要性:分析师盈利预测数据中存在大量缺失值,这些缺失值可能揭示更多关于公司未来盈利的信息,对预测模型的性能有重要影响。
- 缺失值估计方法:本文比较了多种缺失值估计方法,包括零估计、均值估计、多重估计(ME)、iSVD、k-NNI和矩阵分解(MF)。其中,MF方法在估计缺失值方面表现最佳,尤其在高缺失率(如90%)下仍能保持较高的估计精度。
- 耦合矩阵分解(CMF):CMF方法结合了公司特征数据,通过共享时间因子矩阵,提升了对缺失值的估计效果,尤其在处理冷启动和数据稀疏问题时表现出优势。
- 盈利预测模型:基于MF和CMF估计的缺失值,结合机器学习模型(如XGBoost、LASSO和SVR)进行盈利预测,结果表明其效果优于传统方法,尤其在样本外预测中表现突出。
- 评估指标:使用R方、均方误差(MSE)和平均绝对百分比误差(MAPE)作为评估指标,MF+XGBoost在这些指标上均表现优异。
关键信息
缺失值估计方法
- 零估计:效果最差,容易引入噪声。
- 均值估计:在低缺失率下表现良好,但对异常值敏感。
- ME(多重估计):在中等缺失率下表现较好,但在极端缺失率下效果下降。
- iSVD:效果略优于ME,但不如MF。
- k-NNI:表现优于ME和iSVD,但不如MF。
- MF(矩阵分解):表现最佳,尤其在高缺失率下,R方达到0.96,MSE显著降低。
耦合矩阵分解(CMF)
- 方法原理:CMF结合了公司特征数据,通过共享时间因子矩阵U,将分析师预测矩阵X与公司特征矩阵Y进行联合分解,提升缺失值估计效果。
- 优势:解决了MF方法中的冷启动问题,适用于数据稀疏的情况,同时提升了盈利预测的准确性。
盈利预测模型
- XGBoost:表现最佳,尤其在使用MF估计数据时,其预测效果显著提升。
- LASSO:具有自动特征选择能力,有助于减少过拟合。
- SVR:在样本内预测中表现较为稳健,过拟合程度低于XGBoost。
评估准则
- R方:衡量模型预测值与实际值的拟合优度,R方越高,预测越准确。
- MSE:衡量预测误差的大小,MSE越小,预测越准确。
- MAPE:衡量预测值与实际值的百分比误差,MAPE越低,预测越准确。
数据和超参数
- 数据来源:来自I/B/E/S和Thomson Reuters,时间范围为2000年1季度至2016年4季度,涵盖2082家上市公司和9785名分析师。
- 缺失值处理:对数据进行了筛选,剔除市时长过短、分析师覆盖不足或预测次数少的公司,最终形成2082家公司的研究样本。
- 超参数选择:通过10折交叉验证和网格搜索选择最优参数,其中MF和CMF使用K=10作为潜在因子的秩,以保证模型的可扩展性和计算效率。
实证结果
- 缺失值估计效果:MF方法在各种缺失率下均优于其他方法,尤其是在高缺失率(如90%)时,其MSE降低幅度高达94%。
- 盈利预测效果:使用MF估计数据后,XGBoost在MSE和MAPE上分别提升了80%和60%,在R方上也有所提高。
- 分析师数量与分歧度影响:分析师数量较多且分歧度较低的公司,其预测效果更好。当分析师数量较少时,MF方法的提升效果更为显著。
结论
- 缺失值估计的重要性:缺失值的估计有助于提升盈利预测的准确性,特别是在数据稀疏的情况下。
- MF与CMF方法的优势:MF和CMF方法在估计缺失值和预测盈利方面均表现出色,且在处理大规模数据时具有良好的扩展性。
- 机器学习模型的有效性:XGBoost在结合MF估计数据后,其预测效果显著优于传统方法,显示出机器学习在盈利预测中的强大能力。
图表与数据
- 图表1:展示了矩阵分解的示意图。
- 图表2:展示了SGD算法流程。
- 图表3:展示了耦合矩阵分解的示意图。
- 图表4:展示了CMF算法流程。
- 图表5:展示了XGBoost的树结构。
- 图表6:展示了数据的描述性统计。
- 图表7:展示了公司特征相关变量定义。
- 图表8:展示了超参数列表。
- 图表9:展示了不同缺失值比例下的估计表现。
- 图表10:展示了不同估计方法在不同缺失值比例下的表现。
- 图表11:展示了“季度”矩阵与“分析师”矩阵之间的余弦相似度。
- 图表12:展示了不同方法的盈利预测效果。
- 图表13:展示了分析师数量与预测精度的关系。
- 图表14:展示了分析师数量和预测分歧度对盈利预测的影响。
风险提示
- 文献中的结果基于历史数据,模型在政策和市场环境变化时可能失效。
方法论总结
- 矩阵分解(MF):将盈利预测矩阵分解为时间因子矩阵和分析师因子矩阵,有助于提取潜在信息。
- 耦合矩阵分解(CMF):结合公司特征数据,提升估计效果,适用于数据稀疏场景。
- 机器学习模型:如XGBoost、LASSO和SVR,可以有效利用估计后的数据提升盈利预测精度。
总体评价
本文提出了一种创新的方法,通过矩阵分解和机器学习的结合,有效解决了分析师盈利预测数据中的缺失值问题,并显著提升了盈利预测的准确性。对于投资者和金融分析师而言,该方法具有重要的参考价值。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载