金工深度研究:人工智能51,文本PEAD选股策略-20220107-华泰证券-30页_1mb
报告摘要
人工智能51:文本PEAD选股策略总结
核心内容
本文提出了一种基于文本数据的SUE.txt因子,用于捕捉盈余公告后的价格漂移效应(PEAD),并以此构建选股策略。与传统的SUE因子相比,SUE.txt因子通过分析业绩预告及分析师研报文本中的语义信息,挖掘潜在的alpha信息,实现对股票未来表现的预测。
主要观点
-
PEAD效应的定义与传统方法
PEAD效应是指在盈余公告发布后,股价有较大概率向业绩预期方向漂移。传统SUE因子基于财务数据计算,而本文通过文本数据构建SUE.txt因子,以挖掘隐藏的语义信息。 -
文本SUE.txt因子构建方法
SUE.txt因子基于业绩预告与分析师研报文本的词频矩阵构建,利用机器学习模型(如Logistic回归和XGBoost)对文本进行分类预测,并通过log-odds值之差计算因子值。模型使用滚动训练方式,以保证数据的时效性和模型的稳定性。 -
模型优化与可解释性
XGBoost模型在预测能力和分层效果上优于Logistic模型。模型的可解释性分析表明,某些关键词如“上调”、“预增”等对SUE.txt因子具有正面影响,而“下调”、“下滑”等则具有负面影响,符合投资者的直观判断。 -
因子增强与回测表现
基于SUE.txt因子构建的股票池通过引入华泰金工因子库进行增强,显著提升了回测表现。增强后的股票池在20130104-20211231期间年化收益为43.47%,相对中证500的年化超额收益为29.98%,且在2021年的表现尤为突出,年化收益达52.79%。
关键信息
数据来源与处理
- 业绩预告数据:来自万得的AShareProfitNotice,包含发布时间、预告财报期、预期净利润增速上下限等。
- 分析师研报数据:来自朝阳永续的DER_REPORT_RESEARCH数据库,涵盖研报标题、摘要、发布时间等。
- 文本处理:使用Jieba分词,保留普通名词、专有名词、动词等词性,构建词频矩阵。对样本内文本保留出现频率最高的100个词(标题)和500个词(摘要),避免使用未来信息。
模型训练与测试
- 标签定义:根据业绩预告发布后2日的相对中证500超额收益,将其分为“上涨”、“震荡”、“下跌”三类。
- 模型选择:采用Logistic回归和XGBoost模型,使用弹性网络正则化和网格搜索选择最优超参数。
- 因子计算:基于模型预测结果计算log-odds值之差,并通过指数衰减调整因子值,以反映业绩预告发布日与因子计算时间的远近。
回测结果
- SUE.txt因子表现:每月末对股票池进行分5层回测,XGBoost模型表现优于Logistic模型,第一层年化收益分别为27.62%与24.68%。
- 与2日AR因子对比:SUE.txt因子在盈利能力和分层能力上均显著优于2日AR因子,显示其具有更高的预测能力。
模型可解释性
- 关键词重要性:分析发现“上调”、“预增”、“景气”等词对SUE.txt因子有正向影响,而“下调”、“下滑”、“亏损”等词有负向影响。
- 段落重要性分析:将文本按关键词分类为财报、运营、宏观环境和战略四大类,并进一步划分为13个二级分类,发现运营类文本对结果影响最大,且多为负面,宏观环境文本虽占比最低,但对结果有显著正向影响。
股票池增强
- 增强策略:选取SUE.txt因子第一层股票作为基础池,引入华泰金工因子库中表现良好的因子进行等权合成打分,最终选出30只股票作为增强池。
- 增强池表现:增强池在回测期内的年化收益为43.47%,夏普比率为1.57,超额收益显著。
风险提示
- 模型失效风险:基于机器学习构建的选股策略依赖历史数据,存在失效的可能。
- 模型可解释性低:虽然关键词分析与逻辑相符,但整体模型仍具有一定的黑箱特性,使用需谨慎。
结构与方法总结
- 数据预处理:匹配业绩预告与研报文本,进行分词和词频统计。
- 模型训练:使用滚动训练方式,对样本内数据进行K折交叉验证,寻找最优参数。
- 因子构建:通过log-odds值之差计算SUE.txt因子,并进行指数衰减处理。
- 回测框架:按因子值对股票分层,构建投资组合,进行分层回测。
- 增强策略:利用华泰金工因子库对SUE.txt因子进行增强,提升选股效果。
总结
本文通过文本分析挖掘PEAD效应,构建了SUE.txt因子,并结合机器学习模型(XGBoost优于Logistic)进行优化。该因子在回测中表现优异,能够有效提升选股收益,同时通过关键词和段落重要性分析,增强了模型的可解释性。最终通过华泰金工因子库对SUE.txt股票池进行增强,进一步提升了投资组合的绩效。
试读结束,高清完整版pdf/doc/ppt,请点下载