20220121-天风证券-金融工程_海外文献推荐第208期_18页_1mb
报告摘要
金融工程:用机器学习揭示共同基金的隐含信息
核心内容
本研究报告探讨了如何利用自然语言处理(NLP)和神经网络技术分析共同基金股东信中的文本信息,以识别那些具有私人信息(即“知情基金”)的基金。通过分析这些文本信息,研究发现知情基金不仅在未来的基金业绩上表现更好,还更有可能获得晨星评级的提升,并吸引更多的资金流入。这表明投资者认可并利用了这些定性信息进行决策。
主要观点
- 文本信息的价值:共同基金的股东信中包含大量与基金价值相关的定性信息,这些信息可以通过机器学习模型进行分析,从而帮助投资者识别具有私人信息的基金。
- 模型的有效性:使用BERT(双向编码表示)和循环神经网络(RNN)模型,能够有效捕捉文本中的高阶语义和句法特征,从而提升预测基金业绩的能力。
- 基金表现与信息相关性:预测模型中识别的知情基金在未来表现优于不知情基金,其Alpha值更高,且更可能获得晨星评级提升。
- 资金流入与文本信息:投资者在收到股东信后,更倾向于将资金投入知情基金,特别是在高关注度的情况下,资金流入显著增加。
- 信息内容的主题:知情基金倾向于讨论特殊化行业、投资组合风险承担、金融市场整体情况和跨资产混合策略。
- 预测准确性:模型在高风险基金和较老基金中表现更佳,特别是在基金收益波动率较高的情况下。
关键信息
数据与变量
- 数据来源:美国证券交易委员会(SEC)的EDGAR系统,以及CRSP和汤森路透的共同基金数据库。
- 样本范围:2006年至2018年的国内股票基金,共17717份N-CSR文件。
- 变量构造:
- Alpha:基金的异常收益率,基于Fama-French-Carhart四因素模型。
- Flow:资金流动,包括6个月、12个月、24个月和3天、5天等不同时间段。
- MSRating:晨星基金评级。
- PastRisk 和 PastAlpha:过去的风险承担和异常收益率。
- Log(TNA) 和 Log(Age):基金总净资产和基金年龄的自然对数。
- LM_Negative, LM_Positive, LM_Uncertainty, LM_Litigious, LM_StrongModal, LM_WeakModal, LM_Constraining:文本情绪和语气指标。
模型构建
- BERT应用:BERT用于提取股东信的文本特征,捕捉高阶语义和句法信息。
- RNN模型:构建了包含四个隐藏层和一个LSTM层的神经网络模型,用于预测基金的知情程度。
- 标签生成:根据Alpha值将股东信分为三类,标签为2代表表现较好的基金,标签为0代表表现较差的基金。
实证分析
- 基金业绩预测:预测模型识别的知情基金在未来表现优于不知情基金,其Alpha值高出80-88个基点。
- 晨星评级提升:知情基金更有可能获得晨星评级的提升,其MSRating高出0.1个标准差。
- 资金流动分析:知情基金吸引了更多的资金流入,尤其在高关注度的情况下,资金流入差异可达4.49%-4.63%。
- 预测准确性:模型在高风险基金和较老基金中表现更佳,预测准确性更高。
结论
本研究展示了如何利用先进的机器学习模型,如BERT和RNN,来分析共同基金股东信中的文本信息,以识别具有私人信息的基金。这些基金不仅在业绩上表现更优,还更有可能获得更高的评级,并吸引更多的资金流入。因此,投资者可以利用这些文本信息作为投资决策的依据,而基金管理人也应重视股东信中的定性信息,以提高其市场影响力和投资吸引力。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载