20201022-华泰证券-华泰人工智能系列之三十七_舆情因子和BERT情感分类模型_28页_3mb
报告摘要
金工研究:基于金融新闻的舆情因子与BERT情感分类模型分析
核心内容
本文探讨了如何利用金融新闻数据构建舆情因子,并测试基于BERT模型的情感分类效果。同时,介绍了BERT模型的可解释性工具LIT,以帮助理解模型的决策过程。
主要观点
- 金融新闻数据的使用:金融新闻数据是另类数据的重要组成部分,能够为投资决策提供增量信息。
- 舆情因子构建:基于Wind金融新闻数据,通过情感得分计算构建日频舆情因子。该因子在沪深300成分股中表现最佳。
- BERT模型应用:BERT作为前沿的NLP模型,通过预训练和微调方法,实现了高精度的金融新闻情感分类。
- 模型可解释性:使用LIT工具对BERT模型进行分析,揭示其关注的关键词及注意力机制。
关键信息
一、金融新闻舆情因子
- 构建方法:
- 每只个股的情感得分 $S_{i,t}$ 计算为正面新闻数量减去负面新闻数量。
- 每只个股的舆情因子 $F_{i,T}$ 为过去30天情感得分的加权和。
- 数据来源:Wind金融新闻数据库,包含新闻发布时间、标题、内容、来源、公司代码和情感标签。
- 因子表现:
- 在沪深300成分股中表现最好,行业市值中性后RankIC均值为6.13%,IC_IR为0.42,TOP组合年化收益率为17.79%。
- 在中证500成分股中表现次之,在全A股中表现最差。
- 舆情因子在沪深300成分股中覆盖度最高,且随时间推移逐渐上升。
二、BERT模型介绍
- BERT原理:
- 基于Transformer架构,使用自注意力机制捕捉语义关系。
- 预训练任务包括Masked Language Model和Next Sentence Prediction。
- BERT训练:
- 预训练阶段通过大量文本学习语言特征。
- 微调阶段使用标注数据进行情感分类任务。
- BERT模型选择:
- 使用RoBERTa-tiny-clue模型,参数量较小,训练速度快。
三、BERT情感分类实证
- 数据预处理:
- 选取2020年1月至5月的Wind金融新闻数据,筛选出与A股个股相关的新闻。
- 剔除行情类新闻及包含“快讯”、“涨”、“跌”的新闻。
- 整合标题与内容,去除空格,打上情感标签。
- 数据划分为训练集(40%)、验证集(10%)、测试集(10%)。
- 测试结果:
- 模型在测试集上准确率为0.9826,AUC为0.9746,精确率为0.9736,召回率为0.9744。
- 模型在正负样本不平衡情况下仍表现出高预测精度。
四、模型可解释性工具LIT
- 功能介绍:
- LIT是Google开源的NLP模型可解释性工具,支持对模型预测过程进行可视化分析。
- 通过Salience Maps模块分析字符重要性,通过Attention模块分析注意力权重。
- 应用案例:
- 正面新闻中,“同比预增”、“中标”等字符对模型预测影响较大。
- 负面新闻中,“风控”、“减持”、“摘牌”等字符对模型预测影响较大。
风险提示
- 舆情因子的测试结果为历史表现,存在失效风险。
- Wind金融新闻数据覆盖范围有限,因子可能存在偏差。
- LIT工具存在过度简化的风险,不能完全反映模型复杂性。
总结
本文系统介绍了如何基于金融新闻构建舆情因子,并利用BERT模型进行情感分类。通过实证分析,验证了舆情因子在沪深300成分股中的有效性,同时展示了BERT模型在金融新闻情感分类任务中的优秀表现。此外,通过LIT工具对BERT模型进行了可解释性分析,揭示了模型在预测过程中关注的关键信息。这些研究为投资者提供了新的工具和方法,有助于更好地利用另类数据进行投资决策。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载