海外文献速览系列之十六:高频数据下基于文本挖掘和深度学习的股票波动性预测-20220309-东兴证券-22页_1mb
报告摘要
高频数据下基于文本挖掘和深度学习的股票波动性预测总结
核心内容
本文探讨了在高频数据环境下,如何利用文本挖掘和深度学习技术,特别是LSTM模型,来预测股票波动率。作者认为,深度学习模型的非线性关系拟合能力和强大的数据特征学习能力,为提高波动率预测的准确性提供了新的思路。
主要观点
- 波动率预测的重要性:波动率是衡量资产风险和衍生品定价的重要指标,对金融资产的风险分析具有重要的理论和实用价值。
- 传统模型的局限性:传统计量经济学模型(如GARCH、HAR-RV、ARFIMA)虽然在波动率预测中有所应用,但它们主要依赖历史波动率数据,忽视了交易信息和公众意见等非线性因素。
- 深度学习模型的优势:LSTM模型因其对长时记忆的捕捉能力,在金融时间序列分析中表现优异。加入文本情绪因子后,LSTM模型在多个评估标准下均优于未考虑情绪因子的传统模型。
- 情绪因子的构建:作者从东方财富股票评论中提取文本信息,构建了一个包含正面、负面和中性情绪的文本情绪因子,并结合评论的阅读次数进行加权,以更准确地反映市场情绪。
- 模型效果分析:在六种评估标准下,加入情绪因子的LSTM模型预测准确率显著提高,分别在MSE、RMSE、MAE、MSLE、$R^2$和RMSPE下提高了9.3%、4.7%、6.2%、9.2%、7.9%和16.9%。此外,LSTM模型在多步预测中表现更为稳健。
- 窗口长度选择:作者发现,当时间窗口为20天时,模型的预测效果最佳,能够平衡数据量和模型训练效率。
关键信息
预测指标体系
- 交易量信息
- 价格变化率
- 偏差
- CDP(逆市运行指标)
- DMA(平行线差指标)
- 隔夜信息
- 高频交易量波动率
- 市场情绪指标(如AR、BR)
- 换手率
- 每日实际波动率(RV)
评估标准
- 均方误差(MSE)
- 均方根误差(RMSE)
- 平均绝对误差(MAE)
- 均方对数误差(MSLE)
- 决定系数($R^2$)
- 根均方平方预测误差(RMSPE)
LSTM模型结构
- LSTM是一种特殊的循环神经网络(RNN),解决了梯度消失和爆炸的问题。
- 模型包含三个“门”:遗忘门、记忆门和输出门。
- 模型使用两层结构,结合全连接层,并通过调整超参数优化预测效果。
实证数据
- 数据来源:中国股市的漫步者(002351)股票评论和Wind数据库。
- 时间范围:2010年2月8日至2020年5月28日,共2741个交易日。
- 高频数据:每5分钟的交易数据,共118,608条。
模型效果比较
- LSTM模型在单步和多步预测中表现优于传统模型。
- 加入情绪因子的LSTM模型(LSTM+M)在所有评估标准下均优于无情绪因子的LSTM模型。
- LSTM模型在预测极端波动时表现出更强的适应能力。
研究方法
- 数据收集与处理:通过Python爬虫获取股票评论,构建情绪因子,并进行数据标准化处理。
- 模型构建:基于LSTM模型,结合高频数据和文本情绪因子进行波动率预测。
- 模型评估:使用六种损失函数对不同模型进行评估,并比较其预测准确性和稳定性。
- 参数选择:通过调整时间窗口长度、网络结构和超参数,优化模型性能。
风险提示
- 本报告内容来源于相关文献,不构成投资建议。
- 模型基于历史数据回测,当市场环境变化时,可能存在失效风险。
- 投资者需自行判断,承担投资风险。
研究点评
- 本文为波动率预测提供了一个新的思路,结合文本挖掘和深度学习技术,提高了预测的准确性和稳健性。
- 情绪因子的引入显著提升了模型表现,验证了公众意见对波动率预测的重要影响。
- LSTM模型在高频数据下表现良好,尤其是在多步预测中,具有更强的适应性和稳定性。
参考文献
- Bolin Lei, Zhengdi Liu, and Yuping Song. "On stock volatility forecasting based on text mining and deep learning under high-frequency data." Journal of Forecasting (2021).
分析师与研究助理
- 高智威:东兴证券金融工程首席分析师,具有丰富的金融工程研究经验。
- 贺争盛:东兴证券金融工程研究员,拥有5年以上数据分析和量化研究经验。
免责声明
- 本报告内容基于公开信息,不构成投资建议。
- 报告中的观点、结论和建议仅供参考,不保证其准确性和完整性。
- 报告版权归属东兴证券股份有限公司所有,未经书面许可,不得翻版、复制和发布。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载