20221215-东证期货-期权策略专题(六)_股指波动率预测_舆情分析_深度学习能否战胜传统计量模型__32页_3mb
报告摘要
期权策略专题(六)总结:股指波动率预测中的舆情分析与深度学习应用
核心内容
本报告探讨了在股指波动率预测中,是否可以通过引入舆情数据和深度学习模型(如LSTM)来提升预测准确率。研究对比了传统多元回归模型(OLS、Lasso、Ridge)、GARCH模型以及LSTM模型在预测波动率时的表现,并分析了舆情数据对波动率的预测能力。
主要观点
- 波动率预测的重要性:波动率是期权投资和风险管理中的关键指标,尤其在隐含波动率存在偏差的市场环境中,历史数据建模成为一种重要的替代方式。
- 模型对比:
- 多元回归模型:OLS、Lasso和Ridge模型均用于波动率预测,其中Lasso在样本内和样本外均表现最佳,尤其在减少冗余因子和避免多重共线性方面具有优势。
- GARCH模型:作为时间序列模型,GARCH在短期预测(如5日)中表现优异,胜率可达80%以上,但随着预测周期延长,预测准确率下降。
- LSTM模型:基于深度学习的LSTM在预测能力上优于传统线性模型,尤其是在周度预测中胜率高达70.73%,且在样本外表现稳定。
- 舆情分析:通过贝叶斯模型和SnowNLP库对股民评论进行情感分析,发现舆情数据具有一定的预测能力,但其与价量数据的相关性较低,无法显著提升模型效果。
- 模型稳定性:所有模型在样本外均未出现明显衰减,表明其具有一定的泛化能力。
关键信息
数据说明
- 价量数据:选取上证50ETF的20个价量因子,包括开盘价、最高价、收盘价、成交量、滚动均值、偏度和峰度等。
- 舆情数据:基于股民评论,提取发帖数量、阅读数量、评论数量、总情感得分等指标,用于分析市场情绪对波动率的影响。
回测框架
- 采用滚动回归方式,以120天为回看周期进行预测。
- 对波动率进行平稳性检验,结果显示其为平稳序列,有利于模型预测。
模型表现
多元回归模型
- 样本内表现:
- 周度预测:Lasso胜率最高为63.06%,优于OLS(61.42%)和Ridge(61.49%)。
- 日度预测:Lasso胜率稳定在65%左右,优于OLS和Ridge。
- 样本外表现:
- 周度预测:Lasso胜率提升至68.48%,优于OLS(63.05%)和Ridge(62.02%)。
- 日度预测:Lasso胜率稳定在67.70%左右,模型表现良好。
GARCH模型
- 样本内表现:
- 周度预测:胜率最高可达80.10%,随着预测周期延长,准确率逐步下降。
- 日度预测:胜率在62.93%左右,模型表现稳定。
- 样本外表现:
- 周度预测:胜率稳定在68.48%左右,优于样本内表现。
- 日度预测:胜率在68.99%左右,模型表现良好。
LSTM模型
- 样本内表现:
- 周度预测:胜率为70.73%,优于Lasso模型。
- 日度预测:胜率为67.08%,表现稳定。
- 样本外表现:
- 周度预测:胜率下降至67.70%,但仍高于样本内表现。
- 日度预测:胜率提升至70.98%,模型具有较好的泛化能力。
舆情数据分析
- 舆情数据的情感评分在0到1之间,反映市场情绪的强弱。
- 舆情数据与价量数据之间的相关性较低,且舆情数据本身在预测中并未显著提升模型效果。
- 舆情数据在样本外表现优于样本内,可能与数据的丰富性和市场情绪变化有关。
结论
- LSTM模型表现最佳,在周度和日度预测中均优于传统回归模型和GARCH模型。
- Lasso回归优于OLS和Ridge,在处理多重共线性方面具有优势。
- GARCH模型适用于短期波动率预测,在5日预测中表现尤为突出。
- 舆情数据虽具有一定的预测能力,但无法显著提升模型效果,且在样本外表现相对稳定。
- 模型泛化能力较强,样本外表现未出现明显衰减,但需警惕市场风格切换对模型有效性的影响。
风险提示
- 市场风格的切换可能导致特征有效性发生变化,进而影响模型表现。
- 机器学习模型存在可解释性差的问题,需结合实际市场情况进行调整和优化。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载