量化专题报告:基于AI文本挖掘的波动率预测模型,既达万顷,又需见微-20230725-华泰期货-16页_4mb
报告摘要
基于 AI 文本挖掘的波动率预测模型总结
核心内容
本文聚焦于低频波动率(以月度为时间区间)的预测研究,提出了一种结合文本挖掘与机器学习的预测模型,并通过实证分析验证了其在波动率预测中的有效性。研究结果显示,该模型在预测准确性和识别非线性因素方面优于传统的均值回归模型,尤其在捕捉突发事件对波动率的影响上表现出色。
主要观点
-
波动率的研究意义
波动率是金融资产价格变动的速率,对期货和期权交易具有重要影响。它不仅关系到做市商的成本与风险,也是期权定价的关键参数。低频波动率具有较长的均值回归特性,但同时也可能受到突发事件的影响,表现出非线性波动和尾部风险。 -
研究方法
采用 DP-Sent-LDA 机器学习模型进行文本挖掘,从新闻资讯中提取商品价格影响因素。通过归因分析和代理指标选择,构建了涵盖市场、宏观和生产三大类的30多种影响因素,并将其转化为日频数据进行波动率预测。 -
预测模型优势
预测模型在拟合优度(0.3779)上优于均值回归模型(0.2777),并能捕捉到非线性因素和尾部风险。模型通过引入多个影响因子,能够更全面地反映波动率的变化趋势。 -
模型在实际案例中的表现
在俄乌冲突前,模型通过运输费用等小众因子提前识别了原油价格的异动,从而提高了预测效果。尽管地缘政治因素在冲突发生后出现滞后性,但模型仍能通过其他非线性因子弥补预测偏差。 -
最新预测情况
当前预测结果显示,大部分商品的未来月波动率将上升,仅少数品种如生猪、豆粕预计会下降。
关键信息
1. 文本挖掘模型与影响因素识别
- 模型选择:采用 DP-Sent-LDA 模型,通过句子级别的主题建模提升文本信息提取的准确性。
- 影响因素分类:将影响因素分为市场因素、宏观因素和生产因素三大类,其中市场因素包括现货、期货、国际市场及相关市场;宏观因素包括政策、政治和经济;生产因素包括内部和外部。
- 代理指标:为每个影响因素寻找对应的代理指标,如“现货价格”对应“现货价格数据”、“政治冲突”对应“地缘政治指数”、“运输费用”对应“波罗的海干散货运价”。
2. 数据处理与模型构建
- 数据处理:对日频价格类数据计算20日滚动波动率,对非价格类数据计算其20日滚动波动率,并通过 z-score 标准化进行数据归一化。
- 回归模型:采用 Lasso 回归模型,其通过 L1 正则化实现变量选择和防止过拟合,提升模型的解释力和预测能力。
- 预测逻辑:使用未来20日波动率减去历史20日波动率作为目标变量,结合历史波动率得到未来20日的波动率预测。
3. 模型实证分析
- 预测准确率:模型预测准确率达 72.1%,优于均值回归模型。
- 翘尾效应:模型在波动率预测中出现了与历史波动率一致的翘尾效应,说明其能捕捉到非线性波动和尾部风险。
- 归因分析:通过因子贡献度、因子系数和因子值的分析,揭示波动率变化的驱动因素,为市场监控提供依据。
4. 案例分析
- 俄乌冲突案例:模型在冲突前通过小众因子(如运输费用)提前捕捉到原油价格异动,提升了预测效果。
- 地缘政治滞后性:地缘政治因素在冲突发生后出现滞后,但模型通过其他非线性因素弥补了这一不足。
结论
本文研究证明,基于 AI 文本挖掘的波动率预测模型在低频波动率预测中表现优于均值回归模型,尤其在识别非线性因素和尾部风险方面具有显著优势。该模型能够更全面地捕捉市场波动的驱动因素,为投资者和做市商提供更具参考价值的波动率预测结果,有助于降低市场不确定性带来的风险。
试读结束,高清完整版pdf/doc/ppt,请点下载