机器学习系列报告之三:数据纵横,拓展差分的操作域-20190418-光大证券-21页_2mb
报告摘要
数据纵横:拓展差分的操作域 - 机器学习系列报告之三
核心内容概述
本报告探讨了非整数差分在金融时间序列处理中的应用,旨在平衡数据的记忆性与平稳性。通过引入非整差分的概念,利用后移算子将差分操作域从整数扩展到正实数,并验证了其在不同金融数据中的表现。
主要观点与关键信息
差分操作域的拓展
- 差分操作域的拓展:差分阶数从正整数拓展到正实数,使得数据处理更灵活,能够在满足平稳性的同时保留更多市场信息。
- 非整差分的定义:非整差分通过后移算子 $B$ 的级数展开进行计算,即 $(1 - B)^d X_t$,其中 $d$ 为正实数差分阶数。
平稳性与记忆性的平衡
- 指数与股票的差分需求:大部分指数仅需约0.7阶差分即可满足平稳性要求,此时差分序列与原始序列仍保持约0.9的相关性。
- 不同差分阶数下的表现:0.7阶差分在保持较高相关性的同时满足平稳性,优于1阶差分,避免了信息丢失过多的问题。
信息熵的提升
- 信息熵的定义:信息熵用于衡量信息的不确定性,其计算基于概率分布。
- 非整差分提升信息熵:在0.7阶差分下计算的信息熵比收益率序列更高,能够更好地反映市场环境,从而优化交易策略。
波动因子的优化
- 波动因子的定义:基于价格序列的波动性指标,通常使用收益率序列的标准差计算。
- 非整差分优化波动因子:通过测试,发现1.4至1.5阶差分下波动因子效果最佳,提升了因子的IC与IR值。
- 最优波动因子构建方式:推荐使用 $ \mathrm{STD}(1.5, 10) $,即1.5阶差分和10个交易日的样本长度,以提升选股效果和组合表现。
实证分析结果
- 多空组合表现:在不同股票池中,使用非整差分优化后的波动因子构建的多空组合表现优于传统方式,年化收益和夏普比率均有提升。
- IC与IR表现:在全市场、中证500、沪深300股票池中,非整差分优化后的波动因子IC均值与IR均值显著提高。
非整差分的应用
信息熵指标
- 信息熵在RSRS策略中的应用:配合RSRS择时策略使用信息熵指标,有助于避免错误信号,但边际改善有限。
- 分位数与等距编码:分位数编码和等距编码在不同差分阶数下表现出不同的信息熵特征。
波动因子的优化
- 样本长度与差分阶数的优化:在不同样本长度下测试,发现最优差分阶数在1.4至1.5之间。
- 波动因子效果:在1.5阶差分下,波动因子在多个股票池中表现更优,提升了选股效果和组合收益。
风险提示
- 模型风险:本报告中的测试结果基于模型和历史数据,模型可能存在失效风险。
- 数据验证风险:历史数据可能无法有效验证模型的未来表现,需谨慎对待。
结论
- 非整差分能够有效平衡数据的记忆性与平稳性,提升信息熵和波动因子的表现。
- 推荐使用 $ \mathrm{STD}(1.5, 10) $ 作为波动因子的构建方式,以提高模型效果。
- 需要结合实际市场环境和数据特征,灵活应用非整差分技术,以最大化其带来的信息价值。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载