多因子系列报告之十:因子正交与择时,基于分类模型的动态权重配置-20180310-光大证券-23页-2mb
报告摘要
因子正交与择时:基于分类模型的动态权重配置
核心内容概述
本报告探讨了因子正交化处理在因子择时模型中的应用,旨在提升因子收益的预测能力并实现因子权重的动态配置。通过正交化处理,可以有效降低因子间的共线性,从而提高模型的稳定性与解释能力。同时,报告评估了支持向量机(SVM)和随机森林等分类模型在因子择时中的表现,并指出随机森林在样本外回测中表现更优。
主要观点与关键信息
1. 因子正交化处理
- 目的:降低因子间共线性,避免重复暴露,提高因子收益的解释能力。
- 方法:采用对称正交方法,其优势在于正交后因子值与原始值的相似度高,且计算效率高。
- 效果:
- 正交化后因子间相关性显著降低,大部分因子的R²值提升。
- 在2017年市场风格切换期间,正交后的因子组合表现优于未正交组合。
2. 因子择时模型
- 模型类型:
- 条件期望模型:基于因子收益与条件变量的联合正态分布假设,但该假设在实际中难以满足。
- 分类预测模型:不受正态分布假设限制,包括逻辑回归、决策树、支持向量机等。
- 分类模型优缺点:
- 逻辑回归:可输出预测概率,但对非线性分类问题处理能力较弱。
- 决策树:直观易理解,可处理非线性问题,但容易过拟合。
- 支持向量机(SVM):适合处理高维和小样本数据,预测能力较强。
- 随机森林:基于决策树的提升方法,表现稳定,且在样本外回测中具有较好的收益表现。
3. 择时变量的选择
- 外部变量包括宏观经济环境、货币政策、市场状态、因子收益与波动。
- 具体变量如下:
- 货币政策变量:3个月国债收益率、M1货币供应量同比增长率。
- 经济环境变量:CPI、PPI、规模以上工业增加值同比增长率。
- 市场状态变量:期限利差(TS)、信用利差(CS)、沪深300与中证1000收益差值(RET_Spread)、波动差值(STD_Spread)。
- 因子收益衍生变量:因子收益与波动的加权移动平均值。
4. 模型实证效果
- 样本内预测准确度:
- SVM预测准确度较高,达到70%以上。
- 随机森林表现稳定,且信息比和夏普比优于其他模型。
- 逻辑回归表现最差,未在样本内预测中跑赢未择时的正交化组合。
- 样本外回测表现:
- 随机森林:样本外绝对年化收益8.8%,年化超额收益20.8%,信息比2.34,表现较为稳定。
- SVM:样本外年化收益44%,信息比2.99。
- 逻辑回归:未在样本外表现优异,未跑赢未择时的正交化组合。
模型构建与参数设置
- 调仓频率:月度调仓。
- 训练集区间:2006-12-31至2015-12-31。
- 测试集区间:2016-01-01至2018-02-28。
- 权重调整逻辑:
- 若模型预测方向与因子历史方向一致,则权重不变。
- 若不一致,则根据R²值调整权重。
- 参数设置:
- SVM:训练集长度24,核函数为rbf,权重调整系数0.1,阈值r²为0.05。
- 随机森林:训练集长度20,最大深度3,决策树数量20,权重调整系数0.1,阈值r²为0。
- 逻辑回归:训练集长度36,权重调整系数0.2,阈值r²为0.1。
投资建议
- 基于对称正交处理的因子择时模型能够有效提升因子收益的预测能力。
- 随机森林在样本外回测中表现稳定,适合用于因子择时模型的构建。
- SVM在样本内预测准确度上表现优于随机森林,但随机森林在样本外表现更优。
- 综合考虑模型的稳定性与收益表现,建议采用随机森林作为因子择时模型的首选。
风险提示
- 所有模型测试结果基于历史数据,存在模型失效的风险。
- 因子择时模型的效果依赖于外部变量的选取与模型参数的优化,需持续关注市场变化。
- 模型在不同市场环境下可能表现不一,需进行充分的回测与验证。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载