AI模型如何一箭多雕:多任务学习-20230506-华泰证券-20页_1mb
报告摘要
AI模型如何一箭多雕:多任务学习总结
核心内容
本研究探讨了多任务学习(Multi-Task Learning, MTL)在量化选股场景中的应用。通过引入多任务机制,训练全连接神经网络同时预测未来10日和20日的收益率排序,并采用不确定性加权(Uncertainty Weight, UW)或动态加权平均(Dynamic Weight Average, DWA)方式对损失函数进行加权,结果表明多任务学习在合成因子测试和指数增强组合回测指标上均优于单任务学习(Single-Task Learning, STL)。模型规模扩大时,多任务学习的优势更为显著,且多任务学习在时序上的表现更加稳定。
主要观点
-
多任务学习的优势:
- 提高模型泛化能力,增强特征学习;
- 通过辅助任务对主任务进行正则化,减少过拟合;
- 可视为一种隐式的数据增强方式,提升模型鲁棒性;
- 在合成因子测试和组合回测中表现更优。
-
模型架构与参数共享:
- 采用硬参数共享机制,底部层共享,顶部层独立;
- 软参数共享通过正则化提高参数相似性;
- 本文采用硬参数共享,且模型规模扩大有助于多任务学习效果提升。
-
损失加权方式:
- UW:利用任务不确定性作为权重,损失函数中不确定性越大,对模型更新的贡献越小;
- DWA:根据任务历史损失函数值调整权重,保持学习速率一致;
- GLS:使用几何均值作为总损失;
- RW:随机权重,总和为0。
-
测试结果:
- 隐单元数为256时,多任务学习的加权RankIC均值和信息比率均优于单任务学习;
- 多任务学习在子任务预测集成模型中表现更稳定;
- 随着模型规模扩大,多任务学习优势更加明显;
- 但隐单元数扩大至1024时,合成因子RankIC提升,指增组合信息比率下降,存在因子合成与组合优化错配问题。
-
预测相关性分析:
- 多任务学习中10日和20日预测值相关性更高;
- 通过协同训练,多任务学习模型内部预测值相关性更强。
关键信息
模型结构与参数设置
- 基线模型:单任务学习(STL),隐单元数为64或256;
- 多任务模型:隐单元数为64或256,采用UW或DWA方式加权;
- 网络结构:前两层为任务共享层,第三层为任务特异层;
- 组合优化:使用10日预测、20日预测、集成预测(等权均值);
- 测试集划分:训练集为252×6个交易日,验证集为252×2个交易日,测试集为252×0.5个交易日;
- 早停次数:20次;
- 学习率:0.0001;
- 优化器:Adam;
- 随机数种子:5组,取均值;
- 调仓周期:每5个交易日一次;
- 单次调仓单边换手率上限:15%;
- 交易价格:使用VWAP(成交量加权平均价)。
特征与标签
- 特征:42个基本面和量价因子;
- 标签:未来10日或20日收益率在截面上的排序;
- 因子预处理:5倍MAD缩尾、Z-score标准化、缺失值填为0;
- 数据来源:Wind、朝阳永续、华泰研究。
回测指标对比
- 年化收益率:mtl_dwa_256(19.46%) > stl_64(17.44%) > stl_256(18.99%);
- 年化波动率:mtl_dwa_256(25.95%) ≈ stl_64(26.24%) ≈ stl_256(26.16%);
- 夏普比率:mtl_dwa_256(0.75) > stl_64(0.66) > stl_256(0.73);
- 信息比率:mtl_dwa_256(2.77) > stl_64(2.45) > stl_256(2.55);
- 超额收益最大回撤:mtl_dwa_256(8.61%) < stl_64(10.14%) < stl_256(12.41%);
- 相对基准月胜率:mtl_dwa_256(2.01) > stl_64(1.52) > stl_256(1.36);
- 年化双边换手率:mtl_dwa_256(16.14) ≈ stl_64(16.17) < stl_256(16.17)。
风险提示
- 人工智能模型基于历史数据总结规律,可能在未来失效;
- 存在过拟合风险;
- 深度学习模型受随机数影响较大;
- 本文模型调仓频率较高,假设以VWAP成交,忽略其他交易层面因素。
未尽之处
- 任务设置:目前仅测试了不同时间区间的收益率预测,未来可探索分类、回归、夏普比率等任务;
- 加权方式:目前采用UW和DWA,未来可测试GLS、RW等其他加权方式;
- 学习机制:当前使用硬参数共享,未来可探索软参数共享、注意力机制等;
- 因子与组合优化匹配问题:当模型规模扩大时,合成因子表现提升,但指增组合信息比率下降,需进一步研究如何优化匹配。
参考文献
- Abdulnabi, A. H., Wang, G., Lu, J., & Jia, K. (2015). Multi-task CNN model for attribute prediction.
- Caruana, R. (1997). Multitask learning.
- Chennupati, S., Sistu, G., Yogamani, S., & Rawashdeh, S. A. (2019). Multinet++: multi-stream feature aggregation and geometric loss strategy for multi-task learning.
- Hashimoto, K., Xiong, C., Tsuruoka, Y., & Socher, R. (2016). A joint many-task model.
- Kendall, A., Gal, Y., & Cipolla, R. (2017). Multi-Task Learning Using Uncertainty to Weigh Losses for Scene Geometry and Semantics.
- Lin, B., Feiyang, Y. E., Zhang, Y., & Tsang, I. (2022). Reasonable Effectiveness of Random Weighting.
- Liu, S., Johns, E., & Davison, A. J. (2018). End-to-end multi-task learning with attention.
- Ma, J., Zhao, Z., Yi, X., Chen, J., Hong, L., & Chi, E. H. (2018). Modeling task relationships in multi-task learning with multi-gate mixture-of-experts.
- Ma, T., & Tan, Y. (2020). Adaptive and dynamic knowledge transfer in multitask learning with attention networks.
- Ma, T., & Tan, Y. (2022). Stock ranking with multi-task learning.
- Misra, I., Shrivastava, A., Gupta, A., & Hebert, M. (2016). Cross-stitch networks for multi-task learning.
- Ruder, S. (2017). An overview of multi-task learning in deep neural networks.
- Suddarth, S. C., & Kergosien, Y. L. (1990). Rule-injection hints as a means of improving network performance and learning time.
- Yang, Y., & Hospedales, T. (2016). Deep multi-task representation learning: A tensor factorisation approach.
- Zhao, J., Du, B., Sun, L., Zhuang, F., Lv, W., & Xiong, H. (2019). Multiple relational attention network for multi-task learning.
图表说明
- 图表1:部分测试模型超额收益表现(回测期2011-01-04至2023-04-28,基准为中证500);
- 图表2:测试模型回测绩效;
- 图表3:多任务学习的硬参数共享机制;
- 图表4:多任务学习的软参数共享机制;
- 图表5:Cross-stitch网络结构;
- 图表6:多门专家混合模型(MMoE)结构;
- 图表7:多任务学习应用于股票排序问题;
- 图表8:主要测试模型;
- 图表9:网络结构(隐单元数为256);
- 图表10:选股模型构建方法;
- 图表11:42个因子;
- 图表12:合成因子评价指标;
- 图表13:回测绩效;
- 图表14:加权RankIC均值;
- 图表15:信息比率;
- 图表16:加权RankIC均值对比(隐单元数为64或256);
- 图表17:信息比率对比(隐单元数为64或256);
- 图表18:加权RankIC均值差(10日预测);
- 图表19:加权RankIC均值差(20日预测);
- 图表20:加权RankIC均值差(10日与20日预测集成);
- 图表21:超额收益差(10日预测);
- 图表22:超额收益差(20日预测);
- 图表23:超额收益差(10日与20日预测集成);
- 图表24:加权RankIC均值(隐单元数为64、256或1024);
- 图表25:信息比率(隐单元数为64、256或1024);
- 图表26:预测值相关性分析(隐单元数为256)。
总结
多任务学习通过共享网络参数,提升模型的泛化能力与预测稳定性。在量化选股场景中,多任务学习在合成因子测试和指增组合回测中均优于单任务学习,且随着模型规模扩大,优势更加显著。然而,当模型规模过大时,合成因子表现提升,但组合优化效果下降,提示需要进一步研究因子与组合优化的匹配问题。此外,多任务学习在时序上的表现更稳定,但其效果并非始终一致,需进一步探索不同任务设置和加权方式对模型性能的影响。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载