转债入门手册之六:如何利用机器学习方法构建转债择券模型-20200824-广发证券-19页_1mb
报告摘要
转债入门手册之六:如何利用机器学习方法构建转债择券模型
核心内容
本报告探讨了如何利用机器学习方法构建可转债择券模型,旨在解决传统定价方法在复杂转债产品中的适应性不足问题。通过对比随机森林、XGBoosting和支持向量机(SVM)三种方法,展示了它们在转债择券策略中的应用效果和优势。
主要观点
- 机器学习的优势:可转债的复杂性使得传统定价模型难以准确捕捉其特征。机器学习的“黑箱”特性能够避免对模型做出过多假设,从而更灵活地应对复杂的市场环境。
- 模型选择:随机森林、XGBoosting和支持向量机分别代表了集成学习中的Bagging和Boosting方法,以及基于超平面划分的模型,各有其适用场景和优势。
- 回测结果:三种模型在样本测试区间内均表现优于中证转债指数,其中随机森林在稳定性和运算效率上占优,XGBoosting在累计收益和准确率上表现最佳,SVM则略逊一筹。
关键信息
一、为何引入机器学习方法?
- 传统定价方法(如B-S模型)在转债定价中存在适应性不足的问题。
- 投研人员的经验虽有助于预判,但受限于主观偏差和信息处理能力。
- 机器学习方法通过数据训练,使模型积累经验,从而更准确地模仿人脑的判断过程。
二、方法介绍
1. 随机森林(Random Forest)
- 原理:基于决策树和集成学习思想,通过自助采样(Bootstrap)生成多个决策树,形成“森林”以提高模型的稳定性和泛化能力。
- 优势:计算效率高,模型稳定性强,适合处理复杂数据集。
- 代码思路:通过多次采样和特征随机选择构建多个决策树,并在训练过程中优化信息增益。
2. XGBoosting
- 原理:基于GBDT的改进方法,通过损失函数的正则化项优化模型性能,使用贪心算法寻找最优分割点。
- 优势:在累计收益和准确率上表现突出,尤其在2020年后效果显著。
- 代码思路:使用贪心法对训练集进行分割,通过不断迭代优化模型参数。
3. 支持向量机(SVM)
- 原理:在样本空间中寻找最大间隔的超平面,以实现最优分类。
- 优势:在高维空间中具有较强的分类能力。
- 劣势:在低维数据中表现较弱,且计算效率较低。
- 代码思路:通过优化拉格朗日乘子来求解支持向量和超平面。
三、回测流程
- 数据收集:使用2017年1月至2020年5月15日的转债数据。
- 数据清洗:剔除成交量为0、数据长度不足、信用评级较低、规模较小的债券。
- 特征提取:包括收盘价、纯债价值、转股溢价率、主体信用评级、债券余额和成交量。
- 标签构建:以“过去一个月中转债价格是否上涨”作为标签。
- 训练与测试:采用滚动窗口法,将数据分为23个月的有效数据集,其中10个训练集和10个测试集。
- 模型训练与调参:在训练集内进行5折交叉验证,选取AUC最优的参数用于测试。
- 样本外预测:等权买入预测概率前10名的转债,持有一个月后换仓。
四、结果分析
| 指标 | 随机森林 | XGBoosting | SVM |
|---|---|---|---|
| 运行时间(秒) | 24.31 | 38.41 | 34.62 |
| AUC值 | 0.9083 | 0.9124 | 0.8991 |
| 累计收益率 | 28.26% | 33.09% | 21.20% |
- 随机森林:表现稳定,累计收益率接近30%,运算效率高。
- XGBoosting:累计收益最高,但前期波动较大,后期表现优异。
- SVM:表现最弱,累计收益最低,运算时间较长。
五、风险提示
- 转债交易和发行规则可能发生变化,影响模型的有效性。
- 模型回测仅用于方法演示,实际策略需进一步优化和验证。
总结
本报告通过实际测试展示了机器学习方法在转债择券中的应用效果。随机森林和XGBoosting在不同维度上展现出优势,而SVM表现较弱。尽管机器学习方法在预测能力和收益上优于传统方法,但其效果仍受数据质量和市场变化的影响,需持续优化和验证。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载