20170804-华泰证券-华泰人工智能系列之三_人工智能选股之支持向量机模型_33页_4mb
报告摘要
金工研究:支持向量机模型在选股中的应用分析
核心内容概述
本报告为华泰人工智能选股系列的第三篇,重点探讨了支持向量机(SVM)模型在多因子选股中的应用,包括线性支持向量机、核支持向量机和支持向量回归(SVR)等模型的测试与比较。报告旨在通过系统测试,寻找最优的SVM模型以提升选股策略的收益表现和信息比率,同时评估其在不同市场中的适用性。
主要观点
- 支持向量机的优势:SVM是一种广泛应用的机器学习方法,特别适用于非线性分类和回归问题。相比于线性回归模型,SVM在多种选股策略中表现更优,尤其是高斯核SVM。
- 模型构建流程:包括特征提取、标签生成、特征预处理、样本内训练、交叉验证调参和样本外测试等步骤,最终生成对个股未来收益的预测值。
- 模型性能评估:采用正确率、AUC值、年化收益率、信息比率、最大回撤等指标对模型进行评估,其中AUC值被作为调参的重要依据。
- 核函数选择:高斯核SVM在多个策略中表现优于其他核函数,如线性核、多项式核和Sigmoid核,特别是在测试集正确率和AUC值上。
- 参数优化:通过网格搜索法对惩罚系数 $C$ 和 $\gamma$ 值进行优化,以达到模型在样本外的最优表现。
- 策略构建:基于SVM的预测结果构建了沪深300、中证500和全A股的选股策略,测试结果显示高斯核SVM在超额收益和信息比率上表现突出。
关键信息
1. 高斯核SVM的表现
- 沪深300成分股内选股:超额收益为 $4.9%$,信息比率为1.22。
- 中证500成分股内选股:超额收益为 $9.0%$,信息比率为2.37。
- 全A股选股:相对于中证500的超额收益为 $21.1%$,信息比率为3.66。
2. 高斯核SVM的优势
- 测试集正确率:达到 $56.25%$,优于线性核($55.66%$)、3阶多项式核($53.75%$)、7阶多项式核($50.03%$)和Sigmoid核($55.66%$)。
- 回测表现:优于支持向量回归模型。
3. 惩罚系数 $C$ 的影响
- 较大 $C$ 值:模型对错误分类容忍度低,训练集正确率高,但测试集正确率可能下降。
- 较小 $C$ 值:模型对错误分类容忍度高,倾向于最大化分类间隔,但可能影响模型性能。
- 最优参数选择:通过网格搜索法,选取交叉验证集AUC值最高的参数作为最终参数。
4. $\gamma$ 值的影响
- 较大 $\gamma$ 值:样本在高维空间中分布更稀疏,分类边界更复杂,可能引发过拟合。
- 较小 $\gamma$ 值:分类边界更简单,模型稳定性更高。
- 最优 $\gamma$ 值:在高斯核SVM中,$\gamma = 0.01$ 表现最优。
5. 选股模型涉及的因子
- 因子分类:包括估值、成长、财务质量、杠杆、市值、动量反转、波动率、股价、beta、换手率、情绪、股东等。
- 因子描述:如净利润(TTM)/总市值、营业收入(TTM)/总市值、ROE(最新财报,YTD)等。
6. 模型评价指标
- 正确率:衡量模型分类的准确程度。
- AUC值:反映模型在不同分类阈值下的综合性能,与分类阈值无关,更具普适性。
- 年化收益率、信息比率、最大回撤:用于评估策略的实际表现。
模型测试流程
-
数据获取:
- 股票池:沪深300成分股、中证500成分股、全A股。
- 剔除ST股票、停牌股票、上市3个月内的股票。
- 样本内区间:2005-01-31至2011-12-31。
- 样本外区间:2011-01-31至2017-04-28。
-
特征和标签提取:
- 特征:70个因子暴露度。
- 标签:个股下一期的超额收益(以沪深300指数为基准)。
-
特征预处理:
- 中位数去极值。
- 缺失值处理。
- 行业市值中性化。
- 标准化。
- 主成分分析(PCA)以减少共线性。
-
训练集与交叉验证集划分:
- 分类问题:按90%和10%的比例划分。
- 回归问题:直接合并样本进行训练和验证。
-
参数优化:
- 采用网格搜索法对 $C$ 和 $\gamma$ 值进行遍历,选取最优参数。
-
样本外测试:
- 使用最优参数对样本外数据进行预测,构建选股策略并进行回测。
-
模型评价:
- 评估模型性能和策略表现,包括正确率、AUC、年化收益率、信息比率等。
模型测试结果
- 高斯核SVM(全A选股):
- 交叉验证集AUC最高为0.6137,测试集AUC为0.5870。
- 预测值与真实收益率的相关系数较高,表明模型预测能力较强。
- Sigmoid核SVM(全A选股):
- 参数优化结果显示,最优参数组合为 $C=10$,$\gamma=3e-5$。
- 在不同阈值下,模型的正确率和AUC值有所变化,但整体表现不如高斯核SVM。
- 支持向量回归(SVR):
- 回测表现不如支持向量机(SVM)。
- 线性回归:
- 作为对照组,表现不如SVM模型。
总结和展望
- 模型选择:高斯核SVM在多因子选股中表现最佳,尤其是在全A股策略中。
- 参数优化:C和$\gamma$的合理选择对模型性能至关重要,需通过网格搜索法进行优化。
- 策略构建:SVM模型可有效用于构建选股策略,提升超额收益和信息比率。
- 未来研究方向:进一步优化模型参数,探索更多核函数的适用性,以及与其他机器学习方法的结合。
风险提示
- 历史经验总结:支持向量机模型构建的选股策略是基于历史数据的总结,存在失效的可能。
- 模型过拟合:在某些情况下,模型可能对训练数据表现良好,但对测试数据表现不佳,需谨慎处理。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载