2017-人工智能系列之一:人工智能选股框架及经典算法简介_35页_3mb
报告摘要
人工智能选股框架及经典算法简介总结
核心内容
本文介绍了人工智能和机器学习在投资领域的应用,重点围绕监督学习和非监督学习方法展开,结合金融投资的实例进行说明,旨在帮助读者理解机器学习的基本原理和应用方式,澄清对人工智能的误解,并构建一个机器学习的投资框架。
主要观点
- 人工智能与机器学习:并非神秘的黑箱,其本质是通过数理模型模拟人类的感知、推理、学习和决策过程,利用算法挖掘数据中的规律。
- 机器学习对象:是数据中的客观规律,这些规律可以是简单的(如勾股定理)或复杂的(如资本市场中的投资决策与收益关系)。
- 机器学习流程:包括数据获取、特征提取、数据转换、模型训练、模型选择和模型预测,其中数据转换和交互验证是模型成功的关键。
- 监督学习与非监督学习:监督学习用于有标签的数据,如预测涨跌幅;非监督学习用于无标签数据,如聚类和降维。
- 模型选择与评价:交互验证用于避免过拟合和欠拟合,模型评价指标包括均方误差、正确率、精确率、命中率、虚报率、ROC曲线和AUC值等。
- 机器学习方法:涵盖线性回归、岭回归、Lasso回归、逻辑回归、支持向量机、决策树、随机森林、AdaBoost、神经网络和深度学习等。
关键信息
机器学习基本流程
- 数据获取:从数据库或网络爬虫获取数据,数据质量是模型成功的基础。
- 特征提取:从原始数据中提取有信息量的特征,如EP因子、ROE_G_q因子等。
- 数据转换:包括缺失值处理、标准化和降维,以提升模型训练效率和准确性。
- 模型训练:根据问题类型选择合适的算法,如监督学习用于预测,非监督学习用于探索数据规律。
- 模型选择:通过交互验证(如K折验证、留一法)选择最优模型和参数,避免过拟合和欠拟合。
- 模型预测:使用训练好的模型对未来数据进行预测,需要持续更新以适应变化的市场规律。
监督学习方法
- 线性回归:用于预测连续变量,如涨跌幅。
- 岭回归和Lasso回归:引入正则化项,用于防止过拟合,其中Lasso回归可以实现特征选择。
- 逻辑回归:用于二分类问题,如预测涨跌,其输出为概率。
- 多分类问题:通过有序多分类或OvR策略解决,如预测股票涨、跌、震荡。
- 支持向量机(SVM):使用核函数将数据映射到高维空间,解决非线性分类问题。
- 决策树与随机森林:决策树用于非线性分类,随机森林通过Bagging方法提高模型的稳定性和预测能力。
- AdaBoost:通过串行方式组合弱分类器,提升模型的分类效果。
非监督学习方法
- 聚类:如K均值聚类,用于发现数据中的结构。
- 降维:如主成分分析(PCA)和Fisher线性判别法,用于减少数据维度,提升模型效率。
附录:模型评价与交互验证
- 均方误差(MSE):用于衡量回归模型的性能,分解为方差和偏差。
- 交互验证:通过将数据分为训练集和验证集,评估模型的泛化能力。
- 模型评价指标:包括正确率、精确率、命中率、虚报率、ROC曲线和AUC值,用于评估分类模型的性能。
总结与展望
本文通过实例和图表直观地展示了机器学习方法的原理和应用,强调了人工智能在投资领域的潜力和挑战。未来,我们将继续深入探讨其他机器学习方法,如强化学习,以及如何在实际投资中应用这些方法,构建有效的投资策略。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载