2017-人工智能系列之一:人工智能选股框架及经典算法简介_36页-3mb
报告摘要
人工智能选股框架及经典算法简介总结
核心内容
本文介绍了人工智能在投资领域的应用,特别是机器学习方法的基本框架与常用算法。重点在于帮助读者理解人工智能并非神秘,而是基于数理模型和计算机系统模拟人类认知过程的工具。通过机器学习算法,可以挖掘数据中隐藏的规律,并用于预测股票涨跌幅、分类等任务。
主要观点
- 人工智能与机器学习的本质:人工智能和机器学习是通过数理模型和多学科成果,模拟人类的感知、推理、学习和决策过程,以达到预测和分类的目的。
- 机器学习的基本流程:包括数据获取、特征提取、数据转换、模型训练、模型选择和模型预测。
- 模型训练与验证:模型选择的关键在于避免过拟合和欠拟合,通过交互验证和评价指标来选择最优模型。
- 监督学习与非监督学习:监督学习用于有标签的数据,如预测涨跌幅;非监督学习用于探索数据内在规律,如聚类和降维。
- 常见机器学习方法:包括线性回归、岭回归、Lasso回归、逻辑回归、支持向量机、决策树、随机森林、AdaBoost、神经网络、K最近邻等。
关键信息
机器学习基本框架
- 数据获取:需要大量、高质量的数据,如金融领域的雅虎财经、万得终端等。
- 特征提取:从原始数据中提取有信息量的特征,如市盈率、ROE等。
- 数据转换:处理缺失值、标准化、降维等,以提高模型的准确性和稳定性。
- 模型训练:根据问题类型选择合适的模型,如回归或分类。
- 模型选择:通过交互验证选择最优模型,如K折交互验证。
- 模型预测:模型在训练后用于预测新数据,需要动态调整以适应变化的规律。
交互验证与模型评价
- 交互验证:将数据划分为训练集和验证集,以避免过拟合。
- 模型评价指标:包括均方误差(MSE)、分类正确率、命中率、精确率、虚报率、ROC曲线和AUC值等。
- 评估模型:通过多个指标综合判断模型的优劣,特别是对罕见病或不平衡数据的评价。
监督学习方法
线性回归与广义线性模型
- 线性回归:用于预测连续变量,如股票涨跌幅。
- 岭回归与Lasso回归:通过正则化方法减少过拟合,Lasso回归更倾向于选择稀疏特征。
- 逻辑回归:用于二分类问题,如预测股票涨跌,通过Sigmoid函数确保预测值在0到1之间。
- 多分类问题:通过有序多分类和OvR策略解决,如预测股票涨、跌、震荡。
支持向量机(SVM)
- 分类原理:通过超平面划分样本空间,解决线性与非线性分类问题。
- 核函数:包括线性核、多项式核、高斯核,用于非线性分类。
- 优化目标:在允许一定错误率的前提下,最大化分类边界。
决策树与随机森林
- 决策树:通过特征分裂构建树形结构,用于分类。
- 信息增益:选择分裂规则,使得信息增益最大。
- 随机森林:通过Bagging方法集成多个决策树,提高预测稳定性与准确性。
非监督学习方法
- 聚类:如K均值、分层聚类、谱聚类,用于数据分组。
- 降维:包括主成分分析(PCA)、偏最小二乘法(PLS)、Fisher线性判别法(FLD),用于减少数据维度,提升模型性能。
总结和展望
本文通过结合投资领域的实际例子,对机器学习方法进行了系统介绍,帮助读者理解其原理与应用。未来,随着数据的不断积累和算法的持续优化,人工智能在投资领域的应用将更加广泛和深入。同时,本文也为后续的系列研究奠定了基础,为开发成功的机器学习投资策略提供了理论支持与实践指导。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载