20251212-华安证券-_学海拾珠_系列之二百五十九_基于马氏距离K-Means聚类的价值-成长股分类_29页_2mb
报告摘要
基于马氏距离K-Means聚类的价值-成长股分类总结
核心内容
本研究探讨了在价值与成长投资风格分类中,如何通过集成K均值聚类与马氏距离来提升标普500股票分类的准确性与稳定性。研究基于2008年至2023年的Refinitiv数据,通过比较标准K均值MD、K均值++MD及新型K均值++MD混合算法,验证了混合算法在簇稳定性、经济可解释性及时间一致性方面的优势,为无监督学习在金融风格分类中的应用提供了方法论创新与实践洞见。
主要观点
- 混合算法优势:K-Means++MD混合算法通过结合K-Means++初始化和马氏距离计算,有效解决传统K均值对初始质心敏感的问题,显著提升了聚类稳定性与鲁棒性。
- 聚类效果提升:该方法将戴维森堡丁指数(DBI)降至1.86,特征标准差锐减至0.03,优于基准方法(如K-Means MD的DBI为2.06)。
- 特征选择的重要性:仅包含市净率(P/B)和市盈率(P/E)的简约特征集产生最优聚类效果,而引入增长类指标会降低分类清晰度。
- 纯化组合的经济意义:基于轮廓系数和距离比率构建的“纯价值”与“纯成长”组合,在2008-2023年间展现出显著的风险调整后超额收益,且在行业分布上符合传统风格定义。
关键信息
1. 混合算法提升聚类稳定性与鲁棒性
- K-Means++MD混合算法通过多次初始化运行,选择具有最低马氏惯性(MI)的配置,进一步增强聚类一致性。
- 实证结果显示,该算法在簇稳定性、经济可解释性及时间一致性方面优于传统方法。
2. 特征复杂度与分类效果的权衡
- 简约特征集(P/B和P/E)产生最优聚类效果(DBI=0.93,轮廓系数=0.32)。
- 引入增长类指标(如动量、季度增长率)反而降低分类清晰度(如“增长”组合DBI升至1.68)。
3. 纯化组合的绩效表现
- “纯成长”组合夏普比率达0.66,最大回撤为-32.4%,显著优于基准指数。
- “纯价值”组合由金融股主导,“纯成长”组合由科技股主导,符合传统风格定义。
4. 方法论创新
- K-Means++初始化:通过概率选择初始质心,增强初始化的分散性和稳定性。
- 马氏距离(MD):考虑特征间的相关性和尺度差异,优化簇分配。
- 聚类验证指标:使用轮廓系数和DBI评估聚类质量,其中轮廓系数接近+1表示簇定义明确,DBI值越低表示聚类结构越优。
5. 数据预处理与标准化
- 应用正态分位数转换(NQT)标准化数据,减轻异常值影响,提高可比性。
- 处理缺失数据,排除关键财务比率缺失或为负的股票,确保数据完整性。
6. 实证分析结果
- 仅使用P/B和P/E的特征集,产生最低的DBI和最高的轮廓系数,显示最佳分类效果。
- 簇质心随时间演变的分析表明,传统估值比率具有稳定的分离性,而增长指标则表现出较高的噪声和重叠。
主要结论
- K-Means++MD混合算法在提升聚类稳定性、减少对初始条件的敏感性方面表现出色,为无监督学习在金融分类中的应用提供了有效工具。
- 简约的财务指标(如P/B和P/E)在价值-成长分类中更具判别力,避免冗余指标带来的噪声。
- 纯化组合在绩效上优于基准指数,验证了聚类结果的经济意义和实用性。
风险提示
- 文献结论基于历史数据和海外研究,不构成任何投资建议。
- 金融数据具有复杂性,需结合市场变化和经济环境进行综合分析。
方法论与数据
- 数据来源:2008年至2023年标普500成分股季度数据。
- 关键财务指标:P/B、P/E、P/FCF、P/Rev、1Y-Mom、AQGR BV、AQGR EPS、AQGR Rev。
- 数据预处理:应用NQT标准化,处理缺失数据,使用滚动十二个月(TTM)方法平滑季节性波动。
聚类方法
- K均值聚类:通过最小化簇内方差进行分类,但传统欧氏距离忽略特征相关性。
- 马氏距离:考虑特征相关性与尺度差异,提高分类准确性。
- K-Means++MD混合算法:结合K-Means++初始化与马氏距离,优化质心选择与距离度量,提升聚类稳定性。
交易模拟与绩效评估
- 交易模拟覆盖2008年3月至2023年12月,季度再平衡。
- 构建五个投资组合:全股票、价值、成长、纯价值、纯成长。
- 使用风险调整后绩效指标(如夏普比率、最大回撤)评估组合表现。
总结
本研究通过引入K-Means++MD混合算法,提升了价值-成长股分类的准确性与稳定性,验证了简约财务指标在分类中的优势,并展示了纯化组合在实际投资中的应用潜力。研究为无监督学习在金融领域的应用提供了方法论支持,强调了在股票分类中特征选择与算法优化的重要性。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载