20170927-兴业研究-兼论利差之谜在中国_狼真的来了__论机器学习在分析新债发行收益率中的应用_21页_1mb
报告摘要
信用策略报告总结
核心内容
本文首次将随机森林机器学习模型应用于无担保新债发行收益率的分析,旨在揭示中国信用利差的构成与影响因素。研究团队通过分析2006年1月至2017年8月期间发行的所有无担保短融、中票、公司债和企业债(共11050只),并结合兴业研究覆盖的主体评分数据,构建了一个具有较强解释力和可延展性的模型。
主要观点
-
信用风险与基准利率是关键解释变量
- 信用风险(如兴业主体评分、外部评级、所属行业、地区、公司属性等)和基准利率对信用利差具有显著解释力。
- 外部评级虽然存在虚高问题,但在实际应用中仍对利差解释力度强,主要因其影响投资者配置约束和提供免费的违约信息。
-
模型解释力强,但仍有提升空间
- 随机森林模型在测试数据中表现出良好的解释能力,91%的测试数据偏差度在100bp以内,72%在50bp以内,40%在20bp以内。
- 特殊条款(如是否可质押)和流动性溢价对利差的影响相对较小,且需进一步细化数据以提升解释力。
-
模型可扩展性强
- 模型不仅适用于无担保新债,也适用于有担保新债和存量债的定价。
- 随着数据的丰富(如主体评分全覆盖、加入担保特征等),模型效果将有更大提升。
关键信息
模型构建过程
- 数据分为训练集(80%)和测试集(20%)。
- 使用200棵决策树构成随机森林,每棵树基于部分样本和部分特征进行训练。
- 决策树通过“少数服从多数”原则对测试集样本进行分类,预测利差。
利差分解公式
$$
\text{利差} = \text{平均预期损失率} + \text{杠杆可操作性} + \text{风险溢价} + \text{不可预期损失的要求回报率} + \text{市场摩擦因素溢价}
$$
$$
= \text{平均违约率} \times (1 - \text{违约后回收率}) + \text{杠杆可操作性} + (\text{风险厌恶程度} + \text{资产波动性}) + \text{不可预期损失的要求回报率} + \text{流动性溢价} + \text{配置约束} + \text{税收溢价}
$$
特征重要性排序
- 按均方误差增量排序:所处省份、外部评级、公司属性、基准利率、兴业主体评分、行业编码。
- 按节点纯度增量排序:外部评级、兴业主体评分、所处省份、公司属性、基准利率、行业编码。
- 上述变量在所有影响利差的特征中均排在前40%。
模型应用与局限性
- 模型无需依赖中债估值,有助于提升定价透明度。
- 对不可预期损失部分的解释能力有限,需研究员结合市场变化(如投资者结构、评级变动、违约事件、政策调整等)进行人工调整。
- 未来可加入更多特征(如担保、投资人保护条款等)以增强模型效果。
模型使用指标汇总
| 公式1 | 公式2 | 使用指标 |
|---|---|---|
| 平均预期损失率 | 违约概率 | 兴业主体评分、所属行业、所属地区、公司属性、外部评级、期限 |
| 杠杆可操作性 | 杠杆可操作性 | 是否可质押 |
| 风险溢价 | 风险厌恶程度 | 基准利率 |
| 不可预期损失的要求回报率 | 不可预期损失的要求回报率 | 投资者结构变化、评级变动、违约事件风波、信用债市场相关政策变动等 |
| 市场摩擦因素溢价 | 流动性溢价 | 发行规模、发行场所 |
| 配置约束 | 配置约束 | 外部评级 |
| 税收溢价 | 税收溢价 | 国开债 |
风险提示
- 模型存在偏差风险,需结合市场实际情况进行人工调整。
- 随机森林模型虽具有较强的可延展性,但其在20bp以内的预测准确度一般,仍需进一步优化。
附录要点
- 数据统计:样本包括无担保短融、中票、公司债和企业债,其中兴业主体评分覆盖率达39.3%。
- 公司属性分类:包括中央国有企业、地方国有企业、公众企业、集体企业、民营企业等。
- 行业分类:涵盖制造业、电力、信息传输、建筑业、采矿业、批发零售业、租赁商务服务、房地产业、金融业、教育、城投等。
- 地区分类:包括直辖市、省份、自治区、特别行政区等。
- 发行场所分类:交易所、银行间、两种都有。
- 期限分布:以年为单位,涵盖短期、中期、长期债券。
- 发行规模分布:样本发行规模差异较大,对模型影响有限。
- 是否可质押:作为杠杆可操作性的重要指标,但解释力较弱。
模型应用前景
- 随机森林模型在信用利差分析中具有显著优势,未来有望在债券定价领域发挥更大作用。
- 机器学习技术的引入,可能对部分金融从业人员的工作方式产生影响,但“狼不一定到了,但可能正在来的路上”。
总结
本文通过引入机器学习技术,对信用利差的构成因素进行了系统分析,揭示了信用风险、基准利率、外部评级等在信用利差中的关键作用。模型具备良好的可解释性和扩展性,为信用债定价提供了新的方法。尽管模型在部分精度范围内表现良好,但仍有优化空间,未来可进一步完善以提升预测能力。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载