量化策略:数据挖掘在上市公司财务造假识别中的应用-20171215-申万宏源-25页-1mb
报告摘要
数据挖掘在上市公司财务造假识别中的应用总结
核心内容概述
本文研究了数据挖掘技术在识别上市公司财务造假中的应用,通过构建财务和非财务指标,采用神经网络、支持向量机(SVM)和决策树(C&RT、QUEST、CHAID、C5.0)四种算法对上市公司年报是否造假进行判别分析。研究重点在于解决样本数据分类不平衡问题,并通过加入误分类损失函数来提高模型对造假样本的识别能力。最终发现,决策树模型,尤其是CHAID算法,具有更好的识别效果。
主要观点
- 财务造假的严重性:上市公司财务造假对投资者造成巨大损失,影响资本市场健康发展。典型案例包括美国1999-2002年的财务丑闻、2011年中概股事件以及近年来A股市场频繁出现的财务造假行为。
- 常见财务造假手段:
- 虚增交易(如伪造合同、发票等)
- 虚增资产(如不注销无用资产)
- 提前确认收入
- 利用过渡性科目调节利润
- 隐瞒重大事项(如关联交易、资产重组)
- 数据挖掘技术的应用:通过构建财务与非财务指标,采用数据挖掘方法对财务造假进行识别,提升识别的准确性与稳定性。
- 分类不平衡问题:由于造假样本数量较少,模型容易偏向非造假样本,导致对造假样本识别能力下降。为解决此问题,引入误分类损失函数,使模型更关注造假样本的识别。
- 算法对比分析:
- 神经网络模型:准确率高,但对造假样本识别能力较弱,召回率和F值较低。
- SVM模型:准确率与神经网络相近,但对造假样本识别能力仍较弱。
- 决策树模型:在加入误分类损失函数后,召回率显著提高,尤其CHAID算法表现最优。
- 最优算法选择:CHAID算法在四个决策树中综合表现最佳,准确率为93.16%,召回率为59.41%,精确度为17.78%,F值为27.37%。
关键信息
数据集
- 样本选取:2002年后被中国证监会、沪深交易所公开处罚的A股上市公司,共171条记录。
- 控制样本:采用控制样本匹配法,选取同行业未被处罚的上市公司作为对照,总样本为7839条。
- 数据处理:
- 剔除IPO前及上市当年的造假数据。
- 剔除相关性高的指标,如资产负债率、流动比率、速动比率等。
- 剩余指标包括:
- 财务指标:主营业务毛利率、销售毛利率、应收账款占流动资产比例、预付款项占流动资产比例、其他应收款占流动资产比例等。
- 非财务指标:审计师意见、前一年是否亏损、前五大股东股权集中度等。
- 数据集按7:3比例分为训练集和测试集。
模型构建
- 神经网络:采用多层感知器(MLP)模型,使用Bagging方法增强稳定性。
- SVM模型:使用径向基函数(RBF)核函数,适用于非线性分类。
- 决策树模型:
- 采用Bagging方法,构建10个子模型进行投票。
- 通过加入误分类损失函数(造假样本误判成本为非造假样本的50倍)提高模型对造假样本的识别能力。
识别指标
- 重点指标:
- 审计师意见:负面意见表明公司存在较高造假风险。
- 前一年是否亏损:亏损公司有更强的财务造假动机。
- 其他应收款占流动资产比例:比例偏高可能暗示财务造假。
- 销售毛利率:偏高可能通过关联交易等方式虚增利润。
- 预付款项占流动资产比例:偏高可能用于填补虚增收入带来的资金缺口。
算法性能对比
| 算法 | 准确率 | 精确度 | 召回率 | F值 |
|---|---|---|---|---|
| 神经网络 | 97.90% | 100.00% | 2.94% | 5.71% |
| SVM | 97.74% | 34.78% | 4.71% | 8.29% |
| C&RT | 94.39% | 10.06% | 20.00% | 13.39% |
| QUEST | 90.11% | 7.33% | 30.59% | 11.83% |
| CHAID | 93.16% | 17.78% | 59.41% | 27.37% |
| C5.0 | 74.27% | 7.07% | 89.41% | 13.10% |
总结
- 最优模型:CHAID算法在识别上市公司财务造假方面表现最优,综合性能优于其他模型。
- 模型改进:通过引入误分类损失函数,提升模型对造假样本的识别能力,尤其是在决策树模型中效果显著。
- 实际应用价值:识别财务造假指标(如审计师意见、前一年是否亏损、其他应收款比例、销售毛利率、预付款项比例)对投资者和监管机构具有重要参考意义。
- 研究意义:为识别上市公司财务造假提供了一种系统性的方法,有助于提高投资者的风险防范能力,推动资本市场的健康发展。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载