财务风险预测模型构建与性能评估

财务风险预测模型构建与性能评估

最佳答案 匿名用户编辑于2024/07/19 16:22

通过对财务造假的定性和定量分析,建立一个识别财务相对风险的评分模 型,以期能够进一步在我们的财务选股模型结果中做减法,挑选真正高财务质量的 公司,本质上是做大概率事件,提高模型胜率。

一、选取识别财务造假的特征指标

我们通过梳理国内外财务造假预测模型的特征变量,并结合上文定性分析结 论,筛选能够较好反应A股财务问题的指标。国外关于财务造假预测模型的研究, 最具知名度的是Beneish(1999)的Mscore和Dechow(2011)的Fscore模型。Mscore 和Fscore模型利用阀值能快速判断上市公司财务造假的可能性。

尽管Mscore和Fscore模型在西方实务界已被普遍运用,但国内学者研究发现 这两个模型对于预测国内造假事件的适用性较弱。因此,我们采用国内外实证较认 可的财务造假预测指标,计算标准化得分(行业内部比较,更有现实意义),作为 判断是否有严重盈余管理或造假的参考。

特征变量分为四个类别:资产异常、现金异常、盈利异常和非财务指标。 (1)资产异常。财务造假的“恒等式”:利润表的影响(虚增利润)== 资产负 债表的影响(虚增资产+虚减负债+虚减权益)。财务造假的方式是虚增利润,而虚 增利润的同时必然会影响到资产负债表科目。资产的异常变化分析往往是识别财务 造假的关键。比如通过虚增应收款来虚增收入是最常见的造假方式。因此,我们主 要考查资产异常的变量:应收款项占比、应收变化率、存货占比、存货变化率、应 付款项占比、应付变化率、软资产比例、带息负债率。 (2)现金异常。比如,虚增利润的同时虚增相应的经营现金流入,对应资产 负债表虚增货币资金,这时,可考虑货币资金与利息收入的匹配性。另外,若长期 现销率小于1或自由现金增速小于净利润增速,也应警惕。因此,我们主要考查现 金异常的变量:现金销售率、自由现金流变动率、货币现金异常。(3)盈利异常。主要看盈利的构成是否健康、是否有内在矛盾性、是否融资 目的下的操纵行为等。主要考查盈利异常的:交变量联交易占比、交联交易变化 率、毛利率异常、前一年是否亏损、前一年扣非ROE。 (4)非财务指标。主要有指标:是否再融资、股权集中度、机构持股比例、 董事会规模、是否更换事务所、审计意见。

在特征变量的设计上,考虑到逻辑推理的合理性,主要有以下几个特点: ①采用指标的行业分位值。考虑到行业特性不同,多项指标转化为行业分位值 (申万二级行业),进行百分比排位,取值0-100%。若采用加入行业虚拟变量的 做法,则会损失大量的自由度。 ②采用指标的变化率。考查特征指标的突变情况,即引入指标的环比变化率作 为解释变量。由此,通过指标的异常变化,判断是否有财务风险的嫌疑。 ③控制样本采用全样本,即全市场非造假公司。这样可避免样本选择的偏差, 与学术界一般的做法(选择1:1的配对样本)有别。

二、搭建财务风险预测模型及其应用分析

(1)模型选择

本文参考国内外关于财务风险预测模型的研究成果,建立了适用于A股市场, 且更有实际应用价值的财务风险预测模型。在模型层面,本文采用了XGBoost机 器学习模型对财务风险进行识别。XGBoost是一种特殊的梯度提升树模型 (Gradient Boost Decision Trees)。梯度提升树模型的核心思想是:将损失函数 看作拟合值的函数,计算损失函数对拟合值的负梯度,用决策树拟合负梯度并最终 加到原拟合值上,让损失函数不断沿着梯度方向减小,使得拟合值不断逼近真实 值。

本文选择XGBoost模型对上市公司财务风险进行识别,取得了不错的效果。 XGBoost模型优点在于: ①允许特征中存在一定数量的缺失值,避免因特征缺失值删失数据而导致偏 误。XGBoost在处理缺失值时有其独特的机制。与其他机器学习算法不同, XGBoost在构建树模型时可以自动处理缺失值,而无需预先进行缺失值填补或删 除。该模型先利用特征下无缺失值的数据选择决策树的节点,以信息增益最大化为 目标,把缺失值统一归类到左叶子节点或右叶子节点。这样,存在缺失值的数据也 可以通过决策树进行预测。 ②对特征异常值的敏感性较小。XGBoost模型由若干决策树组成,而决策树天 然对异常值较为鲁棒。这是因为决策树通过决策节点对特征进行分割,每次分割取 一个靠中间的值对单个特征进行简单的二分类,将样本归入左叶子节点和右叶子节 点,单个特征的极端值对模型的影响有限。而对于传统线性回归模型而言,极端值 会对最小二乘法产生影响,且极端程度越大影响越大。 ③有独特的特征选择机制。XGBoost模型由若干决策树组成,在决策树节点的 生成过程中,模型自动根据信息增益最大化对特征进行筛选,排除不相关的特征, 因此XGBoost模型对特征质量具有一定的鲁棒性,少量相关性较差的特征的加入对 模型性能的影响有限。 ④对特征的多重共线性不敏感。决策树天然不受多重共线性影响,XGBoost无 需处理多重共线性问题。 ⑤能够捕捉特征之间的非线性关系,适用于复杂的数据集。财务风险与上市公 司特征间并非简单的线性关系,使用线性模型进行财务风险识别容易欠拟合。在没 有过拟合的情况下,类似XGBoost的非线性模型会更有效、准确。

(2)模型设定

①模型参数设定。在模型拟合的过程中,我们发现,XGBoost模型的稳健性较 高,模型的表现对参数的选取不敏感。因此,本文仅通过简单的网格搜索适当优化 模型参数,确定了一组较优的参数。

②样本不平衡处理。在以财务风险识别、信贷风险识别这类异常检测任务中, 存在严重的样本不平衡问题,如果不做处理,模型预测结果会偏向于样本数量更多 的类别,以获得更高的准确率(Accuracy)。样本不平衡的解决方法有过采样、欠 采样等方法,但这类方法会使训练集数据发生改变。本文的解决方案是调整阈值, 使用有财务风险的先验概率为阈值,将预测有财务风险的概率大于先验概率的公司 标记为有财务风险的公司,反之标记为正常公司。 ③模型评价指标。模型选用AUC值作为损失函数。ROC曲线的横坐标是伪阳 性率(也叫假正类率,False Positive Rate),纵坐标是真阳性率(真正类率, True Positive Rate)。简而言之,在财务风险预测任务中,ROC曲线的横坐标是 将正常公司预测为有财务风险的公司的比例,纵坐标是将有财务风险的公司预测为 有财务风险的公司的比例。随着判断阈值从宽松到严格,阳性判定率会不断增加, 伪阳性率和真阳性率都会提升,最终都收敛至100%,构成下图的橙色曲线。AUC 值是橙色曲线下方的面积,面积越大,在伪阳性率相同的情况下,真阳性率整体更 高,模型性能越好,理想模型的AUC值是1,随机模型的AUC值是0.5。

(3)模型拟合

本文基于2000-2023年的65802个“上市公司-年份”样本数据,随机选取80%的 数据作为训练集,剩余20%的数据作为验证集,进行模型拟合。可见,模型在验证 集上的auc值起初为65%,模型的预测近乎随机,经历200轮迭代后,模型性能快 速提高并趋于收敛,最终模型在验证集上的auc值达到80%,模型效果较好。经历 500轮迭代,模型性能没有发生反弹,无严重过拟合现象。

(4)模型结果表现

为解决样本不平衡问题,本文使用有财务风险的先验概率作为判定阈值,先验 概率=样本中有财务风险的数量/总样本数量=0.0468。若上市公司的有财务风险的 概率估计值大于0.0468,将其判定为有财务风险的公司,否则判定为正常公司。

由于样本不平衡问题的存在,将所有公司公司都判定为正常公司,模型准确度 就可以达到90%以上,因此,模型准确度具有迷惑性。本文使用混淆矩阵评估模型 性能,结果显示,使用先验概率作为判定阈值,有财务风险的公司的识别率达到 70.94%,正常公司被错判为有财务风险的比例仅25.56%,模型表现较好。

参考报告REPORT

财务风险识别模型:从蛛丝马迹到全局视角.pdf

财务风险识别模型:从蛛丝马迹到全局视角。前言:为什么财务造假又一次引发市场关注?(1)经济增长信心不稳定,投资者越来越重视公司盈利能力和财务健康状况,对公司透明度和诚信度要求更高,也更加敏感和警惕,对财务造假容忍度显著降低。(2)伴随着A股产业结构的变迁,新业态、新模式不断涌现,财务造假手段演变升级,传统方式与新型手法杂糅共生。(3)新一轮退市制度改革下,财务造假“退市触点”增多,投资者更应警惕“ST风险”。 本文构建了一个全新的财务造假识别模型。通过系统梳理A股历年造假案件及其特征演变,解析财务造假“流程”,定...

我来回答
分享至