CatBoost分类模型结果解读一、方法概述CatBoostCategorical Boosting是一种基于梯度提升决策树的机器学习算法由Yandex公司开发。该算法在处理分类特征和序列数据方面具有显著优势能够有效减少参数调优的工作量并通过对称决策树结构降低过拟合风险。本研究利用SPSSAU软件对欺诈检测数据进行CatBoost分类建模分析旨在通过用户行为特征变量预测欺诈行为为金融风控提供科学依据。在SPSSAU【机器学习】模块选择【CatBoost】将变量拖拽至右侧对应分析框操作如下图二、数据概览本研究共纳入1000个样本以换设备次数、支付失败次数、换IP次数、换IP国次数、交易金额5项指标作为自变量以欺诈标签0非欺诈1欺诈作为因变量进行分类建模。因变量分布如下表所示由表1可知1000个样本中非欺诈样本标签0为600例占比60.00%欺诈样本标签1为400例占比40.00%。数据无缺失值全部纳入分析。由表2可知按照8:2的比例将数据划分为训练集800个样本占80.00%和测试集200个样本占20.000%用于模型训练与泛化能力评估。三、特征权重分析由表3可知CatBoost模型的特征权重分布相较于LightGBM更为均衡。换设备次数的权重最高为0.23423.36%对模型构建起关键作用。支付失败次数与换IP国次数并列第二权重均为0.20820.77%。交易金额的权重为0.18718.70%换IP次数的权重为0.16416.40%。五项特征的权重分布相对均匀最高与最低之间差距仅为6.96个百分点表明CatBoost模型对多维度行为特征均给予了较为均衡的重视。图1 CatBoost特征权重分布图由图1可知CatBoost的特征权重分布呈现较为平缓的梯度格局。换设备次数以23.36%的权重位居首位支付失败次数与换IP国次数权重相同均为20.77%交易金额和换IP次数紧随其后。与LightGBM中交易金额一家独大的局面不同CatBoost更强调设备更换、IP变更等行为维度特征的综合判别作用。四、训练集模型评估由表4可知CatBoost模型在训练集上达到了完美分类效果整体准确率、精确率、召回率和f1-score均为1.000。非欺诈类和欺诈类的各项指标均达到满分表明模型在训练数据上实现了完全拟合。五、测试集模型评估由表5可知CatBoost模型在测试集上的整体准确率为89.00%综合精确率为89.93%综合召回率为89.00%综合f1-score为0.886。相较于训练集的完美表现测试集性能有所下降存在一定过拟合但整体分类效果良好。从各类别看非欺诈类0.0的精确率为0.861召回率为0.984f1-score为0.919召回率高达98.4%表明模型对非欺诈样本的覆盖能力极强。欺诈类1.0的精确率为0.964召回率为0.730f1-score为0.831。欺诈类精确率较高96.4%说明模型判定为欺诈的可靠性较强但召回率为73.0%仍有约27%的欺诈样本未能被识别。六、模型参数汇总由表6可知CatBoost模型采用Auto损失函数迭代次数设置为500次学习率为0.1树最大深度为6。L2正则化系数为3.0特征子集比例为1.0。模型在测试集上取得89.00%的准确率和0.886的f1-score。七、结论本研究基于SPSSAU平台利用CatBoost算法对1000个欺诈检测样本进行分类建模分析。结果显示CatBoost模型对五项行为特征的权重分配较为均衡换设备次数23.36%、支付失败次数20.77%和换IP国次数20.77%是前三位重要特征。模型在测试集上的准确率为89.00%综合f1-score为0.886整体分类效果良好。与LightGBM相比CatBoost在特征利用的均衡性方面表现更优但欺诈样本的召回率73.0%仍有提升空间。