TabDDPM 教程:用扩散模型三步生成高保真表格合成数据
TabDDPM 教程用扩散模型三步生成高保真表格合成数据【免费下载链接】tab-ddpm[ICML 2023] The official implementation of the paper TabDDPM: Modelling Tabular Data with Diffusion Models项目地址: https://gitcode.com/gh_mirrors/ta/tab-ddpmTabDDPM 是 ICML 2023 论文 Modelling Tabular Data with Diffusion Models 的官方实现用扩散模型做表格数据合成解决含混合列数值类别的表格难增强、敏感数据难共享这两类实际痛点。一、为什么要合成表格数据从两个真实场景说起场景 1你要训练客户流失预测模型正样本只有几百条直接训练模型极不稳定。SMOTE 只能插值数值列遇到性别、套餐类型这类类别列就没法用。场景 2数据团队想和外部合作方做联合分析但申请表特征涉及敏感信息原始表格不能出内网。这两个场景的共同难点是表格数据列类型混杂传统增强手段管不了类别列而基于 GAN 的生成方法在混合类型上容易产出看似合理、实际失真的样本。TabDDPM 的思路是用扩散过程代替生成器数值列和类别列各自走对应的扩散通道生成的样本可直接拿去训下游模型并内置 CatBoost / MLP 两套评估流程来量化合成质量。二、三分钟看懂 TabDDPM 的扩散模型原理加噪与去噪训练像用橡皮一点点把表格涂乱再让模型学会反向复原学会后从纯噪声出发就能一步步采样出新行。混合列原生支持数值列走高斯扩散、类别列走多项式扩散一套模型同时管两类列不用自己设计编码规则。条件生成配置里打开is_y_cond就能按指定标签生成样本等于一个定向增强少数类的工具。三、TabDDPM 适合谁用做数据增强的算法工程师分类任务正例稀缺时为少数类补样本——比如对 churn2 数据集扩充流失组后直接跑内置 CatBoost 评估看 AUC 变化。处理敏感数据的数据分析师用 TabDDPM 隐私保护流程生成替代表格对外交付仓库提供scripts/resample_privacy.py做隐私度量。要对比基线做实验的人项目内置 SMOTE、TVAE、CTAB-GAN 等基线目录同一套评估脚本跑全部方法结果统一汇总。复现论文实验的研究生17 个基准数据集配置齐全exp/目录下每个数据集都带现成的config.toml和历史结果。四、TabDDPM 快速上手与同类工具对比 维度SMOTECTGAN / CTAB-GAN 系TabDDPM类别列不支持可支持易失真原生多项式扩散合成质量评估需自建需自建内置 CatBoost/MLP 多种子评估隐私分析无部分实现自带隐私计算脚本上手成本一行 API中等改配置即可全脚本化克隆仓库后改一份配置就能训练、采样、评估一条龙git clone https://gitcode.com/gh_mirrors/ta/tab-ddpm python scripts/pipeline.py --config exp/churn2/ddpm_cb_best/config.toml --train --sample --evalRTX 2080 Ti 级别的消费显卡跑上面这条流程约 7 分钟。想先跑通最小例子直接从 scripts/ 里的 pipeline 脚本入手再对照 CONFIG_DESCRIPTION.md 里的参数说明选一个exp/下的现成配置把数据路径改成自己的即可。【免费下载链接】tab-ddpm[ICML 2023] The official implementation of the paper TabDDPM: Modelling Tabular Data with Diffusion Models项目地址: https://gitcode.com/gh_mirrors/ta/tab-ddpm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考