dingo 数据质量评估给 LLM 训练数据做体检【免费下载链接】dingoDingo: A Comprehensive AI Data, Model and Application Quality Evaluation Tool项目地址: https://gitcode.com/gh_mirrors/dingo5/dingo语料里混着重复文档、乱码、身份证号模型效果就被这些脏数据悄悄拖垮人工抽检几万条文本既慢又不稳定。dingo 是一款面向文本与多媒体数据集的数据质量评估工具把规则检测与 LLM 评估组合成自动化流水线覆盖预训练、微调和评估三类数据。它能做什么文本、图像、音频都能检图片侧还覆盖文图相关性、重复图、标注框重叠等检查预训练语料、SFT 微调数据、RAG 评估数据走同一套配置框架CLI 与 SDK 双入口命令行跑批量任务SDK 嵌进自有数据平台数据源支持本地文件、Hugging Face、SQL、S3流式读取大表不用先落地它怎么工作协作关系可以拆成三步先用输入参数声明数据从哪来、要跑哪些评估器然后执行器Executor按本地或 Spark 两种模式逐条读取数据源最后每条数据分发给插件化的评估器——Rules、LLM-as-a-judge、VLM-as-a-judge、Agent 四类并行处理结果汇成质量问题报告。插件机制的价值在扩展新增一个检测项不用改主流程按评估器接口实现后注册即可内置的 30 规则和 LLM 提示词也能按业务需要增删。七个质量维度逐个看完整性正文是否截断缺失如未正常结尾的文本被RuleColonEnd拦下有效性乱码与格式残留如反爬乱字命中RuleAbnormalChar流畅性语法与阅读节奏如连续字符粘连命中RuleWordStuck相关性开头混入无关来源信息如RuleHeadWord系列按语言逐一过滤安全性敏感信息泄漏如身份证号出现在语料里会被RuleIDCard自动拦下相似性重复内容如整段复制的文档命中RuleDocRepeat可理解性可读性差如全大写单词占比过高命中RuleCapitalWords需要更细的语义判断时再叠加TEXT_QUALITY_V2、QUALITY_BAD_EFFECTIVENESS等 LLM 评估提示词即可。四类典型用法本地文本文件刚把一批网页转成 txt想先看脏数据占比。执行dingo eval --input local_plaintext.json就能出报告适合爬虫同学的日更语料巡检。Hugging Face 数据集做预训练文本数据集质量检测时在配置里把 source 设为 hugging_face、指定数据集与字段即可不用先下载到本地。JSON / JSONL 文件SFT 对话、评测集这类结构化数据用 jsonl 源接入还能按字段分别挂规则isbn 字段跑 ISBN 校验title 字段跑文本质量检查。接入 LLM 做自定义 prompt 评估规则只抓得住格式层面的问题对“是否有效、是否通顺”这类语义判断做 LLM 数据质量评估时可配置LLMTextQualityV4/V5并指向自有模型接口。谁适合用、什么时候别用正在清洗预训练或 SFT 语料、训练前想批量筛掉脏数据的算法与数据工程师是它的核心用户只想抽查一两条样本、问题又集中在单一字段时自己写脚本更快不必引入完整流水线LLM 评估按调用计费、速度受模型接口限制更适合对规则筛剩的样本做二次精判而非全量跑dingo 的思路是把数据质量检测工具做成可插拔的流水线规则负责快LLM 负责深数据源和执行器负责规模。完整指标清单见 docs/metrics.md各场景指南集中在 docs/。【免费下载链接】dingoDingo: A Comprehensive AI Data, Model and Application Quality Evaluation Tool项目地址: https://gitcode.com/gh_mirrors/dingo5/dingo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考