dingo 数据质量评估:给 LLM 训练数据做体检
【免费下载链接】dingoDingo: A Comprehensive AI Data, Model and Application Quality Evaluation Tool项目地址: https://gitcode.com/gh_mirrors/dingo5/dingo
语料里混着重复文档、乱码、身份证号,模型效果就被这些脏数据悄悄拖垮;人工抽检几万条文本,既慢又不稳定。dingo 是一款面向文本与多媒体数据集的数据质量评估工具,把规则检测与 LLM 评估组合成自动化流水线,覆盖预训练、微调和评估三类数据。
它能做什么
- 文本、图像、音频都能检:图片侧还覆盖文图相关性、重复图、标注框重叠等检查
- 预训练语料、SFT 微调数据、RAG 评估数据,走同一套配置框架
- CLI 与 SDK 双入口:命令行跑批量任务,SDK 嵌进自有数据平台
- 数据源支持本地文件、Hugging Face、SQL、S3,流式读取,大表不用先落地
它怎么工作
协作关系可以拆成三步:先用输入参数声明数据从哪来、要跑哪些评估器;然后执行器(Executor)按本地或 Spark 两种模式逐条读取数据源;最后每条数据分发给插件化的评估器——Rules、LLM-as-a-judge、VLM-as-a-judge、Agent 四类并行处理,结果汇成质量问题报告。
插件机制的价值在扩展:新增一个检测项不用改主流程,按评估器接口实现后注册即可;内置的 30+ 规则和 LLM 提示词也能按业务需要增删。
七个质量维度逐个看
- 完整性:正文是否截断缺失,如未正常结尾的文本被
RuleColonEnd拦下 - 有效性:乱码与格式残留,如反爬乱字命中
RuleAbnormalChar - 流畅性:语法与阅读节奏,如连续字符粘连命中
RuleWordStuck - 相关性:开头混入无关来源信息,如
RuleHeadWord系列按语言逐一过滤 - 安全性:敏感信息泄漏,如身份证号出现在语料里会被
RuleIDCard自动拦下 - 相似性:重复内容,如整段复制的文档命中
RuleDocRepeat - 可理解性:可读性差,如全大写单词占比过高命中
RuleCapitalWords
需要更细的语义判断时,再叠加TEXT_QUALITY_V2、QUALITY_BAD_EFFECTIVENESS等 LLM 评估提示词即可。
四类典型用法
本地文本文件
刚把一批网页转成 txt,想先看脏数据占比。执行dingo eval --input local_plaintext.json就能出报告,适合爬虫同学的日更语料巡检。
Hugging Face 数据集
做预训练文本数据集质量检测时,在配置里把 source 设为 hugging_face、指定数据集与字段即可,不用先下载到本地。
JSON / JSONL 文件
SFT 对话、评测集这类结构化数据用 jsonl 源接入,还能按字段分别挂规则:isbn 字段跑 ISBN 校验,title 字段跑文本质量检查。
接入 LLM 做自定义 prompt 评估
规则只抓得住格式层面的问题;对“是否有效、是否通顺”这类语义判断,做 LLM 数据质量评估时可配置LLMTextQualityV4/V5并指向自有模型接口。
谁适合用、什么时候别用
- 正在清洗预训练或 SFT 语料、训练前想批量筛掉脏数据的算法与数据工程师,是它的核心用户
- 只想抽查一两条样本、问题又集中在单一字段时,自己写脚本更快,不必引入完整流水线
- LLM 评估按调用计费、速度受模型接口限制,更适合对规则筛剩的样本做二次精判,而非全量跑
dingo 的思路是把数据质量检测工具做成可插拔的流水线:规则负责快,LLM 负责深,数据源和执行器负责规模。完整指标清单见 docs/metrics.md,各场景指南集中在 docs/。
【免费下载链接】dingoDingo: A Comprehensive AI Data, Model and Application Quality Evaluation Tool项目地址: https://gitcode.com/gh_mirrors/dingo5/dingo
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考