
如何用 Evidently 数据质量检测一次跑完缺失、重复、异常值三类筛查【免费下载链接】evidentlyEvidently is an open-source ML and LLM observability framework. Evaluate, test, and monitor any AI-powered system or data pipeline. From tabular data to Gen AI. 100 metrics.项目地址: https://gitcode.com/GitHub_Trending/ev/evidentlyEvidently 是一个开源的 ML 与 LLM 系统评估和监控框架内置数据质量检测能力对表格数据按数据集、按列计算缺失值、重复值与统计指标输出 HTML 数据质量报告并可接入后续的 ML 数据监控。当你要确认一份新数据或新一批线上数据能不能用时用它可以把结论变成数字和截图。数据质量排查常卡在哪里模型效果变差、训练任务报错时第一反应往往是看数据但排查容易卡在三个地方靠手写 SQL 或 Excel 逐列看看完 20 列仍说不清这月缺失率是不是变高了哪列被重复导入了。判断标准在脑子里3% 的缺失算不算高0.2% 的重复行要不要处理没有参照基线结论没法对齐。结果交付不了只能口头说数据不太好拿不出带数字和阈值的截图。Evidently 适合在哪一步使用 它定位在数据进入链路之后的检验层不是清洗工具也不替你改数据。典型介入点新数据集入库训练前跑一遍确认规模、缺失和重复结构是否正常。周期性数据质量报告对生产批次数据运行并与上一批reference data对比。CI 或定时任务基于报告里的指标结果设阈值失败即告警。先跑一遍最小检查先安装依赖仓库内已带最小依赖清单git clone https://gitcode.com/GitHub_Trending/ev/evidently cd evidently pip install -r requirements.min.txt最小数据质量报告脚本输入是任意 pandas 数据输出是一个 HTML 报告import pandas as pd from evidently.metrics import DatasetMissingValueCount, DuplicatedRowCount, DuplicatedColumnsCount from evidently.core.report import Report report Report(metrics[DatasetMissingValueCount(), DuplicatedRowCount(), DuplicatedColumnsCount()]) report.run(current_datapd.read_csv(your_data.csv)) report.save_html(data_quality_report.html)每个指标在报告里都是一个数值 是否通过的结论。例如DuplicatedRowCount的默认检查是应等于 0大于 0 即标记失败DatasetMissingValueCount同时给出缺失数量与占比。把缺失、重复、异常值拆开看缺失值指标怎么读数据集级DatasetMissingValueCount给出总缺失数和整体占比判断总体健康度。列级MissingValueCount按列统计实现在src/evidently/metrics/column_statistics.py关键特征列缺失率异常应优先处理。判断方法有 reference data 时默认按相对差异 10% 容忍对比没有基线就先定业务可接受上限比如缺失率 1%。重复行与重复列判断依据DuplicatedRowCount与任何其他行完全相同的行数量默认检查为等于 0。DuplicatedColumnsCount与某列完全相同的列数量AlmostDuplicatedColumnsCount进一步标记几乎相同高度相关的列。两者都在src/evidently/metrics/dataset_statistics.py。判断小数据集里个位数的重复行可能是采样噪声占比超过 1% 就该追查来源常见原因是 join 膨胀或重复入库。异常值筛查怎么做Evidently 没有一个一键找异常的按钮正确姿势是用列统计指标MinValue、MaxValue、MeanValue、StdValue、QuantileValue同在src/evidently/metrics/column_statistics.py观察数值列的极值与分布。看 P1/P99 分位数判断尾部是否异常拉长用均值 ± 标准差做粗略边界筛出业务上不可能的取值年龄 200、负数金额有 reference data 时对比当前分布与基线某列分布整体偏移多半是上游管道问题而非真实数据异常。报告如何用于团队沟通截图HTML 报告把每个指标排成卡片并附分布图问题列直接截图即可。数字引用报告里的指标缺失占比、重复行数、P99不说很多。阈值写明所用检查规则如缺失率 ≤ 1%、重复行 0别人可复现你的结论。结论一句话某指标通过/未通过原因指向哪一步再附截图。指标要长期盯时可接入 Grafana 等看板持续可视化examples/grafana/下有完整的看板对接示例。常见误区与适用边界它不是清洗工具报告告诉你问题在哪去重、补全、修源头仍由你或数据管道完成。异常筛查靠统计 业务判断Evidently 给极值和分布对比是否算异常取决于业务含义别期待单一按钮。默认阈值只是参考10% 相对差异和等于 0都是默认值生产环境建议验证后换成业务容忍值。大表可先抽样跑通流程再放量报告是单个 HTML 文件归档、分享成本很低。下一步怎么继续把最小检查的 3 个指标写进新数据集入库清单把缺失率、重复行、极值设为固定项。用生产批次数据替换演示 CSV保留上一批作为 reference data产出对比报告。把默认阈值改成业务容忍值将report.run()放进定时任务失败即告警。需要长期可视化时参考examples/grafana/的示例对接自己的监控看板。熟悉表格数据后查看src/evidently/presets/dataset_stats.py里的数据统计算子预设按列扩展检查项。【免费下载链接】evidentlyEvidently is an open-source ML and LLM observability framework. Evaluate, test, and monitor any AI-powered system or data pipeline. From tabular data to Gen AI. 100 metrics.项目地址: https://gitcode.com/GitHub_Trending/ev/evidently创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考