CleanLab 2026:11K 星 — 开源 AI 数据清洗与标签错误检测平台
CleanLab 用 AI 自动检测标签错误、数据质量问题。支持图像、文本、音频,11K+ GitHub star。与 scikit-learn、PyTorch、TensorFlow 集成。
- ⭐ 11458
- 更新于 2026-08-27
CleanLab 2026:11K 星 — 开源 AI 数据清洗与标签错误检测平台 #
CleanLab 是开源数据质量平台,用 AI 自动检测标签错误、数据异常和样本问题。11K+ GitHub star,被超过 50,000 个 ML 项目使用。
🔗 GitHub: https://github.com/cleanlab/cleanlab
核心特性 #
标签错误检测 #
from cleanlab.dataset import dataset_health
from cleanlab.filter import find_label_issues
# 加载数据
labels = [...] # 真实标签
pred_probs = [...] # 模型预测概率
# 检测标签错误
label_issues = find_label_issues(labels, pred_probs)
print(f"检测到 {len(label_issues)} 个标签错误")
数据质量问题扫描 #
from cleanlab.dataset import dataset_health
# 全面数据集健康检查
health = dataset_health(labels, pred_probs)
print(f"标签噪声率: {health['label_noise_rate']:.2%}")
print(f"不兼容样本: {health['joint_noise_matrix']}")
自动清洗建议 #
from cleanlab.filter import filter_by_prob_normalized_margin
# 获取最可能是错误的样本
confidence_scores, to_remove = filter_by_prob_normalized_margin(
pred_probs, labels, threshold=0.2
)
支持的模态 #
| 模态 | 模块 | 功能 |
|---|---|---|
| 图像 | cleanlab.image | 图像分类标签错误检测 |
| 文本 | cleanlab.text | 文本分类数据质量问题 |
| 音频 | cleanlab.audio | 音频标注错误识别 |
| 表格 | cleanlab.tabular | 通用数据质量扫描 |
与 ML 框架集成 #
scikit-learn #
from cleanlab.sklearn import ClassifierPipeline
# 自动处理标签错误的分类器
clf = ClassifierPipeline(
model="random_forest",
labels=labels,
pred_probs=pred_probs
)
clf.fit(X_train, y_train)
PyTorch #
from cleanlab.torch import CleanLearning
# 包装 PyTorch 模型
clean_learning = CleanLearning(model)
clean_learning.fit(X_train, y_train)
Hugging Face Transformers #
from cleanlab.transformers import CleanLearningForSequenceClassification
# NLP 任务自动清洗
clean_clf = CleanLearningForSequenceClassification(model)
clean_clf.fit(train_dataset, label_names=["label"])
典型工作流 #
- 导入数据 → 加载标签和预测概率
- 运行健康检查 → 检测标签噪声和异常
- 审查问题样本 → 人工验证建议清洗
- 应用清洗 → 移除或修正问题样本
- 重训练模型 → 使用清洗后数据
比较:CleanLab vs 传统清洗 #
| 特性 | CleanLab | pandas-profiling | 手动清洗 |
|---|---|---|---|
| 标签错误检测 | ✅ 自动 | ❌ | ❌ |
| 数据质量扫描 | ✅ 自动 | ✅ 部分 | ❌ |
| ML 集成 | ✅ 深度 | ❌ | ❌ |
| 多模态 | ✅ 图像/文本/音频 | ❌ | ❌ |
| 易用性 | 简单 API | 简单 | 复杂 |
常见问题 #
Q: CleanLab 适合生产环境吗? A: 是的。被超过 50,000 个项目使用,包括企业级 ML 流水线。
Q: 需要多少数据才能检测标签错误? A: 至少需要 100-200 个样本和可靠预测概率。更大数据集检测更准确。
Q: CleanLab 开源吗? A: 是的,MIT 许可完全开源。
结论 #
CleanLab 是 ML 数据质量自动化工具的事实标准。通过 AI 驱动标签错误检测和与主流框架的深度集成,它大幅减少数据清洗时间,提高模型性能。
💬 留言讨论