机器学习入门文档深度页
数据质量检查
在训练前系统检查形状、类型、缺失、重复、异常单位、标签和采集来源。
学习前需要掌握
Pandas 基础内容待补充任务定义内容待补充
背景与问题
模型会忠实学习输入中的错误。单位混用、重复样本跨分割、标签定义漂移或不可能数值,都可能比算法选择更显著地影响结果。
概念定义
数据质量检查是在建模前验证数据是否符合任务契约的过程。它不仅是打印 describe,还包括标签语义、时间边界、来源一致性和预测时可用性。
直观理解
先确认“尺子、答案和样本对应关系”正确,再比较模型;否则更复杂的模型只会更熟练地拟合错误。
核心原理
检查分为结构、数值、标签与来源四层:结构检查 shape/dtype;数值检查缺失、范围、重复与异常;标签检查比例和一致性;来源检查时间、设备、群组和采集变化。
计算与实现步骤
- 1
核对样本数、特征数和 X/y 对应。
- 2
查看每列 dtype 与单位。
- 3
统计缺失和重复。
- 4
检查分位数、极端值与不可能值。
- 5
查看类别分布和标签定义。
- 6
记录时间、来源与群组字段。
- 7
把发现转成可重复断言和报告。
代码实现
示例 1
Pandas 数据审计起点
Pandas 数据审计起点
Python
example_01.py用途:生成结构、缺失、重复、描述统计和标签分布。
print(df.shape)
print(df.dtypes)
print(df.isna().sum())
print("duplicates:", df.duplicated().sum())
print(df.describe(include="all"))
print(df["target"].value_counts(dropna=False))代码解析
解析始终位于完整代码下方,并按实际代码段逐项对应。
输入数据与任务
生成结构、缺失、重复、描述统计和标签分布。
Step 1 · 1–6 行
输出中间参数、形状或最终指标,用于核对代码是否符合预期。
print(df.shape)
print(df.dtypes)
print(df.isna().sum())
print("duplicates:", df.duplicated().sum())
print(df.describe(include="all"))
print(df["target"].value_counts(dropna=False))预期输出或运行结果
输出行列数、各列类型、缺失计数、重复行数量、描述统计和每类样本数。
常见错误 · 4 条
- 只看均值不看单位和来源
- 把所有极端值直接删除
- 忽略标签定义变化
- 确认样本轴、特征轴以及 X 与 y 的第一维完全对应。
实际应用
- 建模前数据验收
- 训练/线上数据契约
- 错误样本追踪
常见错误
只看均值不看单位和来源
把所有极端值直接删除
忽略标签定义变化
文档来源
02|数据预处理与特征工程原始文档
学习资料/learning_tech/02_preprocessing_feature_engineering.md- §2 数据质量检查
- §8 异常值
- §14 预处理检查清单
推荐学习资料
暂未收录相关资料
参考库不会生成虚假资源或无效外部链接。