机器学习进阶文档深度页
错误分析
从混淆类别、样本质量、人群来源、极端区域和置信度定位模型失败机制。
学习前需要掌握
背景与问题
一个分数不能说明错误是否集中于少数群体、标签问题或训练未覆盖区域。
概念定义
错误分析把汇总指标还原到具体样本与切片,决定下一步应改数据、特征、模型还是指标。
直观理解
不要只问“错了多少”,还要问“错的是谁、在哪里、为什么、代价多大”。
核心原理
在独立预测上建立可重复切片;避免只展示方便解释的个例。结论需转成可验证改进假设。
数学表达
核心表达
在独立预测上建立可重复切片;避免只展示方便解释的个例。结论需转成可验证改进假设。
变量含义
变量定义与本页概念定义一致,代码中的同名变量保持相同语义。
计算步骤
- 1生成独立预测
- 2定位错误索引
- 3按真实/预测类统计
- 4按来源/范围切片
代码对应位置
示例 1错误分析 示例:对应文档中的可靠评价或训练流程。
计算与实现步骤
- 1
生成独立预测
- 2
定位错误索引
- 3
按真实/预测类统计
- 4
按来源/范围切片
- 5
人工检查标签
- 6
提出改进并重新验证
代码实现
示例 1
错误分析 示例
错误分析 示例
scikit-learn
example_01.py用途:对应文档中的可靠评价或训练流程。
errors=X_test.loc[y_pred!=y_test].copy()
errors["true"]=y_test[y_pred!=y_test]
errors["pred"]=y_pred[y_pred!=y_test]
print(errors.head())代码解析
解析始终位于完整代码下方,并按实际代码段逐项对应。
输入数据与任务
对应文档中的可靠评价或训练流程。
X_test- 测试特征,只用于最终 transform、predict 和评价。
y_test- 与 X_test 对齐的测试目标。
y_pred- 模型对输入产生的预测结果。
Step 1 · 1–4 行
输出中间参数、形状或最终指标,用于核对代码是否符合预期。
errors=X_test.loc[y_pred!=y_test].copy()
errors["true"]=y_test[y_pred!=y_test]
errors["pred"]=y_pred[y_pred!=y_test]
print(errors.head())预期输出或运行结果
显示测试集中预测错误样本及真实/预测标签。
常见错误 · 4 条
- 挑选个例
- 用测试集反复修模型却仍称最终测试
- 不检查标签
- 确认样本轴、特征轴以及 X 与 y 的第一维完全对应。
实际应用
- 模型迭代
- 公平性与风险审查
常见错误
挑选个例
用测试集反复修模型却仍称最终测试
不检查标签
文档来源
07|模型评估与调参原始文档
学习资料/learning_tech/07_evaluation_tuning.md- §11 错误分析
- §12 一份可靠评价模板
推荐学习资料
暂未收录相关资料
参考库不会生成虚假资源或无效外部链接。