机器学习挑战文档深度页
Digits 可视化与错误分析
生成样本、分布、模型比较、混淆矩阵和错误样本五类图,并解释主要数字混淆。
学习前需要掌握
背景与问题
总体 macro F1 无法说明哪些数字形状相似、哪些类别召回低或是否存在模糊标签。
概念定义
错误分析把 y_pred!=y_test 的索引还原到 8×8 图像,标注真实值与预测值。
直观理解
把项目当作一条可复现、可审计的实验链,而不是追求一次最高分。
核心原理
图表必须保存为 PNG、包含完整标签与标题;错误少于 20 条时展示全部,不得删除不利样本。
数学表达
项目主线
图表必须保存为 PNG、包含完整标签与标题;错误少于 20 条时展示全部,不得删除不利样本。
变量含义
变量定义与本页概念定义一致,代码中的同名变量保持相同语义。
计算步骤
- 1展示至少 20 个样本
- 2画 0–9 分布
- 3画 CV 平均与误差线
- 4最终模型混淆矩阵
代码对应位置
示例 1Digits 可视化与错误分析 核心代码:对应项目要求中的可运行核心步骤。
计算与实现步骤
- 1
展示至少 20 个样本
- 2
画 0–9 分布
- 3
画 CV 平均与误差线
- 4
最终模型混淆矩阵
- 5
定位错误索引
- 6
画至少 20 个错误
- 7
总结混淆对
代码实现
示例 1
Digits 可视化与错误分析 核心代码
Digits 可视化与错误分析 核心代码
scikit-learn
example_01.py用途:对应项目要求中的可运行核心步骤。
error_idx=np.flatnonzero(y_pred!=y_test)
for idx in error_idx[:20]:
image=X_test[idx].reshape(8,8)
print("true",y_test[idx],"pred",y_pred[idx])代码解析
解析始终位于完整代码下方,并按实际代码段逐项对应。
输入数据与任务
对应项目要求中的可运行核心步骤。
X_test- 测试特征,只用于最终 transform、predict 和评价。
y_test- 与 X_test 对齐的测试目标。
y_pred- 模型对输入产生的预测结果。
Step 1 · 1–4 行
输出中间参数、形状或最终指标,用于核对代码是否符合预期。
error_idx=np.flatnonzero(y_pred!=y_test)
for idx in error_idx[:20]:
image=X_test[idx].reshape(8,8)
print("true",y_test[idx],"pred",y_pred[idx])预期输出或运行结果
打印前 20 个错误样本的真实和预测数字,可用于绘图。
常见错误 · 4 条
- 只挑易解释错误
- 图不保存
- 只有分数无样本
- 确认样本轴、特征轴以及 X 与 y 的第一维完全对应。
实际应用
- 分类错误诊断
- 报告图表
常见错误
只挑易解释错误
图不保存
只有分数无样本
文档来源
综合练习项目|传统机器学习手写数字识别原始文档
学习资料/learning_tech/practice_project_digits\README.md- §8 必须完成的可视化
- §12 FR-08–FR-09
- §17 完成后应能回答
推荐学习资料
暂未收录相关资料
参考库不会生成虚假资源或无效外部链接。