机器学习进阶扩展内容
模型评估与错误代价
评价指标必须匹配真实使用方式、类别分布和错误成本。
前置知识
通俗直觉
准确率只回答“总体对了多少”,却可能掩盖少数类漏报;指标要围绕真正关心的错误选择。
核心原理
混淆矩阵拆分 TP、FP、FN、TN;精确率关注误报,召回率关注漏报,F1 平衡二者。
数学公式
误报成本高看精确率,漏报成本高看召回率。
工作流程
- 1
明确输入、输出与评价方式
- 2
建立简单基线
- 3
实现并检查关键中间量
- 4
在验证数据上诊断和迭代
代码示例
模型评估与错误代价 示例
Python
example.py用途:不要只报告单一准确率;同时查看每类指标和具体错误样本。
from sklearn.metrics import classification_report, confusion_matrix
print(confusion_matrix(y_test, y_pred))
print(classification_report(y_test, y_pred))代码解析
不要只报告单一准确率;同时查看每类指标和具体错误样本。
- — 先检查数据和张量形状
- — 把会学习参数的步骤限制在训练数据内
应用场景
- 建立可靠训练流程
- 诊断模型行为
常见误区
只记接口而不检查数据边界
只看单次分数而忽略泛化
推荐学习资料
官方文档A 级
scikit-learn User Guide
覆盖监督学习、无监督学习、预处理、模型选择、评估和常见陷阱。
scikit-learn Contributors · scikit-learn
资料笔记
代码教程A 级
scikit-learn Examples
按算法和应用组织可运行示例,展示预处理、训练、评估与可视化流程。
scikit-learn Contributors · scikit-learn
资料笔记
GitHub 仓库B 级
scikit-learn/scikit-learn
经典机器学习算法、模型选择、预处理和评估工具的核心实现仓库。
scikit-learn Contributors · GitHub
仓库信息
研究 scikit-learn 实现和贡献流程
主要语言:Python / Cython包含数据集或实验需要额外环境资料笔记
技术文章B 级
Rules of Machine Learning
从指标、特征、管线和迭代方式总结构建真实机器学习系统的实践原则。
Martin Zinkevich · Google for Developers