机器学习入门文档深度页
分类概率与决策阈值
模型概率表示类别倾向,最终类别由 argmax 或阈值规则产生。
学习前需要掌握
背景与问题
默认 0.5 不一定符合业务成本。降低阈值通常提高召回并增加误报。
概念定义
多分类通常选择最大概率类别;二分类可把正类概率与阈值 τ 比较。
直观理解
概率是排序和置信信号,阈值是行动规则;两者应分开评价。
核心原理
概率最大不保证正确或校准。阈值必须在验证数据上依据误报/漏报成本选择。
数学表达
核心表达
概率最大不保证正确或校准。阈值必须在验证数据上依据误报/漏报成本选择。
变量含义
变量定义与本页概念定义一致,代码中的同名变量保持相同语义。
计算步骤
- 1获得 predict_proba
- 2检查概率列顺序
- 3定义错误成本
- 4在验证集比较阈值
代码对应位置
示例 1分类概率与决策阈值:最小可验证示例:把正文原理映射为可检查的代码行为。
计算与实现步骤
- 1
获得 predict_proba
- 2
检查概率列顺序
- 3
定义错误成本
- 4
在验证集比较阈值
- 5
锁定后测试
代码实现
示例 1
分类概率与决策阈值:最小可验证示例
分类概率与决策阈值:最小可验证示例
NumPy
example_01.py用途:把正文原理映射为可检查的代码行为。
prob = model.predict_proba(X_valid)[:, 1]
threshold = 0.3
y_pred = (prob >= threshold).astype(int)代码解析
解析始终位于完整代码下方,并按实际代码段逐项对应。
输入数据与任务
把正文原理映射为可检查的代码行为。
model- 组合预处理和估计器的模型对象。
y_pred- 模型对输入产生的预测结果。
prob- 模型输出的正类概率。
Step 1 · 1–3 行
复用已经学到的状态处理未见数据;这里不能再次 fit,否则会产生数据泄漏。
prob = model.predict_proba(X_valid)[:, 1]
threshold = 0.3
y_pred = (prob >= threshold).astype(int)预期输出或运行结果
得到使用 0.3 阈值的二分类预测数组。
常见错误 · 3 条
- 把概率当事实
- 测试集调阈值
- 忽略概率校准
实际应用
- 欺诈和筛查
- 拒绝策略
常见错误
把概率当事实
测试集调阈值
忽略概率校准
文档来源
01|数学与数据基础原始文档
学习资料/learning_tech/01_math_data_foundations.md- §4.1 概率
- 如何用代码查看分类概率
推荐学习资料
暂未收录相关资料
参考库不会生成虚假资源或无效外部链接。