机器学习进阶文档深度页
Dummy 基线模型
用最常见类别或训练均值建立最低参照,复杂模型必须证明真正超过简单策略。
学习前需要掌握
评价指标内容待补充
背景与问题
没有基线时,0.90 准确率可能只是类别 90% 不平衡,R² 也缺少参照。
概念定义
DummyClassifier/Regressor 不学习特征规律,只按标签频率、常数或简单随机策略预测。
直观理解
先问“完全不看特征能做到多好”,再评价模型增加了多少价值。
核心原理
基线使用与候选模型相同的划分和指标;基线差距、成本与稳定性共同决定是否值得部署。
数学表达
核心表达
基线使用与候选模型相同的划分和指标;基线差距、成本与稳定性共同决定是否值得部署。
变量含义
变量定义与本页概念定义一致,代码中的同名变量保持相同语义。
计算步骤
- 1选择符合任务的 Dummy
- 2相同 CV
- 3记录指标与波动
- 4比较候选模型
代码对应位置
示例 1Dummy 基线模型 示例:对应文档中的可靠评价或训练流程。
计算与实现步骤
- 1
选择符合任务的 Dummy
- 2
相同 CV
- 3
记录指标与波动
- 4
比较候选模型
- 5
分析增益是否业务有意义
代码实现
示例 1
Dummy 基线模型 示例
Dummy 基线模型 示例
scikit-learn
example_01.py用途:对应文档中的可靠评价或训练流程。
from sklearn.dummy import DummyClassifier
baseline=DummyClassifier(strategy="most_frequent")
print(cross_val_score(baseline,X,y,cv=cv,scoring="f1_macro"))代码解析
解析始终位于完整代码下方,并按实际代码段逐项对应。
输入数据与任务
对应文档中的可靠评价或训练流程。
X- 完整特征矩阵,每行一个样本、每列一个特征。
y- 目标标签或连续目标值。
Step 1 · 1–3 行
导入当前步骤需要的数值计算、预处理、模型或评价工具。依赖集中写在代码开头,便于复现。
from sklearn.dummy import DummyClassifier
baseline=DummyClassifier(strategy="most_frequent")
print(cross_val_score(baseline,X,y,cv=cv,scoring="f1_macro"))预期输出或运行结果
输出各折 Dummy macro F1。
常见错误 · 2 条
- 跳过基线
- 基线和模型使用不同折
实际应用
- 任何模型比较
- 项目验收
常见错误
跳过基线
基线和模型使用不同折
文档来源
07|模型评估与调参原始文档
学习资料/learning_tech/07_evaluation_tuning.md- §7 基线模型
推荐学习资料
暂未收录相关资料
参考库不会生成虚假资源或无效外部链接。