机器学习入门文档深度页
欠拟合、过拟合与合适拟合
训练与验证表现共同决定模型是能力不足、记住噪声还是具备合理泛化。
学习前需要掌握
训练验证测试内容待补充
背景与问题
单个分数无法区分问题类型。模型复杂度、数据量、特征质量、正则化和划分设计共同影响结果。
概念定义
欠拟合时训练和验证都差;过拟合时训练很好但验证明显下降;合适拟合时两者均好且差距与波动合理。
直观理解
不会做练习是欠拟合,只会背原题是过拟合,能解决新题才是合适学习。
核心原理
同时报告训练/验证指标、泛化差距和多折波动,并先排除数据泄漏与分布变化。
数学表达
核心表达
同时报告训练/验证指标、泛化差距和多折波动,并先排除数据泄漏与分布变化。
变量含义
变量定义与本页概念定义一致,代码中的同名变量保持相同语义。
计算步骤
- 1建立简单基线
- 2同时测训练/验证
- 3计算差距
- 4查看多折波动
代码对应位置
示例 1欠拟合、过拟合与合适拟合:最小可验证示例:把正文原理映射为可检查的代码行为。
计算与实现步骤
- 1
建立简单基线
- 2
同时测训练/验证
- 3
计算差距
- 4
查看多折波动
- 5
检查泄漏和分布
- 6
按模型调整复杂度
代码实现
示例 1
欠拟合、过拟合与合适拟合:最小可验证示例
欠拟合、过拟合与合适拟合:最小可验证示例
Python
example_01.py用途:把正文原理映射为可检查的代码行为。
from sklearn.model_selection import cross_validate
result = cross_validate(model, X, y, cv=5, return_train_score=True)
print(result["train_score"].mean(), result["test_score"].mean())代码解析
解析始终位于完整代码下方,并按实际代码段逐项对应。
输入数据与任务
把正文原理映射为可检查的代码行为。
X- 完整特征矩阵,每行一个样本、每列一个特征。
y- 目标标签或连续目标值。
model- 组合预处理和估计器的模型对象。
mean- 训练特征逐列均值。
Step 1 · 1–3 行
导入当前步骤需要的数值计算、预处理、模型或评价工具。依赖集中写在代码开头,便于复现。
from sklearn.model_selection import cross_validate
result = cross_validate(model, X, y, cv=5, return_train_score=True)
print(result["train_score"].mean(), result["test_score"].mean())代码与数学原理
减去训练均值并除以训练标准差,对应代码中的 mean/std 或 StandardScaler。
预期输出或运行结果
输出平均训练分数与验证分数,用于判断能力和差距。
常见错误 · 4 条
- 不要在测试集上调用 fit 或 fit_transform;测试集只能复用训练参数。
- 训练 100% 就断言过拟合
- 只追求最小差距
- 正则化越强越好
实际应用
- 模型诊断
- 正则化选择
常见错误
训练 100% 就断言过拟合
只追求最小差距
正则化越强越好
文档来源
00|机器学习导论原始文档
学习资料/learning_tech/00_introduction.md- §8 欠拟合、过拟合与恰当拟合
推荐学习资料
暂未收录相关资料
参考库不会生成虚假资源或无效外部链接。