机器学习入门文档深度页
训练、预测与泛化
fit 学习状态,predict 使用已学状态;泛化衡量模型对未见数据的有效性。
学习前需要掌握
背景与问题
不同模型的 fit 学习内容不同:逻辑回归学习权重,树学习结构,朴素贝叶斯学习统计量,KNN 保存样本。
概念定义
训练改变模型内部参数或保存训练样本;预测通常不继续学习;泛化是新数据表现而非训练记忆。
直观理解
训练像整理笔记,预测像闭卷答题;考试成绩而不是抄笔记速度决定学习是否有效。
核心原理
预测阶段必须冻结训练状态。只有明确支持增量学习的 partial_fit 才会更新;任何评价都需确认样本未参与相应 fit。
数学表达
核心表达
预测阶段必须冻结训练状态。只有明确支持增量学习的 partial_fit 才会更新;任何评价都需确认样本未参与相应 fit。
变量含义
变量定义与本页概念定义一致,代码中的同名变量保持相同语义。
计算步骤
- 1明确模型学习状态
- 2仅在训练集 fit
- 3检查训练完成标志
- 4对新数据 predict
代码对应位置
示例 1训练、预测与泛化:最小可验证示例:把正文原理映射为可检查的代码行为。
计算与实现步骤
- 1
明确模型学习状态
- 2
仅在训练集 fit
- 3
检查训练完成标志
- 4
对新数据 predict
- 5
使用合适指标评估
- 6
监控分布变化
代码实现
示例 1
训练、预测与泛化:最小可验证示例
训练、预测与泛化:最小可验证示例
Python
example_01.py用途:把正文原理映射为可检查的代码行为。
model.fit(X_train, y_train)
state_before = model.get_params()
y_pred = model.predict(X_test)
assert len(y_pred) == len(X_test)代码解析
解析始终位于完整代码下方,并按实际代码段逐项对应。
输入数据与任务
把正文原理映射为可检查的代码行为。
X_train- 训练特征,只允许它参与预处理器和模型的 fit。
X_test- 测试特征,只用于最终 transform、predict 和评价。
y_train- 与 X_train 对齐的训练目标。
model- 组合预处理和估计器的模型对象。
y_pred- 模型对输入产生的预测结果。
Step 1 · 1–4 行
调用 fit 学习训练数据中的参数;若在 Pipeline 中,预处理器与模型会按顺序拟合。
model.fit(X_train, y_train)
state_before = model.get_params()
y_pred = model.predict(X_test)
assert len(y_pred) == len(X_test)预期输出或运行结果
产生与测试样本数一致的预测;predict 不重新拟合模型。
常见错误 · 4 条
- 在测试集 fit
- 以为 predict 自动学习
- 训练高分等同泛化好
- 确认样本轴、特征轴以及 X 与 y 的第一维完全对应。
实际应用
- 所有监督模型
- 部署推理
常见错误
在测试集 fit
以为 predict 自动学习
训练高分等同泛化好
文档来源
00|机器学习导论原始文档
学习资料/learning_tech/00_introduction.md- §5 训练与预测
推荐学习资料
暂未收录相关资料
参考库不会生成虚假资源或无效外部链接。