机器学习入门文档深度页
机器学习是什么
机器学习从历史数据中学习参数或规则,再对未见数据产生可评价预测。
学习前需要掌握
机器学习必备 NumPy 操作数据表概念内容待补充
背景与问题
当规则难以穷举、存在足够历史数据、结果可客观评价时,机器学习比手写规则更合适;数据少、标签不可信或错误无法审核时则应谨慎。
概念定义
普通程序由人写规则,机器学习由算法根据数据与训练目标寻找参数;模型学到的是统计关系,不等同于人的理解。
直观理解
把算法看作调参过程:历史题目和答案决定一组数学参数,新题只使用已确定的参数作答。
核心原理
任务必须明确输入、输出、标签定义、评价指标和真实使用条件;只有未见数据上的表现才能反映泛化。
数学表达
核心表达
任务必须明确输入、输出、标签定义、评价指标和真实使用条件;只有未见数据上的表现才能反映泛化。
变量含义
变量定义与本页概念定义一致,代码中的同名变量保持相同语义。
计算步骤
- 1定义业务问题与错误成本
- 2确认数据和标签可用
- 3划分数据并建立基线
- 4训练、验证、测试
代码对应位置
示例 1机器学习是什么:最小可验证示例:把正文原理映射为可检查的代码行为。
计算与实现步骤
- 1
定义业务问题与错误成本
- 2
确认数据和标签可用
- 3
划分数据并建立基线
- 4
训练、验证、测试
- 5
保存、部署和监控
代码实现
示例 1
机器学习是什么:最小可验证示例
机器学习是什么:最小可验证示例
Python
example_01.py用途:把正文原理映射为可检查的代码行为。
model.fit(X_train, y_train)
y_pred = model.predict(X_test)
print(model.score(X_test, y_test))代码解析
解析始终位于完整代码下方,并按实际代码段逐项对应。
输入数据与任务
把正文原理映射为可检查的代码行为。
X_train- 训练特征,只允许它参与预处理器和模型的 fit。
X_test- 测试特征,只用于最终 transform、predict 和评价。
y_train- 与 X_train 对齐的训练目标。
y_test- 与 X_test 对齐的测试目标。
model- 组合预处理和估计器的模型对象。
y_pred- 模型对输入产生的预测结果。
Step 1 · 1–3 行
调用 fit 学习训练数据中的参数;若在 Pipeline 中,预处理器与模型会按顺序拟合。
model.fit(X_train, y_train)
y_pred = model.predict(X_test)
print(model.score(X_test, y_test))预期输出或运行结果
输出模型在未参与训练的测试数据上的评价分数。
常见错误 · 4 条
- 把拟合当真正理解
- 无法评价结果仍强行建模
- 只看训练分数
- 确认样本轴、特征轴以及 X 与 y 的第一维完全对应。
实际应用
- 分类
- 回归
- 聚类与异常检测
常见错误
把拟合当真正理解
无法评价结果仍强行建模
只看训练分数
文档来源
00|机器学习导论原始文档
学习资料/learning_tech/00_introduction.md- §1 机器学习是什么
- §2 为什么需要机器学习
- §10 初学者容易产生的误解