机器学习入门文档深度页
分类与回归
分类预测离散类别或类别概率,回归预测连续数值。
学习前需要掌握
背景与问题
任务类型影响输出、损失、指标和模型接口。把类别编号误当连续数值会引入不存在的大小关系。
概念定义
监督学习中,目标 y 的语义决定任务类型:有限离散标签对应分类,具有数值距离意义的连续目标对应回归。
直观理解
“是什么”通常是分类,“多少”通常是回归;但点击率若表示概率数值可以是回归,是否点击则是分类。
核心原理
先根据业务输出定义任务,再选择损失与指标。分类关注混淆和概率,回归关注误差大小与单位。
数学表达
核心表达
先根据业务输出定义任务,再选择损失与指标。分类关注混淆和概率,回归关注误差大小与单位。
变量含义
变量定义与本页概念定义一致,代码中的同名变量保持相同语义。
计算步骤
- 1明确预测对象
- 2判断标签是否离散
- 3确定错误代价
- 4选择模型与指标
代码对应位置
示例 1分类与回归:最小可验证示例:把正文原理映射为可检查的代码行为。
计算与实现步骤
- 1
明确预测对象
- 2
判断标签是否离散
- 3
确定错误代价
- 4
选择模型与指标
- 5
检查输出形状
代码实现
示例 1
分类与回归:最小可验证示例
分类与回归:最小可验证示例
Python
example_01.py用途:把正文原理映射为可检查的代码行为。
from sklearn.linear_model import LogisticRegression, LinearRegression
classifier = LogisticRegression()
regressor = LinearRegression()代码解析
解析始终位于完整代码下方,并按实际代码段逐项对应。
输入数据与任务
把正文原理映射为可检查的代码行为。
Step 1 · 1–3 行
导入当前步骤需要的数值计算、预处理、模型或评价工具。依赖集中写在代码开头,便于复现。
from sklearn.linear_model import LogisticRegression, LinearRegression
classifier = LogisticRegression()
regressor = LinearRegression()预期输出或运行结果
得到两个不同接口语义的估计器:一个输出类别,一个输出连续值。
常见错误 · 2 条
- 把类别编码当连续目标
- 只按模型名字判断任务
实际应用
- 垃圾邮件分类
- 房价回归
常见错误
把类别编码当连续目标
只按模型名字判断任务
文档来源
00|机器学习导论原始文档
学习资料/learning_tech/00_introduction.md- §3.1 监督学习 / 分类
- §3.1 监督学习 / 回归
推荐学习资料
视频课程A 级
Google Machine Learning Crash Course
以短视频、可视化和练习讲解回归、分类、数据、过拟合与神经网络基础。
Google · Google for Developers
资料笔记
数据集B 级
UCI Machine Learning Repository
提供分类、回归、聚类等任务常用的公开数据集和字段说明。
UC Irvine · UCI