机器学习入门扩展内容
监督学习
从带标签样本中学习输入到目标的映射。
前置知识
通俗直觉
像带答案练习:模型看过许多“题目—答案”对,再尝试回答新题。
核心原理
选择参数化函数,用训练样本上的损失衡量预测误差,并通过优化降低平均损失。
数学公式
寻找使平均训练损失最小的模型参数 θ。
工作流程
- 1
准备带标签数据
- 2
拆分训练与验证集
- 3
训练模型降低损失
- 4
在未见数据上评估
代码示例
监督学习 示例
Python
example.py用途:逻辑回归从四个带标签样本中学习分类边界,并判断新样本 2.5 更接近哪一类。
from sklearn.linear_model import LogisticRegression
X = [[0], [1], [2], [3]]
y = [0, 0, 1, 1]
model = LogisticRegression().fit(X, y)
print(model.predict([[2.5]]))代码解析
逻辑回归从四个带标签样本中学习分类边界,并判断新样本 2.5 更接近哪一类。
- — fit 使用带标签样本学习
- — predict 对新输入进行分类
应用场景
- 垃圾邮件识别
- 图像分类
- 销量预测
常见误区
训练集准确不代表泛化好
标签质量会限制模型上限