机器学习进阶文档深度页
线性回归
用特征加权和预测连续数值,通过最小化平方误差学习权重与偏置。
学习前需要掌握
点积内容待补充MSE内容待补充
背景与问题
它是回归任务的重要基线,可用解析方法或梯度优化求参数。加入多项式特征后仍对转换后特征线性。
概念定义
多元线性回归假设预测值是输入特征的仿射组合。
直观理解
寻找一条线或超平面,使所有样本到预测面的平方偏差总体最小。
核心原理
权重和偏置由训练数据 fit;MSE 强调大误差。尺度、异常值、共线性和高维会影响稳定性。
数学表达
核心表达
权重和偏置由训练数据 fit;MSE 强调大误差。尺度、异常值、共线性和高维会影响稳定性。
变量含义
变量定义与本页概念定义一致,代码中的同名变量保持相同语义。
计算步骤
- 1检查连续目标
- 2划分数据
- 3建立均值基线
- 4拟合线性回归
代码对应位置
示例 1线性回归 实现:对应文档中的训练与预测逻辑。
计算与实现步骤
- 1
检查连续目标
- 2
划分数据
- 3
建立均值基线
- 4
拟合线性回归
- 5
查看权重与残差
- 6
用 MAE/RMSE/R² 评价
代码实现
示例 1
线性回归 实现
线性回归 实现
scikit-learn
example_01.py用途:对应文档中的训练与预测逻辑。
from sklearn.linear_model import LinearRegression
model=LinearRegression().fit(X_train,y_train)
print(model.coef_, model.intercept_)
print(model.score(X_test,y_test))代码解析
解析始终位于完整代码下方,并按实际代码段逐项对应。
输入数据与任务
对应文档中的训练与预测逻辑。
X_train- 训练特征,只允许它参与预处理器和模型的 fit。
X_test- 测试特征,只用于最终 transform、predict 和评价。
y_train- 与 X_train 对齐的训练目标。
y_test- 与 X_test 对齐的测试目标。
model- 组合预处理和估计器的模型对象。
Step 1 · 1–4 行
导入当前步骤需要的数值计算、预处理、模型或评价工具。依赖集中写在代码开头,便于复现。
from sklearn.linear_model import LinearRegression
model=LinearRegression().fit(X_train,y_train)
print(model.coef_, model.intercept_)
print(model.score(X_test,y_test))预期输出或运行结果
输出特征权重、偏置和测试 R²。
常见错误 · 4 条
- 相关性当因果
- 异常值主导 MSE
- 非线性关系仍强行解释
- 确认样本轴、特征轴以及 X 与 y 的第一维完全对应。
实际应用
- 房价预测
- 趋势基线
常见错误
相关性当因果
异常值主导 MSE
非线性关系仍强行解释
文档来源
03|线性模型原始文档
学习资料/learning_tech/03_linear_models.md- §1 什么是线性模型
- §2 线性回归
推荐学习资料
视频课程A 级
Google Machine Learning Crash Course
以短视频、可视化和练习讲解回归、分类、数据、过拟合与神经网络基础。
Google · Google for Developers
资料笔记
书籍A 级
An Introduction to Statistical Learning
以较低数学门槛系统讲解回归、分类、重采样、树模型、正则化与无监督学习。
James / Witten / Hastie / Tibshirani / Taylor · StatLearning
资料笔记
视频B 级
StatQuest Machine Learning Videos
用图形和分步推理讲解回归、分类、树模型、聚类、PCA 与评估指标。
Josh Starmer · YouTube