机器学习进阶扩展内容
过拟合与正则化
过拟合是记住训练噪声;正则化通过约束复杂度改善泛化。
前置知识
通俗直觉
像把练习题答案背下来,却不会做新题。正则化要求模型用更简单稳定的规律作答。
核心原理
在数据损失之外加入参数惩罚,控制模型自由度,在偏差与方差之间取得平衡。
数学公式
λ 决定拟合训练数据与限制参数大小之间的权衡。
工作流程
- 1
观察训练/验证误差差距
- 2
选择正则化方法
- 3
用验证集调整强度
- 4
在测试集确认泛化
代码示例
过拟合与正则化 示例
Python
example.py用途:Ridge 在线性回归损失中加入权重平方惩罚,减少参数对少量训练样本的过度适配。
from sklearn.linear_model import Ridge
model = Ridge(alpha=1.0)
model.fit([[1], [2], [3]], [1.2, 1.9, 3.4])
print(model.coef_)代码解析
Ridge 在线性回归损失中加入权重平方惩罚,减少参数对少量训练样本的过度适配。
- — Ridge 使用 L2 正则化
- — alpha 越大约束通常越强
应用场景
- 小样本建模
- 高维特征选择
- 稳定模型参数
常见误区
正则越强不一定越好
用测试集调参会造成信息泄漏
推荐学习资料
暂未收录相关资料
参考库不会生成虚假资源或无效外部链接。