深度学习入门文档深度页
深度学习数学基础
用张量、矩阵乘法、梯度、概率、交叉熵和 KL 理解模型计算。
学习目标
- 判断矩阵形状
- 手算梯度
- 解释交叉熵/KL
为什么需要这个概念
前向由线性代数描述,反向由链式法则描述,分类和生成由概率信息量描述。
- 理解公式与代码
- 培养形状和数值稳定性意识
学习前需要掌握
基础代数内容待补充
背景与问题
前向由线性代数描述,反向由链式法则描述,分类和生成由概率信息量描述。
概念定义
深度学习数学重点是形状、局部变化和概率目标,而非先完成全部证明。
直观理解
矩阵描述数据流,梯度描述如何改参数,概率描述不确定性。
核心原理
每个公式都应对应张量形状、计算轴和稳定实现。
框架组合损失用 log-sum-exp 等技巧避免直接 exp/log 溢出。
数学表达
核心公式
真实分布固定时,最小化交叉熵等价于最小化 KL。
变量含义
P真实分布Q模型分布
计算步骤
- 1ŷ=2
- 2dL/dw=2(2-6)×2
代码对应位置
示例 1深度学习数学基础 · PyTorch 示例:验证深度学习数学基础的输入、计算和输出。
变量解释
| 变量 | 含义 |
|---|---|
P | 真实分布 |
Q | 模型分布 |
完整数值示例
链式梯度
已知条件
- ŷ=wx
- L=(ŷ-y)^2
- x=2,y=6,w=1
- 1
ŷ=2
- 2
dL/dw=2(2-6)×2
梯度 -16
处理前后对比
计算与实现步骤
- 1
标注形状
- 2
前向计算
- 3
损失
- 4
链式求导
- 5
稳定实现
代码实现
示例 1
深度学习数学基础 · PyTorch 示例
深度学习数学基础 · PyTorch 示例
PyTorch
example_01.py用途:验证深度学习数学基础的输入、计算和输出。
w=torch.tensor(1.,requires_grad=True)
x=torch.tensor(2.);target=torch.tensor(6.)
loss=(w*x-target)**2
loss.backward();print(w.grad)代码解析
解析始终位于完整代码下方,并按实际代码段逐项对应。
输入数据与任务
验证深度学习数学基础的输入、计算和输出。
loss- 当前预测与目标之间的损失值。
w- 模型权重或当前待优化参数。
Step 1 · 1–4 行
计算损失对参数的梯度,对应数学表达中的 ∇J;梯度只给出局部变化方向。
w=torch.tensor(1.,requires_grad=True)
x=torch.tensor(2.);target=torch.tensor(6.)
loss=(w*x-target)**2
loss.backward();print(w.grad)代码与数学原理
平方误差代码对应均方损失。
预期输出或运行结果
tensor(-16.)。
常见错误 · 3 条
- 忽略广播
- 概率直接 log0
- 矩阵内维不匹配
实际应用
- 所有深度模型
常见错误
忽略广播
概率直接 log0
矩阵内维不匹配
文档来源
09_深度学习数学基础速查原始文档
学习资料/deeplearning/09_深度学习数学基础速查.md- §2–10 线代与微积分
- §11–17 概率信息论
- §18 数值稳定
常见问题
必须先学完高数吗?
不必,但要理解当前公式、形状和用途。
KL 是距离吗?
通常不对称,严格说不是普通距离。
推荐学习资料
暂未收录相关资料
参考库不会生成虚假资源或无效外部链接。