深度学习进阶文档深度页
深度学习模型调试
调试按数据、shape/dtype、前向损失、梯度、参数更新、极小 batch 和曲线顺序。
学习目标
- 解释核心机制
- 手算一个主要形状或公式
- 运行完整示例并排查错误
为什么需要这个概念
深度学习模型调试是该文档中连接数据表示、训练目标和工程实现的核心主题。
- 掌握深度学习模型调试的输入输出与训练边界
- 能够用 PyTorch 代码验证公式和形状
学习前需要掌握
PyTorch Tensor内容待补充神经网络训练循环
背景与问题
深度学习模型调试是该文档中连接数据表示、训练目标和工程实现的核心主题。
概念定义
调试按数据、shape/dtype、前向损失、梯度、参数更新、极小 batch 和曲线顺序。
直观理解
把深度学习模型调试理解为数据在模型中的一套明确变换,而不是只记一个类名。
核心原理
拟合 8–32 个样本是最有价值的综合检查之一。
实现时必须同时检查 shape、dtype、mask 或模式切换,并用验证集而不是测试集选择配置。
数学表达
核心公式
深度学习模型调试的核心数学表达。
变量含义
Nbatch sizeD/H特征或隐藏维度
计算步骤
- 1按公式或模块逐步计算
- 2核对输出 shape
代码对应位置
示例 1深度学习模型调试 · PyTorch 示例:验证深度学习模型调试的输入、计算和输出。
变量解释
| 变量 | 含义 |
|---|---|
N | batch size |
D/H | 特征或隐藏维度 |
完整数值示例
深度学习模型调试数值/形状检查
已知条件
- N=8
- D=64
- 1
按公式或模块逐步计算
- 2
核对输出 shape
输出保持 batch 维并符合任务头约定
处理前后对比
计算与实现步骤
- 1
确认输入与目标
- 2
建立最小模块
- 3
随机张量前向
- 4
计算损失
- 5
反向与更新
- 6
验证与错误分析
代码实现
示例 1
深度学习模型调试 · PyTorch 示例
深度学习模型调试 · PyTorch 示例
PyTorch
example_01.py用途:验证深度学习模型调试的输入、计算和输出。
x,y=next(iter(loader));print(x.shape,x.dtype,y.shape,y.dtype)
logits=model(x);loss=criterion(logits,y);loss.backward()
for name,p in model.named_parameters():print(name,p.grad is None)代码解析
解析始终位于完整代码下方,并按实际代码段逐项对应。
输入数据与任务
验证深度学习模型调试的输入、计算和输出。
y- 目标标签或连续目标值。
model- 组合预处理和估计器的模型对象。
loss- 当前预测与目标之间的损失值。
Step 1 · 1–3 行
计算损失对参数的梯度,对应数学表达中的 ∇J;梯度只给出局部变化方向。
x,y=next(iter(loader));print(x.shape,x.dtype,y.shape,y.dtype)
logits=model(x);loss=criterion(logits,y);loss.backward()
for name,p in model.named_parameters():print(name,p.grad is None)代码与数学原理
平方误差代码对应均方损失。
预期输出或运行结果
打印与页面说明一致的张量形状或损失。
常见错误 · 5 条
- 先换大模型
- 静默广播
- 随意 detach
- retain_graph 掩盖错误
- 确认样本轴、特征轴以及 X 与 y 的第一维完全对应。
实际应用
- 深度学习模型调试
- 教学与项目基线
常见错误
先换大模型
静默广播
随意 detach
retain_graph 掩盖错误
文档来源
26_深度学习模型调试指南原始文档
学习资料/deeplearning/26_深度学习模型调试指南.md- §1 顺序
- §3 极小 batch
- §4–14 shape/梯度/NaN
- §15–22 排查
常见问题
深度学习模型调试最先检查什么?
先检查输入输出 shape、dtype 和数据边界。
何时使用测试集?
全部设计锁定后最终评估。