机器学习入门文档深度页
半监督与自监督学习
半监督结合少量标签和大量无标签数据,自监督从数据本身构造训练目标。
学习前需要掌握
背景与问题
高质量标签通常昂贵,而原始文本、图像和传感器数据较易收集。两类方法都试图利用无标签数据中的结构。
概念定义
半监督的监督信号部分来自人工标签;自监督通过遮盖、预测上下文或数据变换自动生成目标,再迁移到下游任务。
直观理解
半监督像少量带答案题带动大量未标注题;自监督像把题目的一部分遮住,让数据自己提供答案。
核心原理
预训练目标与下游任务不同,表示是否有用仍需在独立下游评价中验证。伪标签错误也可能被循环放大。
数学表达
核心表达
预训练目标与下游任务不同,表示是否有用仍需在独立下游评价中验证。伪标签错误也可能被循环放大。
变量含义
变量定义与本页概念定义一致,代码中的同名变量保持相同语义。
计算步骤
- 1准备无标签数据
- 2设计预训练或伪标签策略
- 3避免评价数据参与训练
- 4在下游训练/验证
代码对应位置
示例 1半监督与自监督学习:最小可验证示例:把正文原理映射为可检查的代码行为。
计算与实现步骤
- 1
准备无标签数据
- 2
设计预训练或伪标签策略
- 3
避免评价数据参与训练
- 4
在下游训练/验证
- 5
比较纯监督基线
代码实现
示例 1
半监督与自监督学习:最小可验证示例
半监督与自监督学习:最小可验证示例
Python
example_01.py用途:把正文原理映射为可检查的代码行为。
# 自监督思想示意:遮住一个位置并预测原值
masked = sample.copy()
target = masked[position]
masked[position] = mask_token代码解析
解析始终位于完整代码下方,并按实际代码段逐项对应。
输入数据与任务
把正文原理映射为可检查的代码行为。
Step 1 · 1–4 行
先确认输入形状和数据边界。
# 自监督思想示意:遮住一个位置并预测原值
masked = sample.copy()
target = masked[position]
masked[position] = mask_token预期输出或运行结果
产生一条由原始样本自身构造的输入与训练目标。
常见错误 · 2 条
- 把无标签数据等同无风险数据
- 伪标签无验证地循环使用
实际应用
- 语言模型预训练
- 有限标签图像分类
常见错误
把无标签数据等同无风险数据
伪标签无验证地循环使用
文档来源
00|机器学习导论原始文档
学习资料/learning_tech/00_introduction.md- §3.3 半监督与自监督学习
推荐学习资料
暂未收录相关资料
参考库不会生成虚假资源或无效外部链接。