机器学习进阶文档深度页
模型监控与数据/概念漂移
上线后持续监控输入质量、分布、预测比例、真实效果、延迟和版本。
学习前需要掌握
模型评价内容待补充数据质量内容待补充
背景与问题
部署时的地区、设备、用户行为和规则会变化,离线优秀不代表长期有效。
概念定义
数据漂移是输入分布变化;概念漂移是输入与目标关系变化。两者都可能让离线模型失效。
直观理解
模型像根据旧地图导航,城市或道路规则变化后必须发现并更新。
核心原理
无即时标签时先监控输入与预测代理信号;有延迟标签后计算真实分群指标,并定义告警和再训练条件。
数学表达
核心表达
无即时标签时先监控输入与预测代理信号;有延迟标签后计算真实分群指标,并定义告警和再训练条件。
变量含义
变量定义与本页概念定义一致,代码中的同名变量保持相同语义。
计算步骤
- 1记录模型/数据版本
- 2监控缺失和范围
- 3比较特征分布
- 4监控预测比例/置信度
代码对应位置
示例 1模型监控与数据/概念漂移 示例:对应文档中的可靠评价或训练流程。
计算与实现步骤
- 1
记录模型/数据版本
- 2
监控缺失和范围
- 3
比较特征分布
- 4
监控预测比例/置信度
- 5
回收标签
- 6
分群评价
- 7
定义回滚与再训练
代码实现
示例 1
模型监控与数据/概念漂移 示例
模型监控与数据/概念漂移 示例
scikit-learn
example_01.py用途:对应文档中的可靠评价或训练流程。
current_missing=live_df.isna().mean()
current_summary=live_df.describe()
print(current_missing)
print(current_summary)代码解析
解析始终位于完整代码下方,并按实际代码段逐项对应。
输入数据与任务
对应文档中的可靠评价或训练流程。
mean- 训练特征逐列均值。
Step 1 · 1–4 行
只从训练数据逐列计算均值与标准差,对应标准化公式中的 μ 和 σ。
current_missing=live_df.isna().mean()
current_summary=live_df.describe()
print(current_missing)
print(current_summary)代码与数学原理
减去训练均值并除以训练标准差,对应代码中的 mean/std 或 StandardScaler。
预期输出或运行结果
输出线上输入缺失率和分布摘要,供与训练基线比较。
常见错误 · 4 条
- 不要在测试集上调用 fit 或 fit_transform;测试集只能复用训练参数。
- 只监控平均准确率
- 漂移即自动重训
- 无版本记录
实际应用
- 本地批处理监控
- 生产维护
常见错误
只监控平均准确率
漂移即自动重训
无版本记录
文档来源
08|端到端机器学习项目原始文档
学习资料/learning_tech/08_end_to_end_project.md- §12 部署后的监控
- §13 项目完成检查清单
推荐学习资料
暂未收录相关资料
参考库不会生成虚假资源或无效外部链接。