机器学习进阶文档深度页
无监督学习中的过拟合
过多簇、成分或噪声方向会让无监督模型追随训练细节,需要稳定性和独立价值验证。
学习前需要掌握
无监督评价内容待补充
背景与问题
K-Means 过多 K、PCA 保留低方差噪声、异常检测边界过紧都属于自由度过高。
概念定义
无标签任务没有训练准确率差距的直接形式,过拟合表现为结构过细、对参数/样本敏感或新正常样本误报。
直观理解
把每个个体都分成独立小组会让内部误差很好,却没有可推广结构。
核心原理
使用独立数据、参数扰动、重采样稳定性、下游任务和领域解释共同评价。
数学表达
核心表达
使用独立数据、参数扰动、重采样稳定性、下游任务和领域解释共同评价。
变量含义
变量定义与本页概念定义一致,代码中的同名变量保持相同语义。
计算步骤
- 1留出独立数据
- 2改变 K/成分数
- 3改变随机种子
- 4比较稳定性
代码对应位置
示例 1无监督学习中的过拟合 示例:对应文档中的可靠评价或训练流程。
计算与实现步骤
- 1
留出独立数据
- 2
改变 K/成分数
- 3
改变随机种子
- 4
比较稳定性
- 5
检查下游表现
- 6
领域审查
代码实现
示例 1
无监督学习中的过拟合 示例
无监督学习中的过拟合 示例
scikit-learn
example_01.py用途:对应文档中的可靠评价或训练流程。
for k in [2,3,5,10]:
labels=KMeans(k,n_init=20,random_state=42).fit_predict(X_train_scaled)
print(k,silhouette_score(X_train_scaled,labels))代码解析
解析始终位于完整代码下方,并按实际代码段逐项对应。
输入数据与任务
对应文档中的可靠评价或训练流程。
Step 1 · 1–3 行
输出中间参数、形状或最终指标,用于核对代码是否符合预期。
for k in [2,3,5,10]:
labels=KMeans(k,n_init=20,random_state=42).fit_predict(X_train_scaled)
print(k,silhouette_score(X_train_scaled,labels))预期输出或运行结果
不同簇数的内部指标,仍需独立稳定性和业务解释。
常见错误 · 3 条
- 只最小化训练簇内误差
- 内部指标唯一化
- 确认样本轴、特征轴以及 X 与 y 的第一维完全对应。
实际应用
- 聚类
- PCA
- 异常检测
常见错误
只最小化训练簇内误差
内部指标唯一化
文档来源
12|过拟合:诊断与解决方法原始文档
学习资料/learning_tech/12_overfitting_solutions.md- §14 无监督学习中的过拟合
推荐学习资料
暂未收录相关资料
参考库不会生成虚假资源或无效外部链接。