机器学习进阶文档深度页
无监督学习结果评价
从内部结构、稳定性、外部标签、下游价值和领域解释多角度评价无标签结果。
学习前需要掌握
聚类内容待补充评价内容待补充
背景与问题
高轮廓系数不保证分组可行动,降维保留方差也不保证保留预测信息。
概念定义
没有标准标签时不能只用准确率;内部指标衡量数学结构,业务意义必须另行验证。
直观理解
算法找到“像”的群体,但“像什么、是否有用”需要领域和独立实验回答。
核心原理
检查随机种子与参数稳定性、专家解释、下游任务提升和独立数据复现。真实标签若存在只能用于事后外部评价。
数学表达
核心表达
检查随机种子与参数稳定性、专家解释、下游任务提升和独立数据复现。真实标签若存在只能用于事后外部评价。
变量含义
变量定义与本页概念定义一致,代码中的同名变量保持相同语义。
计算步骤
- 1计算内部指标
- 2改变参数/种子
- 3检查簇规模和样本
- 4领域命名
代码对应位置
示例 1无监督学习结果评价 实现:对应文档中的训练与预测逻辑。
计算与实现步骤
- 1
计算内部指标
- 2
改变参数/种子
- 3
检查簇规模和样本
- 4
领域命名
- 5
独立数据验证
- 6
评估下游价值
代码实现
示例 1
无监督学习结果评价 实现
无监督学习结果评价 实现
scikit-learn
example_01.py用途:对应文档中的训练与预测逻辑。
for seed in [1,2,3,4,5]:
labels=KMeans(3,n_init=20,random_state=seed).fit_predict(X_scaled)
print(seed,silhouette_score(X_scaled,labels))代码解析
解析始终位于完整代码下方,并按实际代码段逐项对应。
输入数据与任务
对应文档中的训练与预测逻辑。
Step 1 · 1–3 行
输出中间参数、形状或最终指标,用于核对代码是否符合预期。
for seed in [1,2,3,4,5]:
labels=KMeans(3,n_init=20,random_state=seed).fit_predict(X_scaled)
print(seed,silhouette_score(X_scaled,labels))预期输出或运行结果
输出多个随机种子下的轮廓系数,用于观察稳定性。
常见错误 · 3 条
- 簇直接命名业务类别
- 只追求内部指标
- 偷用标签训练
实际应用
- 聚类审查
- 降维验证
常见错误
簇直接命名业务类别
只追求内部指标
偷用标签训练
文档来源
06|无监督学习原始文档
学习资料/learning_tech/06_unsupervised_learning.md- §8 聚类和分类的区别
- §9 无监督结果如何评价
推荐学习资料
暂未收录相关资料
参考库不会生成虚假资源或无效外部链接。