机器学习进阶文档深度页
DBSCAN 密度聚类
从核心点扩展高密度区域,识别任意形状簇并把孤立样本标为噪声。
学习前需要掌握
距离内容待补充密度内容待补充
背景与问题
无需预设簇数并能发现弯曲结构,但对尺度、eps 和密度差异敏感。
概念定义
eps 定义邻域半径,min_samples 定义核心点密度;样本分核心点、边界点与噪声点。
直观理解
从人群足够密集的位置出发,把相连的高密度邻域扩成一组。
核心原理
标准化后根据距离分布选择 eps;高维中距离失去区分力,统一 eps 难覆盖密度差异大的簇。
数学表达
核心表达
标准化后根据距离分布选择 eps;高维中距离失去区分力,统一 eps 难覆盖密度差异大的簇。
变量含义
变量定义与本页概念定义一致,代码中的同名变量保持相同语义。
计算步骤
- 1标准化
- 2设置 eps/min_samples
- 3找核心点
- 4扩展相连核心邻域
代码对应位置
示例 1DBSCAN 密度聚类 实现:对应文档中的训练与预测逻辑。
计算与实现步骤
- 1
标准化
- 2
设置 eps/min_samples
- 3
找核心点
- 4
扩展相连核心邻域
- 5
加入边界点
- 6
噪声标 -1
代码实现
示例 1
DBSCAN 密度聚类 实现
DBSCAN 密度聚类 实现
scikit-learn
example_01.py用途:对应文档中的训练与预测逻辑。
from sklearn.cluster import DBSCAN
labels=DBSCAN(eps=0.8,min_samples=5).fit_predict(X_scaled)
print(set(labels))代码解析
解析始终位于完整代码下方,并按实际代码段逐项对应。
输入数据与任务
对应文档中的训练与预测逻辑。
Step 1 · 1–3 行
导入当前步骤需要的数值计算、预处理、模型或评价工具。依赖集中写在代码开头,便于复现。
from sklearn.cluster import DBSCAN
labels=DBSCAN(eps=0.8,min_samples=5).fit_predict(X_scaled)
print(set(labels))预期输出或运行结果
输出簇编号集合,可能包含噪声标记 -1。
常见错误 · 3 条
- 未缩放
- 把 -1 当普通簇
- 一组参数处理差异密度
实际应用
- 空间形状聚类
- 噪声识别
常见错误
未缩放
把 -1 当普通簇
一组参数处理差异密度
文档来源
06|无监督学习原始文档
学习资料/learning_tech/06_unsupervised_learning.md- §6 DBSCAN
推荐学习资料
暂未收录相关资料
参考库不会生成虚假资源或无效外部链接。