← 질문 목록
#215깊이 0
DBSCAN은 K-means보다 어떤 상황에서 더 유리한가?
데이터베이스심화
데이터의 분포가 원형이 아니거나 노이즈가 섞인 데이터셋에서 유리하다. K-means는 중심 둘레에 고르게 모인 덩어리에 맞고, DBSCAN은 밀도로 묶으므로 길쭉하거나 휘어진 모양도 잡는다.
| 기준 | K-means | DBSCAN |
|---|---|---|
| 클러스터 모양 | 구형 (Centroid 기반) | 임의의 모양 (Density 기반) |
| 노이즈 처리 | 모든 점을 할당 | 밀도 미달 점을 노이즈로 분류 |
| 파라미터 | K (클러스터 개수) | eps, minPts (밀도 기준) |
DBSCAN은 설정한 거리(eps) 내에 최소 점 개수(minPts)가 있으면 이를 핵심적으로 연결한다. 이 과정을 반복해 밀도가 높은 영역을 하나의 덩어리로 묶는다.
반면 K-means는 모든 데이터를 강제로 클러스터에 포함시킨다. 밀도가 낮은 외곽의 점들이 중심점과 묶여 클러스터의 모양을 왜곡시킨다.
데이터 모양을 미리 정하기 어렵거나 이상치를 따로 가려야 할 때 DBSCAN이 맞다.