← 질문 목록
#311깊이 0
고차원 데이터에서 거리 계산 시 발생하는 문제는 무엇인가?
고차원 데이터에서는 점 사이 거리의 상대적 차이가 줄어 유사도를 구분하기 어려워지는 문제다. 차원이 증가할수록 데이터 공간이 급격히 넓어진다.
| 상황 | 데이터 밀도 | 최단·최장 거리 차이 | 거리 기반 분석 |
|---|---|---|---|
| 저차원 | 높음 | 크다 | 명확한 구분 가능 |
| 고차원 | 극도로 낮음 | 상대적으로 준다 | 구분력이 떨어진다 |
차원이 늘어나면 같은 밀도를 유지하는 데 필요한 표본 수가 기하급수적으로 늘어난다. 고차원 공간에서는 데이터가 존재하는 영역보다 비어 있는 공간이 훨씬 많아진다.
차원이 높고 값들이 비슷하게 흩어지면 가장 가까운 것과 가장 먼 것의 거리 차이가 상대적으로 줄어든다. 늘 그런 것은 아니고 조건이 붙는다. 이 때문에 이웃을 정의하거나 밀도를 측정하는 기존 방식이 무력화된다.
거리 집중이 나타나면 DBSCAN이나 K-means 같은 거리 기반 알고리즘의 구분력이 떨어진다. PCA로 차원을 줄이거나 코사인 유사도를 쓰는 이유다.