← 질문 목록
#311깊이 0

고차원 데이터에서 거리 계산 시 발생하는 문제는 무엇인가?

데이터베이스심화성능인덱스·질의

고차원 데이터에서는 점 사이 거리의 상대적 차이가 줄어 유사도를 구분하기 어려워지는 문제다. 차원이 증가할수록 데이터 공간이 급격히 넓어진다.

상황데이터 밀도최단·최장 거리 차이거리 기반 분석
저차원높음크다명확한 구분 가능
고차원극도로 낮음상대적으로 준다구분력이 떨어진다

차원이 늘어나면 같은 밀도를 유지하는 데 필요한 표본 수가 기하급수적으로 늘어난다. 고차원 공간에서는 데이터가 존재하는 영역보다 비어 있는 공간이 훨씬 많아진다.

차원이 높고 값들이 비슷하게 흩어지면 가장 가까운 것과 가장 먼 것의 거리 차이가 상대적으로 줄어든다. 늘 그런 것은 아니고 조건이 붙는다. 이 때문에 이웃을 정의하거나 밀도를 측정하는 기존 방식이 무력화된다.

거리 집중이 나타나면 DBSCAN이나 K-means 같은 거리 기반 알고리즘의 구분력이 떨어진다. PCA로 차원을 줄이거나 코사인 유사도를 쓰는 이유다.

추천 꼬리질문

0/300

적은 내용은 AI 학습에 쓰일 수 있습니다. 이름이나 연락처는 넣지 말아 주세요.

관련 질문

고차원 데이터에서 거리 계산 시 발생하는 문제는 무엇인가?