마할라노비스 거리 (Mahalanobis Distance)

통계
한 줄 정의: 여러 변수를 동시에 고려하면서, 변수들 사이의 상관관계까지 반영하여 한 관측치가 전체 데이터 집단의 중심에서 얼마나 떨어져 있는지를 나타내는 거리 지표입니다.

쉽게 풀면

키와 몸무게 데이터가 있다고 해봅시다. 키 180cm에 몸무게 45kg인 사람은 키만 보면 평범하고 몸무게만 보면 평범할 수 있지만, "키에 비해 몸무게가 지나치게 가볍다"는 조합 자체가 이상합니다. 단순히 평균에서 얼마나 떨어졌는지(유클리드 거리)만 보면 이런 조합의 이상함을 놓치기 쉽습니다. 마할라노비스 거리는 변수들 사이의 상관관계(키가 크면 몸무게도 대체로 큰 경향)까지 고려해서, "이 조합이 전체 데이터의 패턴에서 얼마나 벗어나 있는가"를 계산합니다. 그래서 여러 변수를 함께 볼 때의 다변량 이상치를 찾아내는 데 특히 유용합니다.

왜 중요한가

실제 데이터는 변수들이 서로 얽혀 있는 경우가 많아, 개별 변수만 따로 살펴보는 방식으로는 진짜 이상한 관측치를 놓치기 쉽습니다. 마할라노비스 거리는 이러한 다변량 구조를 반영해 이상치를 걸러내거나 관측치를 분류하는 데 쓰이기 때문에, 심리학·사회과학의 설문 데이터 정제부터 패턴 인식, 이상 탐지 분야의 알고리즘 설계까지 폭넓게 인용됩니다.

논문에서는 이렇게 쓰입니다

"마할라노비스 거리를 산출하여 χ² 분포 기준 p < .001에 해당하는 다변량 이상치 3건을 분석에서 제외하였다."

이 문장은 여러 변수를 동시에 고려했을 때 나머지 데이터와 패턴이 크게 다른 응답 3건을 통계적 기준으로 걸러냈다는 뜻입니다.

"각 표본과 클래스 중심 간 마할라노비스 거리를 기준으로 최근접 클래스에 할당하는 분류 규칙을 적용하였다."

패턴 인식 연구에서 마할라노비스 거리를 분류 기준으로 사용한 문장입니다.

"공정 데이터의 다변량 관리도에서 마할라노비스 거리가 관리 한계선을 벗어난 시점을 이상 상태 발생 시점으로 판단하였다."

품질관리 연구에서 마할라노비스 거리를 공정 이상 탐지 지표로 활용한 문장입니다.

조금 더 깊게 보면

마할라노비스 거리는 변수들의 분산과 공분산 정보를 담은 공분산행렬의 역행렬을 이용해 계산되며, 이 과정에서 변수 간 상관관계와 서로 다른 척도(단위)의 차이가 함께 보정됩니다. 관측치 수가 변수 개수에 비해 충분히 많지 않거나 변수 간 상관이 지나치게 높은 다중공선성 상황에서는 공분산행렬의 역행렬 계산이 불안정해져 거리값이 왜곡될 수 있어 주의가 필요합니다. 표본이 다변량 정규분포를 따른다는 가정 아래에서는 마할라노비스 거리의 제곱이 카이제곱 분포를 따른다는 성질이 알려져 있어, 이를 근거로 이상치 판정 기준값을 정하는 경우가 많습니다.

주의할 점

마할라노비스 거리는 변수 하나하나의 값이 극단적이지 않아도 변수들의 "조합"이 이상하면 큰 값을 갖습니다. 그래서 단변량 이상치 탐지(예: Z점수)만으로는 걸러지지 않는 사례를 찾아낼 수 있지만, 다중공선성이 심한 데이터에서는 계산이 불안정해질 수 있으므로 함께 점검해야 합니다. 또한 이 거리는 선형판별분석에서 관측치를 어느 집단에 분류할지 판단하는 기준으로도 활용됩니다.

관련 용어