실루엣 계수 (Silhouette Score)

통계
한 줄 정의: 군집분석 결과에서 각 데이터가 자기 군집에는 잘 어울리고 다른 군집과는 잘 구별되는지를 -1에서 1 사이의 숫자로 나타낸 지표입니다.

쉽게 풀면

학급을 몇 개의 모둠으로 나눴다고 생각해봅시다. 실루엣 계수는 "이 학생이 지금 모둠 친구들과는 얼마나 가깝고, 옆 모둠 친구들과는 얼마나 먼가?"를 점수로 매기는 것과 같습니다. 자기 모둠 안에서는 서로 아주 친하고(거리가 가깝고) 다른 모둠과는 확실히 구분된다면 점수는 1에 가까워집니다. 반대로 자기 모둠보다 오히려 옆 모둠과 더 가깝다면 점수는 음수가 되어, "이 학생은 모둠을 잘못 배정받았다"는 신호가 됩니다. 이렇게 전체 데이터의 점수를 평균 내면 "이번 군집 나누기가 얼마나 잘 됐는가"를 하나의 숫자로 요약할 수 있습니다.

왜 중요한가

실루엣 계수는 정답 레이블이 없는 비지도학습인 군집분석에서 결과의 타당성을 정량적으로 평가할 수 있는 몇 안 되는 지표이기 때문에, 고객 세분화나 유전자 발현 패턴 분류처럼 군집 개수를 사전에 알 수 없는 다양한 응용 분야 논문에서 군집 수를 결정하는 근거로 자주 인용됩니다. 특히 다른 내부 평가지표(예: 엘보우 방법)와 함께 제시되어 군집화 결과의 신뢰도를 뒷받침하는 용도로도 쓰입니다.

논문에서는 이렇게 쓰입니다

"군집 수를 2에서 6까지 변화시키며 실루엣 계수를 비교한 결과, 군집 수가 4일 때 평균 실루엣 계수가 0.62로 가장 높게 나타나 최적의 군집 수로 선정하였다."

이 문장은 "여러 후보 중에서 군집이 가장 뚜렷하게 잘 나뉘는 경우를 실루엣 계수로 비교해 골랐다"는 뜻입니다. 군집 개수를 미리 알 수 없는 k-평균 군집화 같은 분석에서 몇 개로 나눌지 결정할 때 흔히 사용됩니다.

"고객 구매 패턴에 대한 계층적 군집분석 결과를 실루엣 계수로 검증한 결과, 세 개의 군집으로 나누었을 때 가장 높은 응집도와 분리도를 보였다."

마케팅 분야에서 고객 세분화 결과의 타당성을 실루엣 계수로 뒷받침한 예이다.

"단일세포 전사체 데이터의 군집화 결과에 대해 실루엣 계수를 산출하여 세포 유형 간 분리도를 정량적으로 평가하였다."

생명과학 분야에서 고차원 데이터의 군집화 품질을 실루엣 계수로 검증한 예를 보여준다.

조금 더 깊게 보면

개별 데이터 포인트의 실루엣 계수는 같은 군집 내 다른 점들과의 평균 거리(응집도)와 가장 가까운 다른 군집과의 평균 거리(분리도)를 비교해 계산되며, 이를 전체 데이터에 대해 평균 낸 값이 흔히 보고하는 평균 실루엣 계수입니다. 값이 0에 가까우면 군집 경계가 모호하다는 뜻이고, 음수는 잘못된 군집에 배정되었을 가능성을 시사합니다. 실루엣 계수는 거리 기반 지표이기 때문에 사용하는 거리 척도와 데이터의 스케일링 방식에 따라 결과가 달라질 수 있어, 다른 평가지표와 함께 해석하는 것이 일반적입니다.

주의할 점

실루엣 계수가 높다고 해서 그 군집 결과가 연구 목적상 의미 있는 분류라는 보장은 없습니다. 수학적으로 잘 나뉘어 보여도 실제 현상과 무관한 그룹일 수 있으므로, 각 군집의 특성을 해석하고 이론적 타당성을 함께 검토해야 합니다.

관련 용어