순위기반 통계량 (Rank-Based Statistics)

통계
한 줄 정의: 관측값 자체의 크기 대신 관측값들을 크기 순서로 나열했을 때의 순위(rank)를 이용하여 계산하는, 분포에 대한 가정이 적은 통계량.

쉽게 풀면

시험 점수 그 자체(85점, 92점 등)를 이용하는 대신, '몇 등인지'라는 순위 정보만 이용해서 통계 분석을 하는 방식이다. 순위만 사용하면 원래 값에 극단적인 이상치가 섞여 있어도 순위 자체는 크게 흔들리지 않기 때문에 이상치에 강건(robust)하고, 자료가 정규분포를 따른다는 가정 없이도 검정을 수행할 수 있다는 장점이 있다. 윌콕슨 순위합 검정, 스피어만 순위상관계수 등이 대표적인 순위기반 통계량이다.

왜 중요한가

실제 자료는 정규분포를 따르지 않거나 이상치를 포함하는 경우가 많은데, 이때 t검정이나 상관분석 같은 모수적 방법을 그대로 쓰면 결과가 왜곡될 위험이 있다. 순위기반 통계량은 분포에 대한 가정을 거의 요구하지 않으면서도 이상치에 강건한 결론을 제공하기 때문에, 표본이 작거나 자료의 정규성이 의심되는 실험연구·설문연구에서 비모수 검정의 핵심 도구로 폭넓게 쓰인다. 또한 순위 개념은 순위상관, 순위기반 회귀 등 여러 통계 기법의 기초가 된다.

논문에서는 이렇게 쓰입니다

"자료가 정규성을 만족하지 않아 순위기반 통계량인 윌콕슨 순위합 검정을 적용하였다."

표본이 작거나 정규분포를 따르지 않는다고 의심될 때, 모수적 검정 대신 사용하는 비모수적 대안으로 언급된다.

"두 변수 간 관계가 비선형적일 가능성을 고려하여 피어슨 상관계수 대신 순위기반 통계량인 스피어만 순위상관계수를 산출하였다."

변수 간 관계가 반드시 직선적이지 않을 때, 순위 정보만으로 단조적 연관성을 파악하는 접근을 설명할 때 쓰인다.

"세 집단 이상의 순위 분포 차이를 비교하기 위해 순위기반 통계량인 크루스칼-왈리스 검정을 실시하였다."

분산분석의 비모수적 대안으로 여러 집단의 중심 경향 차이를 순위에 기반해 검정하는 사례를 나타낸다.

조금 더 깊게 보면

순위기반 통계량을 계산할 때는 동일한 값(동점, tie)이 여러 개 있을 경우 해당 관측치들에 평균 순위를 부여하는 방식이 흔히 쓰이며, 동점이 많으면 근사 검정통계량에 보정이 필요할 수 있다. 또한 순위기반 방법은 상대적 위치 정보만 사용하므로 효과크기를 원래 척도로 직접 해석하기 어려운 경우가 많아, 논문에서는 순위 차이에 기반한 별도의 효과크기 지표(예: 순위상관 기반 효과크기)를 함께 보고하기도 한다.

주의할 점

순위기반 통계량은 원래 값의 크기 차이에 대한 세부 정보를 일부 버리기 때문에, 분포 가정이 실제로 충족되는 상황에서는 모수적 방법보다 검정력이 다소 낮을 수 있다.

관련 용어