순서통계량 (Order Statistics)

통계
한 줄 정의: 표본을 크기 순으로 정렬했을 때 각 위치의 값을 가리키는 통계량입니다.

쉽게 풀면

표본을 작은 값부터 큰 값까지 줄 세우면 첫 번째 값은 최솟값, 마지막 값은 최댓값이 됩니다. 이렇게 순서를 매긴 값 하나하나를 순서통계량이라고 합니다. 중앙값이나 사분위수처럼 익숙한 요약값도 사실은 순서통계량으로 정의됩니다.

왜 중요한가

분포의 모양을 가정하지 않고도 다룰 수 있어 비모수 방법과 극단값 분석의 기초가 됩니다. 신뢰구간을 순서통계량으로 구성하거나 분위수를 추정하는 절차의 이론적 근거가 여기서 나옵니다.

논문에서는 이렇게 쓰입니다

"표본 중앙값은 순서통계량의 함수이므로 그 표집분포를 순서통계량의 분포로부터 유도하였다."

정렬된 값들의 분포 성질을 이용해 요약통계량의 성질을 구했다는 뜻입니다.

조금 더 깊게 보면

연속분포에서 k번째 순서통계량의 밀도는 그 값보다 작은 관측치가 k-1개, 큰 관측치가 나머지가 될 확률을 조합해 얻으며, 균일분포의 순서통계량은 베타분포를 따릅니다. 순서통계량들은 서로 독립이 아니고 항상 크기 순서라는 제약을 받는다는 점이 특징입니다. 최솟값과 최댓값의 극한 거동은 극단값 이론으로 이어지고, 순서통계량의 선형결합은 강건한 위치 추정량을 만드는 데 쓰입니다.

주의할 점

순서통계량은 순위 자체를 쓰는 순위기반 통계량과 밀접하지만, 순위가 아니라 그 위치의 실제 값이라는 점이 다릅니다. 표본에서 계산하는 백분위수도 순서통계량을 보간해 정의한 값입니다.

관련 용어