순서형 로지스틱 회귀 (Ordinal Logistic Regression)

통계
한 줄 정의: "매우 불만족~매우 만족"처럼 순서는 있지만 간격은 일정하지 않은 응답 변수를 분석할 때 쓰는 회귀분석 방법입니다.

쉽게 풀면

설문조사에서 "전혀 그렇지 않다, 그렇지 않다, 보통이다, 그렇다, 매우 그렇다"처럼 5단계로 답하게 하는 경우가 많습니다. 이 응답은 숫자로 1~5점을 매길 수 있지만, 1점과 2점의 차이가 4점과 5점의 차이와 똑같은 크기라고 보장할 수 없습니다. 그렇다고 이걸 "예/아니오" 같은 단순한 두 갈래로 취급하면 순서 정보를 버리게 됩니다. 순서형 로지스틱 회귀는 이런 애매한 상황을 위해 만들어진 방법으로, 순위 정보(순서는 있다)는 살리면서 등간격이라고 억지로 가정하지 않고 "어떤 단계 이상으로 응답할 확률"을 모형화합니다.

왜 중요한가

설문조사, 임상 중증도 평가, 만족도 조사 등 순위가 있는 범주형 응답은 사회과학과 의학 연구에서 매우 흔하게 다뤄지는 자료 형태이기 때문에, 이 방법은 리커트 척도나 등급 변수를 정확하게 분석하기 위한 표준적인 통계 도구로 자리잡았습니다. 순서 정보를 무시하고 단순 선형회귀나 이분형 로지스틱 회귀로 분석하면 정보 손실이나 잘못된 가정으로 인해 결과가 왜곡될 수 있어, 순위형 자료를 다루는 논문에서는 이 방법의 사용 여부와 근거를 명시하는 것이 중요하게 여겨집니다.

논문에서는 이렇게 쓰입니다

"직무만족도(5점 리커트 척도)를 종속변수로 하는 순서형 로지스틱 회귀(ordinal logistic regression)를 실시한 결과, 근속연수가 길수록 더 높은 만족도 범주에 속할 승산이 유의하게 증가하였다(OR=1.24, p<0.01)."

이 문장은 근속연수가 늘어날수록 응답자가 "매우 불만족"보다 "만족" 쪽 범주에 속할 가능성이 통계적으로 유의하게 높아진다는 것을 의미합니다. 리커트 척도 설문 결과를 분석할 때 흔히 사용되는 방법입니다.

"뇌졸중 환자의 기능적 회복 정도(순위형 척도인 수정 랭킨 척도, mRS)를 종속변수로 순서형 로지스틱 회귀를 적용하여 치료 시작 시점이 회복 등급에 미치는 영향을 분석하였다."

임상연구에서 환자의 회복 상태를 여러 단계의 순위로 평가하고, 그 등급에 영향을 미치는 요인을 분석하는 데 이 방법이 쓰인 예문이다.

"소비자의 제품 만족도 등급(매우 불만족~매우 만족)에 대해 순서형 로지스틱 회귀를 적용한 결과, 가격 대비 품질 인식이 만족도 등급 상승에 유의한 영향을 미치는 것으로 나타났다."

마케팅 연구에서 소비자 만족도라는 순위형 응답을 종속변수로 삼아 여러 예측 요인의 영향을 분석한 예문이다.

조금 더 깊게 보면

이 방법은 흔히 누적 로짓 모형(cumulative logit model) 형태로 구현되며, 여러 개의 임계값(threshold)을 두어 "특정 범주 이상에 속할 확률"을 로지스틱 함수로 모형화합니다. 핵심 가정인 비례승산 가정은 설명변수의 효과가 어느 임계값을 기준으로 하든 동일하다는 뜻으로, 이 가정이 성립하지 않으면 부분비례승산모형(partial proportional odds model)이나 일반화순서형 로짓모형 같은 대안을 고려하기도 합니다. 가정 검토에는 흔히 브랜트 검정(Brant test) 등이 활용됩니다.

주의할 점

순서형 로지스틱 회귀는 "비례승산 가정(각 단계 구간에서 설명변수의 효과가 동일하다는 가정)"을 전제로 하며, 이 가정이 깨지면 결과 해석이 왜곡될 수 있습니다. 단순한 이분형 결과를 다루는 로지스틱 회귀와 달리 세 개 이상의 순서 있는 범주를 다룰 때 사용해야 하며, 순서가 없는 범주(예: 거주 지역)에는 적용할 수 없습니다.

관련 용어