공분산분석 (ANCOVA)

통계 연구방법론
한 줄 정의: 집단 간 평균 차이를 비교할 때, 결과에 영향을 줄 수 있는 다른 변수(공변량)의 효과를 통계적으로 먼저 제거한 뒤 비교하는 분석 방법입니다.

쉽게 풀면

새로운 학습법의 효과를 보려고 실험군과 대조군의 기말고사 점수를 비교한다고 해봅시다. 그런데 두 그룹이 원래 실험 시작 전부터 사전 실력 차이가 있었다면, 기말고사 점수 차이가 학습법 때문인지 원래 실력 차이 때문인지 구분하기 어렵습니다. ANCOVA(공분산분석, Analysis of Covariance)는 이럴 때 "사전점수"처럼 결과에 영향을 주는 변수(공변량, covariate)를 통계적으로 통제한 다음, 그 영향을 제거하고 난 "순수한" 집단 간 차이를 비교합니다. 쉽게 말해 분산분석회귀분석의 아이디어를 더해, 비교를 방해하는 변수의 영향을 먼저 걸러내는 방법이라고 볼 수 있습니다.

왜 중요한가

실험 연구에서는 참가자를 완전히 동일한 조건으로 무작위 배정하기 어려운 경우가 많고, 관찰 연구에서는 애초에 무작위 배정 자체가 불가능합니다. ANCOVA는 이런 상황에서 집단 간 사전 차이나 개인차 변수의 영향을 통계적으로 걸러내어, 처치 효과를 더 정확하게 추정할 수 있게 해줍니다. 이 때문에 교육학, 심리학, 의학 등 실험설계 논문에서 집단 비교의 신뢰도를 높이는 핵심 분석 기법으로 널리 쓰이며, 표본 크기가 제한적인 연구에서는 오차분산을 줄여 통계적 검정력을 높이는 효과도 기대할 수 있습니다.

논문에서는 이렇게 쓰입니다

"사전검사 점수를 공변량으로 투입한 공분산분석 결과, 사전점수를 통제한 후에도 집단 간 사후검사 점수 차이는 통계적으로 유의하였다(F=8.21, p<0.01)."

이 문장은 "실험 시작 전 두 집단의 실력 차이를 통계적으로 보정하고 나서도, 학습법에 따른 점수 차이가 우연이 아니라 실제로 존재했다"는 뜻입니다.

"환자의 연령과 기저질환 중증도를 공변량으로 통제한 ANCOVA 분석 결과, 신약 투여군과 위약군 간 치료 후 지표 개선 정도에 유의한 차이가 나타났다."

이 문장은 "환자마다 나이나 원래 질환의 심각도가 달랐던 점을 통계적으로 보정한 뒤에도, 신약을 투여받은 집단이 위약을 투여받은 집단보다 실제로 더 나은 개선을 보였다"는 뜻입니다.

"참가자의 기초 체력 수준을 공변량으로 포함한 공분산분석에서, 운동 프로그램 유형에 따른 사후 근력 측정치의 차이는 유의하지 않았다."

이 문장은 "참가자들의 원래 체력 차이를 통계적으로 통제하고 보니, 어떤 운동 프로그램을 했는지에 따른 근력 차이는 우연히 발생했을 가능성을 배제할 수 없었다"는, 즉 유의한 효과가 발견되지 않았다는 뜻입니다.

조금 더 깊게 보면

ANCOVA에서 산출되는 "조정평균(adjusted mean)"은 각 집단의 공변량 값을 전체 평균 수준으로 맞췄다고 가정했을 때 예상되는 결과 평균으로, 원래의 단순 평균과는 다를 수 있습니다. 공변량은 보통 하나가 아니라 여러 개를 동시에 투입하기도 하며, 이때는 다변량 형태인 MANCOVA와 개념이 이어집니다. 또한 효과크기를 함께 보고하는 경우 부분 에타제곱(partial eta squared) 같은 지표가 자주 함께 제시되며, 공변량이 처치 자체의 영향을 받아 변화하는 변수라면(예: 처치 이후 측정된 값) ANCOVA 적용이 오히려 왜곡을 낳을 수 있다는 점도 논문을 읽을 때 유의해서 볼 부분입니다.

주의할 점

ANCOVA는 공변량과 집단 구분이 서로 독립적이어야 하고, 공변량이 결과에 미치는 영향의 기울기가 모든 집단에서 동일하다는 회귀선 동질성(homogeneity of regression slopes) 가정을 만족해야 합니다. 이 가정이 깨지면(예: 공변량의 영향이 집단마다 다르면) 결과를 그대로 신뢰할 수 없으므로, 분석 전 이 가정을 반드시 점검해야 합니다.

관련 용어