주성분회귀 (Principal Component Regression)

통계
한 줄 정의: 서로 겹치는 정보가 많은 여러 독립변수를 몇 개의 요약 변수(주성분)로 압축한 다음, 그 요약 변수로 회귀분석을 하는 방법입니다.

쉽게 풀면

독립변수가 여러 개인데 그 변수들끼리 서로 강하게 상관되어 있으면(다중공선성), 일반적인 회귀분석은 각 변수의 개별 효과를 안정적으로 구분해내지 못하고 계수가 이상하게 튀는 문제가 생깁니다. 주성분회귀는 이 문제를 해결하기 위해 먼저 주성분분석으로 여러 독립변수를 서로 겹치지 않는 소수의 "요약 변수(주성분)"로 압축합니다. 그런 다음 원래 변수 대신 이 요약 변수를 가지고 회귀분석을 진행합니다. 변수 개수는 줄었지만 원래 데이터가 가진 정보 대부분은 유지되기 때문에, 다중공선성 문제 없이 더 안정적인 예측 모형을 만들 수 있습니다.

왜 중요한가

독립변수가 많고 서로 상관이 높은 상황은 화학, 유전체학, 계량경제학처럼 관측 변수 수가 표본 수에 비해 많거나 변수 간 연관성이 강한 분야에서 흔히 발생합니다. 주성분회귀는 이런 상황에서도 안정적인 예측 모형을 만들 수 있게 해주는 대표적인 방법 중 하나로, 다중공선성으로 인해 일반 회귀분석의 계수 추정이 불안정해지는 문제를 우회하는 실용적 해법으로 다루어집니다.

논문에서는 이렇게 쓰입니다

"12개의 토양 성분 변수 간 다중공선성이 심각하여, 상위 3개 주성분을 추출한 뒤 이를 예측변수로 사용하는 주성분회귀를 수행하였다."

이 문장은 "변수끼리 너무 겹쳐서 회귀분석이 불안정해지자, 변수들을 몇 개의 요약 지표로 압축한 뒤 그 지표로 회귀분석을 했다"는 뜻입니다.

"근적외선 분광 데이터의 수백 개 파장대 변수를 주성분회귀에 투입하여 시료의 성분 농도를 예측하는 모형을 구축하였다."

화학계량학(chemometrics) 분야에서는 서로 매우 밀접하게 연관된 수많은 스펙트럼 변수를 주성분으로 압축한 뒤 회귀에 사용하는 방식이 표준적으로 쓰입니다.

"거시경제 지표 간 높은 상관관계를 고려하여, 다수의 경기선행지수 변수를 주성분회귀로 압축해 국내총생산 성장률을 예측하였다."

계량경제학에서도 서로 밀접하게 움직이는 여러 경제지표를 요약해 예측력을 높이는 목적으로 주성분회귀가 활용됩니다.

조금 더 깊게 보면

주성분회귀는 몇 개의 주성분까지 회귀에 포함할지를 결정해야 하는데, 이는 흔히 각 주성분이 설명하는 분산의 비율이나 교차검증을 통한 예측 성능을 기준으로 정합니다. 다만 주성분은 목표변수(종속변수)를 고려하지 않고 독립변수들의 분산만을 기준으로 추출되기 때문에, 분산은 크지만 목표변수 예측에는 도움이 되지 않는 주성분이 선택될 수 있다는 한계가 있습니다. 이런 한계를 보완하기 위해 목표변수와의 관계까지 함께 고려하는 부분최소제곱회귀(PLS regression) 같은 대안이 함께 언급되기도 합니다.

주의할 점

주성분회귀로 압축된 주성분은 원래 변수들의 조합이라 그 자체로는 해석이 직관적이지 않습니다. "어떤 변수가 결과에 영향을 주는가"를 설명하는 것이 목적이라면, 예측 정확도만 높이는 주성분회귀보다 다중공선성 자체를 진단하고 변수를 정리하는 방법이 더 적합할 수 있습니다.

관련 용어