결합분포 (Joint Distribution)

통계
한 줄 정의: 두 개 이상의 확률변수가 동시에 특정 값들을 가질 확률(또는 확률밀도)을 나타내는 분포.

쉽게 풀면

키와 몸무게처럼 서로 관련이 있을 수 있는 두 변수를 따로따로 보지 않고, '키가 170이면서 동시에 몸무게가 65인 경우가 얼마나 흔한가'처럼 두 변수의 조합 전체를 확률로 표현한 것이 결합분포다. 결합분포를 알면 각 변수의 개별 분포(주변분포)와 한 변수가 주어졌을 때 다른 변수의 분포(조건부분포)를 모두 유도할 수 있다. 다변량 통계 분석의 출발점이 되는 개념이다.

왜 중요한가

결합분포는 다변량 통계, 베이지안 모형, 시계열 분석, 머신러닝의 확률적 그래프 모형 등 변수 간 관계를 다루는 거의 모든 분야의 이론적 기반이기 때문에 방법론 섹션에서 빈번히 등장합니다. 변수들이 함께 어떻게 움직이는지를 정확히 표현할 수 있어야 이후의 조건부 추론이나 예측이 가능해지므로, 그 중요성이 큽니다.

논문에서는 이렇게 쓰입니다

"두 변수의 결합분포로부터 조건부분포를 유도하여 상관구조를 분석하였다."

다변량 자료의 의존구조를 설명하거나 조건부 확률을 계산하는 이론적 근거로 언급된다.

"금융시계열 연구에서는 자산 수익률 간 결합분포를 코퓰러 함수를 통해 모델링하여 꼬리위험 의존성을 분석하였다."

계량금융 분야에서 결합분포를 코퓰러(copula) 모형과 함께 다룰 때 흔히 쓰이는 문장입니다.

조금 더 깊게 보면

결합분포를 각 변수의 주변분포와 변수 간 의존구조로 분리해 다루는 대표적인 도구가 코퓰러(copula)이며, 특히 극단값 사이의 동시 발생 경향(꼬리 의존성)을 분석할 때 자주 활용됩니다. 또한 결합분포로부터 조건부분포를 유도하는 과정은 베이즈 정리의 기초가 되며, 그래프 모형(graphical model)에서는 변수 간 조건부 독립 구조를 결합분포의 인수분해로 표현하기도 합니다.

주의할 점

두 변수가 각각 정규분포를 따른다고 해서 결합분포도 자동으로 이변량 정규분포가 되는 것은 아니라는 점에 유의해야 한다.

관련 용어