결합분포 (Joint Distribution)
쉽게 풀면
키와 몸무게처럼 서로 관련이 있을 수 있는 두 변수를 따로따로 보지 않고, '키가 170이면서 동시에 몸무게가 65인 경우가 얼마나 흔한가'처럼 두 변수의 조합 전체를 확률로 표현한 것이 결합분포다. 결합분포를 알면 각 변수의 개별 분포(주변분포)와 한 변수가 주어졌을 때 다른 변수의 분포(조건부분포)를 모두 유도할 수 있다. 다변량 통계 분석의 출발점이 되는 개념이다.
왜 중요한가
결합분포는 다변량 통계, 베이지안 모형, 시계열 분석, 머신러닝의 확률적 그래프 모형 등 변수 간 관계를 다루는 거의 모든 분야의 이론적 기반이기 때문에 방법론 섹션에서 빈번히 등장합니다. 변수들이 함께 어떻게 움직이는지를 정확히 표현할 수 있어야 이후의 조건부 추론이나 예측이 가능해지므로, 그 중요성이 큽니다.
논문에서는 이렇게 쓰입니다
다변량 자료의 의존구조를 설명하거나 조건부 확률을 계산하는 이론적 근거로 언급된다.
계량금융 분야에서 결합분포를 코퓰러(copula) 모형과 함께 다룰 때 흔히 쓰이는 문장입니다.
조금 더 깊게 보면
결합분포를 각 변수의 주변분포와 변수 간 의존구조로 분리해 다루는 대표적인 도구가 코퓰러(copula)이며, 특히 극단값 사이의 동시 발생 경향(꼬리 의존성)을 분석할 때 자주 활용됩니다. 또한 결합분포로부터 조건부분포를 유도하는 과정은 베이즈 정리의 기초가 되며, 그래프 모형(graphical model)에서는 변수 간 조건부 독립 구조를 결합분포의 인수분해로 표현하기도 합니다.
주의할 점
두 변수가 각각 정규분포를 따른다고 해서 결합분포도 자동으로 이변량 정규분포가 되는 것은 아니라는 점에 유의해야 한다.