확률질량함수와 확률밀도함수 (Probability Mass Function and Probability Density Function)

통계
한 줄 정의: 확률질량함수(PMF)는 셀 수 있는 값(이산형)이 각각 나올 확률을, 확률밀도함수(PDF)는 셀 수 없이 연속적인 값(연속형)의 확률을 구간 넓이로 나타내는 함수입니다.

쉽게 풀면

주사위 눈금처럼 나올 수 있는 값이 1, 2, 3, 4, 5, 6으로 딱 떨어지는 경우를 이산확률변수라고 합니다. 이때 "3이 나올 확률은 1/6이다"처럼 각 값에 직접 확률을 대응시키는 함수가 확률질량함수(PMF)입니다. 반면 사람의 키처럼 170.1cm, 170.15cm처럼 값이 끊임없이 이어지는 경우를 연속확률변수라고 합니다. 연속형에서는 "정확히 170.152...cm일 확률"이 사실상 0이기 때문에 특정 값 하나의 확률을 묻는 게 의미가 없고, 대신 "170cm에서 175cm 사이일 확률"처럼 구간의 확률을 그래프 아래 넓이로 계산합니다. 이 넓이를 계산해주는 함수가 확률밀도함수(PDF)입니다. 즉 PMF는 "값 하나하나에 붙는 확률표"이고, PDF는 "구간의 넓이로 확률을 재는 곡선"이라고 이해하면 됩니다.

왜 중요한가

변수가 이산형인지 연속형인지에 따라 사용할 확률함수와 그에 따른 추정·검정 방법 전체가 달라지기 때문에, 데이터의 성격을 정확히 구분하는 것은 통계 분석의 첫 단계입니다. 설문조사의 응답 범주, 실험 시행 횟수 등 이산형 데이터는 PMF 기반 모형(이항분포, 포아송분포 등)으로, 반응시간이나 측정값 같은 연속형 데이터는 PDF 기반 모형(정규분포 등)으로 분석하는 관행이 여러 분야 논문에서 공통적으로 나타납니다.

논문에서는 이렇게 쓰입니다

"응답 범주는 이산확률변수로 간주하여 확률질량함수를 이용해 각 범주의 발생확률을 산출한 반면, 반응시간 변수는 연속확률변수로 보아 정규분포의 확률밀도함수를 적합하였다."

논문에서 변수의 성격(이산형/연속형)을 밝히고 그에 맞는 확률함수(PMF 또는 PDF)를 지정하는 것은 이후 통계 모형을 세우는 데 필요한 전제 조건입니다.

"유전자 발현 횟수 데이터는 포아송분포의 확률질량함수로 모델링하였으며, 과산포가 관찰된 경우 음이항분포를 대안으로 고려하였다."

생물정보학의 카운트 데이터 분석에서는 이산형 변수에 대해 어떤 확률질량함수를 가정하느냐에 따라 결과 해석이 달라지므로, 분포 가정의 적절성을 함께 검토하는 경우가 많습니다.

조금 더 깊게 보면

PMF와 PDF를 통합적으로 다루기 위해 확률측도 관점에서 정의되는 확률질량·밀도함수, 또는 이 둘을 아우르는 일반화된 개념으로 라돈-니코딤 도함수가 언급되기도 합니다. 실제 데이터가 이산형과 연속형이 섞인 경우(예: 검사 결과가 0인 값이 많고 나머지는 연속적으로 분포)에는 혼합분포 모형을 세워 PMF와 PDF를 함께 사용하기도 합니다.

주의할 점

PDF의 값 자체는 확률이 아닙니다. 확률밀도함수는 특정 지점에서의 "밀도"를 나타낼 뿐이며, 실제 확률은 그 함수를 특정 구간에서 적분한(넓이를 구한) 값입니다. 그래서 PDF 값이 1보다 커도 이상한 것이 아닙니다. 대표적인 이산형 확률분포로는 이항분포포아송분포가, 대표적인 연속형 확률분포로는 정규분포가 있습니다.

관련 용어