정보이론적 엔트로피 (Entropy (Information Theory))

통계
한 줄 정의: 어떤 확률분포가 내포한 불확실성 또는 무작위성의 정도를, 그 분포에서 나올 수 있는 결과들의 발생 확률을 이용해 수치화한 정보이론의 핵심 개념.

쉽게 풀면

항상 앞면만 나오는 동전은 결과가 이미 확실하므로 정보량(불확실성)이 0이지만, 앞뒤가 정확히 반반으로 나오는 공정한 동전은 결과를 예측하기 가장 어려워 불확실성(엔트로피)이 최대가 된다. 엔트로피는 이렇게 확률분포가 얼마나 '고르게 퍼져 있는지', 즉 결과를 예측하기가 얼마나 어려운지를 하나의 숫자로 요약한 값이다. 통계학에서는 모형 선택, 최대엔트로피 원리에 의한 분포 추정, 결정트리의 분할 기준 등 다양한 곳에서 이 개념이 활용된다.

왜 중요한가

정보이론적 엔트로피는 데이터나 신호에 실제로 담긴 정보량의 이론적 하한을 알려주기 때문에, 데이터 압축, 통신 채널 용량 산정, 머신러닝 모델의 손실 함수 설계 등 폭넓은 분야에서 핵심 도구로 쓰입니다. 통계학과 기계학습 논문에서는 분포 간의 차이를 비교하거나(쿨백-라이블러 발산), 모델이 예측하는 확률분포의 불확실성을 정량화하는 기준으로 자주 등장하기 때문에 이론과 응용 양쪽에서 빠지지 않고 다뤄집니다.

논문에서는 이렇게 쓰입니다

"각 분할 지점에서의 엔트로피 감소량을 기준으로 의사결정나무의 분기 변수를 선택하였다."

확률분포의 불확실성을 정량화하거나, 두 분포 사이의 정보량 차이를 논의하는 이론적 기반으로 사용된다.

"채널의 잡음 특성을 반영한 조건부 엔트로피를 계산하여 통신 채널의 최대 전송률을 추정하였다."

정보통신 분야에서 엔트로피가 채널을 통해 안전하게 전달할 수 있는 정보량의 이론적 한계를 계산하는 데 쓰이는 예시이다.

"언어 모델의 다음 토큰 예측 분포에 대한 엔트로피를 측정하여 생성 결과의 다양성을 평가하였다."

자연어처리 연구에서 모델 출력 분포의 엔트로피가 생성 결과의 확신도나 다양성을 가늠하는 지표로 활용됨을 보여준다.

조금 더 깊게 보면

정보이론적 엔트로피는 로그의 밑에 따라 단위가 달라지는데, 밑이 2이면 비트(bit) 단위가 되어 정보를 표현하는 데 필요한 최소 이진수 자릿수와 직결됩니다. 이 개념은 두 확률분포 사이의 거리를 재는 쿨백-라이블러 발산이나, 실제 분포와 모델 분포 사이의 불일치를 측정하는 교차엔트로피처럼 다양한 변형 지표로 확장되며, 이런 파생 지표들은 분류 모델의 손실 함수나 모델 간 비교에 폭넓게 활용됩니다. 또한 두 변수가 서로 얼마나 많은 정보를 공유하는지를 나타내는 상호정보량도 엔트로피를 바탕으로 정의되는 대표적인 개념입니다.

주의할 점

엔트로피는 분포의 '모양'에만 의존하는 척도이므로, 그 자체만으로는 분포가 어떤 값을 중심으로 있는지(위치)에 대한 정보는 전혀 알려주지 않는다.

관련 용어