지프 법칙 (Zipf's Law)

문헌정보학
한 줄 정의: 텍스트에서 단어의 출현 빈도가 그 빈도 순위에 대략 반비례한다는 경험 법칙입니다.

쉽게 풀면

책 한 권의 단어를 많이 나온 순서로 줄 세우면, 1등 단어는 2등보다 약 두 배, 3등보다 약 세 배 자주 나옵니다. 즉 순위와 빈도를 곱하면 거의 일정한 값이 됩니다. 이것을 지프 법칙이라고 합니다.

왜 중요한가

정보검색에서 너무 자주 나오는 단어는 불용어로 빼고, 너무 드문 단어는 색인 가치가 낮다고 보는 판단의 이론적 근거가 됩니다. 계량서지학에서는 브래드포드·로트카 법칙과 함께 3대 법칙으로 다룹니다.

논문에서는 이렇게 쓰입니다

"코퍼스의 순위-빈도 분포를 로그 척도로 그리자 기울기 약 -1의 직선에 가까워 지프 법칙을 따르는 것으로 확인되었다."

양쪽 축에 로그를 씌우면 반비례 관계가 기울기 -1 직선으로 보인다는 점을 이용한 확인입니다.

조금 더 깊게 보면

미국 언어학자 조지 킹슬리 지프가 1930~40년대에 널리 알렸습니다. 순위 r인 단어의 빈도가 1/r에 비례한다는 형태이며, 실제로는 지수가 1 근처에서 조금씩 달라집니다. 같은 모양의 분포가 도시 인구, 웹 방문 수 등에서도 나타나 멱법칙 분포의 대표 예로 꼽힙니다. 룬(Luhn)은 이를 바탕으로 중간 빈도 단어가 주제를 잘 나타낸다는 자동색인 아이디어를 제시했습니다.

주의할 점

불용어는 지프 법칙을 활용한 실무 결과물 가운데 하나이지 법칙 자체가 아닙니다. 순위 상하위 극단에서는 법칙에서 벗어나는 경우가 흔하므로 전 구간에 딱 맞는다고 쓰면 안 됩니다.

관련 용어