N-그램 모형 (N-gram Model)
쉽게 풀면
N-그램 모형은 바로 앞에 나온 몇 개의 단어만 보고 다음에 어떤 단어가 나올 확률이 높은지를 통계적으로 계산하는 간단한 언어 모형입니다. 예를 들어 '오늘 날씨가'라는 두 단어 다음에 어떤 단어가 자주 등장하는지를 대량의 텍스트에서 세어보고, 그 확률이 가장 높은 단어를 다음 단어로 예측하는 방식입니다. 이는 최신 인공신경망 언어모델이 등장하기 전까지 자연어처리 분야에서 널리 쓰인 기본적인 통계적 접근입니다.
왜 중요한가
N-그램 모형은 통계적 언어처리의 기초 개념으로, 이후 등장한 신경망 기반 언어모델의 성능을 비교·평가하는 베이스라인으로 널리 쓰입니다. 또한 음성인식, 기계번역, 오타 교정, 정보검색 등 다양한 응용 분야에서 지금도 간단하고 해석 가능한 확률 모형으로 활용되며, 언어모델의 발전 과정을 설명할 때 빠지지 않는 개념입니다.
논문에서는 이렇게 쓰입니다
전산언어학 논문에서 통계적 언어모델의 기본 개념을 소개하거나 비교 기준으로 사용할 때 등장한다.
음성인식 논문에서 N-그램 모형을 실제 시스템의 한 구성요소로 사용하며 관련 기술적 보완책을 함께 설명할 때 등장한다.
자연어처리 응용 논문에서 단어가 아닌 문자 단위 N-그램을 활용하는 사례를 설명할 때 등장한다.
조금 더 깊게 보면
N-그램 모형에서 N값이 커질수록 더 넓은 문맥을 반영할 수 있지만, 학습 데이터에서 관측되지 않은 조합이 늘어나는 데이터 희소성 문제가 심해집니다. 이를 보완하기 위해 라플라스 평활화, 카츠 백오프, 크네저-네이 평활화 등 다양한 평활화(smoothing) 기법이 함께 사용됩니다. 모형의 성능은 흔히 퍼플렉서티(perplexity)라는 지표로 평가하며, 값이 낮을수록 예측력이 좋다고 해석합니다.
주의할 점
N-그램 모형은 정해진 개수의 앞 단어만 고려하기 때문에, 그보다 먼 거리에 있는 문맥 정보는 반영하지 못한다는 근본적 한계가 있다.