서프라이절 (Surprisal)

언어학
한 줄 정의: 앞 문맥이 주어졌을 때 다음 단어가 나올 확률의 음의 로그값으로, 예측하기 어려운 단어일수록 커지는 정보이론적 지표입니다.

쉽게 풀면

"나는 아침에 커피를 ___"에서 "마셨다"는 예측하기 쉬워 서프라이절이 낮고, "칠했다"는 뜻밖이라 서프라이절이 높습니다. 서프라이절 이론은 이렇게 예상 밖의 단어일수록 읽을 때 처리 부담이 커진다고 봅니다. 계산식은 −log P(단어 | 앞 문맥)입니다.

왜 중요한가

읽기 시간, 시선 고정 시간, N400 같은 뇌파 반응을 예측하는 변수로 심리언어학에서 널리 쓰입니다. 최근에는 대규모 언어 모델이 계산한 서프라이절이 인간 처리 부담을 얼마나 잘 예측하는지 비교하는 연구가 활발합니다.

논문에서는 이렇게 쓰입니다

"GPT-2로 추정한 단어별 서프라이절은 자기조절읽기 과제의 읽기 시간을 유의하게 예측하였다."

언어 모델 기반 서프라이절을 처리 지표와 연결한 전형적 서술입니다.

조금 더 깊게 보면

헤일(Hale, 2001)이 문장 처리 모형으로 제안했고, 레비(Levy, 2008)가 기대 기반 이해 이론으로 발전시켰습니다. 정보이론에서 한 사건의 자기 정보량(self-information)과 같은 개념이며, 로그 밑이 2이면 비트 단위가 됩니다. 서프라이절과 처리 시간이 선형 관계인지, 문맥 창 크기와 모델 종류에 따라 결과가 어떻게 달라지는지가 주요 쟁점입니다.

주의할 점

가장 가까운 기존 항목인 n-그램 모형은 확률을 추정하는 방법 중 하나이고, 서프라이절은 그렇게 추정된 확률로 계산한 처리 부담 지표라는 점이 다릅니다. 확률을 어떤 모델로 추정했는지에 따라 값이 크게 달라지므로 모델과 학습 자료를 명시해야 합니다.

관련 용어