ROUGE 점수 (ROUGE score)
쉽게 풀면
자동 요약이 잘 됐는지 사람이 일일이 읽어 판단하기는 어려우니, 사람이 만든 모범 요약과 단어가 얼마나 겹치는지로 대신 잽니다. 참조 요약에 있는 내용 중 몇 퍼센트를 모델 요약이 담아냈는지를 보기 때문에 재현율 중심입니다. 연속된 두 단어 묶음이 겹치는 정도나 가장 긴 공통 부분수열의 길이를 세는 변형이 함께 보고됩니다.
왜 중요한가
자동 요약 연구에서 20년 넘게 표준으로 쓰여 온 지표라 논문 간 비교의 공통 기준 역할을 합니다. 계산이 빠르고 재현 가능해서 모델 개발 중 반복 평가에 적합합니다. 최근 생성 모델 논문에서도 사람 평가나 모델 기반 평가와 나란히 보고되는 것이 관례입니다.
논문에서는 이렇게 쓰입니다
단어 단위, 두 단어 묶음 단위, 가장 긴 공통 부분수열 기준 모두에서 점수가 올랐다는 보고입니다.
조금 더 깊게 보면
ROUGE-N은 참조 요약의 n-그램 중 생성 요약에 등장한 비율이고, ROUGE-L은 최장 공통 부분수열의 길이를 이용해 순서를 어느 정도 반영합니다. 실제 보고에서는 재현율뿐 아니라 정밀도를 합친 F 점수 형태를 쓰는 경우가 많고, 참조 요약이 여러 개면 최대값이나 평균을 취합니다. 어간 추출 여부, 불용어 제거 여부 같은 전처리 설정에 점수가 민감하므로 구현체와 설정을 명시하는 것이 권장됩니다.
주의할 점
BLEU 점수가 기계 번역에서 정밀도 중심으로 설계된 것과 달리 ROUGE는 요약 평가를 위해 재현율 중심으로 설계되었습니다. 표면적인 단어 겹침만 보기 때문에 같은 뜻을 다른 표현으로 쓴 좋은 요약을 낮게 평가하거나, 사실이 틀린 요약을 걸러내지 못한다는 한계가 분명합니다.