COMET (COMET)
한 줄 정의: 원문·기계번역문·참조번역을 신경망 모델에 넣어 사람의 품질 판단을 예측하는 기계번역 자동평가 지표입니다.
쉽게 풀면
COMET은 기계번역 결과가 얼마나 좋은지를 사람 평가와 비슷하게 점수로 매기는 도구입니다. 단어가 참조번역과 똑같이 겹치는지만 세는 BLEU와 달리, 사전학습 언어모델로 문장의 의미를 비교합니다. 그래서 표현이 달라도 뜻이 맞으면 높은 점수를 줄 수 있습니다.
왜 중요한가
COMET은 사람 평가와의 상관이 BLEU보다 높다는 결과가 반복 보고되면서 기계번역 연구와 공유과제에서 사실상 표준 지표로 자리 잡았습니다. 최근 논문들은 BLEU와 COMET을 함께 보고하는 경우가 많습니다.
논문에서는 이렇게 쓰입니다
""제안 모델은 기준 모델과 BLEU 점수는 비슷했지만 COMET 점수가 유의하게 높아, 의미 보존 측면에서 개선되었음을 시사한다.""
표면 일치 지표와 학습 기반 지표가 서로 다른 결과를 보일 때의 해석 방식을 보여 줍니다.
조금 더 깊게 보면
COMET은 2020년 레이(Rei) 등이 Unbabel에서 발표했으며, 다국어 사전학습 인코더 위에 사람 품질 점수를 예측하도록 학습시킨 구조입니다. 참조번역 없이 원문과 번역문만으로 점수를 내는 품질추정용 변형도 있습니다. 점수의 절대값은 모델 버전마다 척도가 달라 버전을 함께 밝혀야 합니다. 학습에 쓰인 언어쌍·영역에서 벗어나면 신뢰도가 떨어질 수 있다는 지적도 있습니다.
주의할 점
BLEU는 n-그램 일치를 세는 규칙 기반 지표이고 COMET은 학습된 신경망이 품질을 예측하는 지표라 점수 척도와 해석이 전혀 다릅니다. COMET 점수는 서로 다른 버전끼리 직접 비교하면 안 됩니다.