기계번역 품질추정 (quality estimation (QE) for machine translation)
한 줄 정의: 정답 번역(참조 번역) 없이 기계번역 결과의 품질을 자동으로 예측하는 기술입니다.
쉽게 풀면
BLEU 같은 지표는 사람이 만든 정답 번역과 비교해야만 점수를 낼 수 있습니다. 하지만 실제로 번역기를 쓰는 순간에는 정답이 없죠. 품질추정은 원문과 번역문만 보고 '이 문장은 믿을 만하다/고쳐야 한다'를 예측합니다.
왜 중요한가
실무에서는 품질추정 점수로 어떤 문장을 그대로 내보내고 어떤 문장을 사람에게 보낼지 자동으로 분류할 수 있어 사후편집 비용을 줄이는 데 쓰입니다. 연구에서는 참조 번역이 없는 대량의 데이터를 걸러 학습 자료를 정제하거나, 평가 지표 자체를 참조 없이 설계하는 방향으로 확장되고 있습니다.
논문에서는 이렇게 쓰입니다
"품질추정 점수가 임계값 이상인 문장은 사후편집 없이 게시하도록 한 결과, 사후편집 대상 문장이 38% 감소하였다."
품질추정을 작업 분배 기준으로 활용한 실무 연구의 결과 서술입니다.
조금 더 깊게 보면
품질추정은 문장 단위 점수 예측뿐 아니라 단어 단위로 어느 부분이 틀렸는지 표시하거나 문서 전체 품질을 예측하는 수준으로도 나뉩니다. 학습 목표로는 사람이 매긴 품질 점수나 사후편집에서 계산한 HTER 같은 값을 사용합니다. 기계번역 학술 대회인 WMT에서 2012년 무렵부터 공유과제로 다뤄지며 발전했고, 최근에는 사전학습된 다국어 언어모델을 바탕으로 한 모델이 주류가 되었습니다. 원문과 번역문만으로 판단하므로, 유창하지만 원문과 뜻이 다른 번역을 잡아내는 것이 여전히 어려운 과제입니다.
주의할 점
기계번역 평가 일반, 특히 참조 번역과 비교하는 BLEU·TER 방식과는 참조가 필요 없다는 점에서 구별됩니다. 품질추정 점수는 예측값이므로 사람의 품질 판정을 대신하는 확정적 판단으로 쓰면 안 됩니다.