이중언어 텍스트 정렬 (bilingual text alignment)

통번역학
한 줄 정의: 원문과 번역문을 문장·구·단어 단위로 서로 대응하는 부분끼리 짝지어 연결하는 작업입니다.

쉽게 풀면

원문 한 편과 번역문 한 편이 따로 있으면, 어느 문장이 어느 문장의 번역인지 컴퓨터는 알지 못합니다. 정렬은 이 두 텍스트를 나란히 놓고 '원문 3번 문장 = 번역문 3번과 4번 문장'처럼 짝을 맞춰 주는 과정입니다. 이렇게 짝지어진 자료가 있어야 번역메모리병렬말뭉치로 쓸 수 있습니다.

왜 중요한가

정렬은 과거 번역 자산을 번역메모리로 되살리는 실무 작업이자, 병렬말뭉치 기반 번역 연구와 통계·신경망 기계번역 학습 데이터 구축의 첫 단계입니다. 정렬 오류는 뒤이은 모든 분석과 학습에 그대로 전파되므로, 논문에서는 정렬 방법과 수작업 검수 비율을 방법론에 밝히는 것이 일반적입니다.

논문에서는 이렇게 쓰입니다

"수집한 한일 법령 병렬 텍스트는 길이 기반 알고리즘으로 문장 정렬한 뒤, 무작위 추출한 5%를 두 연구자가 수작업으로 검수하였다."

병렬 코퍼스 구축 절차에서 정렬과 품질 확인을 어떻게 했는지 밝히는 방법론 문장입니다.

조금 더 깊게 보면

초기의 대표적 방법인 게일(Gale)과 처치(Church)의 1993년 알고리즘은 '서로 번역인 문장은 길이도 비슷하다'는 가정만으로 문장을 짝지었습니다. 이후 사전이나 기계번역 결과를 함께 활용하는 방법, 다국어 문장 임베딩의 의미 유사도로 짝을 찾는 방법이 등장해 정확도가 높아졌습니다. 번역에서는 한 문장을 둘로 나누거나 둘을 합치는 일이 흔하므로 1:1 외에 1:2, 2:1 대응과 대응 없음(생략·첨가)을 처리하는 것이 핵심 난제입니다. 단어 단위 정렬은 통계적 기계번역에서 번역 확률을 추정하는 데 중심 역할을 했습니다.

주의할 점

디자인 분야의 '텍스트 정렬'(글자를 왼쪽·가운데로 맞추는 조판 기능)과는 전혀 다른 개념입니다. 정렬은 대응 관계를 찾는 전처리일 뿐 그 자체로 번역 품질을 평가하지는 않습니다.

관련 용어