퍼지매치 (fuzzy match)

통번역학
한 줄 정의: 번역메모리에서 현재 문장과 완전히 같지는 않지만 비슷한 과거 번역 문장을 찾아 제시하는 기능입니다.

쉽게 풀면

번역가가 예전에 번역한 문장들은 번역메모리에 쌓입니다. 새 문장이 예전 문장과 글자 몇 개만 다르다면, 프로그램이 '85% 일치'처럼 유사도를 표시하며 옛 번역을 보여 줍니다. 번역가는 그 번역을 처음부터 새로 쓰지 않고 다른 부분만 고치면 됩니다.

왜 중요한가

퍼지매치 비율은 번역 산업에서 작업량과 단가를 계산하는 기준으로 쓰여, 일치율 구간별로 할인율을 정하는 관행이 널리 퍼져 있습니다. 연구에서는 일치율이 번역 속도·품질·번역가의 인지 부담에 어떤 영향을 주는지, 그리고 퍼지매치 수정과 기계번역 사후편집 중 무엇이 더 효율적인지를 비교하는 주제로 자주 다뤄집니다.

논문에서는 이렇게 쓰입니다

"85~94% 구간의 퍼지매치를 수정할 때의 처리 속도는 같은 문장을 신경망 기계번역 출력으로 사후편집할 때와 통계적으로 차이가 없었다."

번역메모리 재활용과 기계번역 활용의 생산성을 비교한 결과를 서술합니다.

조금 더 깊게 보면

유사도는 대개 문자나 단어 단위의 편집거리(얼마나 고쳐야 같아지는지)를 바탕으로 계산하지만, 구체적인 알고리즘은 도구마다 달라 같은 문장 쌍이라도 도구에 따라 일치율이 다르게 나옵니다. 업계에서는 대체로 70~75% 안팎을 최소 임계값으로 두고 그 아래는 '일치 없음'으로 처리합니다. 앞뒤 문맥까지 같은 경우는 100% 일치보다 한 단계 높은 문맥 일치로 따로 구분하기도 합니다. 일치율이 높아도 숫자·부정어처럼 작은 차이가 의미를 크게 바꿀 수 있어 검토가 반드시 필요합니다.

주의할 점

퍼지매치는 사람이 과거에 번역한 문장을 재활용하는 것이지 새 번역을 생성하는 기계번역이 아닙니다. 또 일치율은 표면 형태의 유사도일 뿐 의미의 유사도를 보장하지 않습니다.

관련 용어