벤치마크 오염 (benchmark contamination)

컴퓨터과학·AI
한 줄 정의: 평가용 문제가 사전학습 데이터에 섞여 들어가 성능이 부풀려지는 문제입니다.

쉽게 풀면

모델을 인터넷 전체로 학습시키다 보면, 나중에 시험 문제로 쓸 데이터셋이 그 안에 이미 들어 있는 일이 생깁니다. 그러면 모델은 문제를 푸는 것이 아니라 답을 외워서 맞히는 셈이 되고, 발표된 점수는 실제 능력보다 높게 나옵니다. 시험지가 유출된 시험의 점수를 믿을 수 없는 것과 같습니다.

왜 중요한가

거대 모델들의 벤치마크 성적을 서로 비교하고 신뢰할 수 있는지를 좌우하는 문제입니다. 학습 데이터가 공개되지 않는 상용 모델에서는 오염 여부를 외부에서 확인할 방법이 사실상 없다는 점 때문에 재현성 논쟁의 핵심이 되었습니다. 최근에는 평가 데이터를 공개 후 일정 기간만 쓰거나, 학습 시점 이후에 만들어진 문제로 평가하는 관행이 확산되고 있습니다.

논문에서는 이렇게 쓰입니다

"학습 말뭉치와 평가셋 간 n-그램 중복을 검사한 결과 일부 문항에서 벤치마크 오염이 확인되어 해당 항목을 제외하고 재평가하였다."

시험 문제가 학습 자료에 들어 있었는지 확인해 겹치는 문항을 빼고 다시 점수를 냈다는 뜻입니다.

조금 더 깊게 보면

탐지 방법으로는 학습 말뭉치와 평가 문항의 긴 n-그램 중복을 직접 대조하는 방식, 문항의 로그 확률이 비정상적으로 높은지를 보는 방식, 보기 순서를 섞었을 때 정확도가 크게 떨어지는지를 확인하는 방식 등이 쓰입니다. 정답까지 함께 학습된 경우와 문제 본문만 노출된 경우의 영향이 다르므로 구분해 보고해야 합니다. 대응책으로는 평가셋을 비공개로 유지하거나, 정기적으로 새 문항으로 교체하는 살아 있는 벤치마크 방식이 제안됩니다.

주의할 점

데이터 누수는 일반적인 머신러닝 실험에서 검증·시험 데이터의 정보가 학습에 새어 드는 문제 전반을 가리키는 상위 개념이고, 벤치마크 오염은 그중 사전학습 말뭉치에 공개 평가셋이 포함되는 특수한 상황을 가리킵니다. 오염이 없다는 증명은 학습 데이터가 공개되어야만 가능하다는 점도 유의해야 합니다.

관련 용어