도메인 적응 (domain adaptation)
한 줄 정의: 과제는 같지만 데이터 분포가 다른 새 환경(타깃 도메인)에서도 모델이 잘 작동하도록 맞추는 기법이에요.
쉽게 풀면
맑은 날 찍은 사진으로 학습한 자율주행 인식 모델은 비 오는 밤 영상에서 성능이 떨어질 수 있어요. 해야 할 일은 같은데 들어오는 데이터의 모습이 달라졌기 때문이에요. 도메인 적응은 이런 차이를 줄여 기존 모델이 새 환경에서도 잘 작동하게 만드는 방법이에요.
왜 중요한가
실제 현장 데이터는 학습 데이터와 다른 경우가 많아 의료영상, 자율주행, 자연어처리에서 중요한 연구 분야예요. 특히 타깃 도메인에 정답 라벨이 없는 상황을 다루는 연구가 많아요.
논문에서는 이렇게 쓰입니다
"합성 데이터로 학습한 분할 모델에 비지도 도메인 적응을 적용하여 실제 도로 영상에서의 mIoU를 12%p 향상시켰다."
라벨 없는 타깃 도메인으로 성능을 끌어올린 전형적인 결과 문장이에요.
조금 더 깊게 보면
소스 도메인에는 라벨이 충분하고 타깃 도메인에는 라벨이 없거나 적은 상황을 주로 다뤄요. 대표 방법으로 두 도메인의 특징 분포 거리를 줄이는 방법(MMD 등), 도메인 판별기를 속이도록 학습하는 적대적 방법(DANN), 타깃 데이터에 가짜 라벨을 붙여 자기 학습하는 방법이 있어요. Ben-David 등의 이론은 타깃 오차가 소스 오차와 도메인 간 차이에 의해 제한된다고 설명해요. 학습 때 타깃 데이터를 전혀 볼 수 없으면 도메인 일반화라고 따로 불러요.
주의할 점
전이학습은 한 과제나 데이터에서 얻은 지식을 다른 곳에 활용하는 넓은 개념이고, 도메인 적응은 그중 과제는 같고 입력 분포만 달라진 경우에 특화된 하위 분야예요. 라벨이 있는 타깃 데이터로 단순히 파인튜닝하는 것과도 구분해서 써요.