준지도학습 (semi-supervised learning)

컴퓨터과학·AI
한 줄 정의: 소량의 라벨 데이터와 대량의 라벨 없는 데이터를 함께 써서 모델을 학습시키는 방법입니다.

쉽게 풀면

정답이 붙은 데이터를 만드는 일은 비싸지만, 정답 없는 데이터는 흔히 넘쳐납니다. 준지도학습은 적은 정답 데이터로 대략의 방향을 잡은 뒤, 정답 없는 데이터가 알려 주는 데이터 분포의 모양을 함께 이용해 경계를 다듬습니다. 비슷한 입력에는 비슷한 예측이 나와야 한다는 가정이 그 바탕입니다.

왜 중요한가

의료 영상이나 전문 문서처럼 라벨링에 전문가가 필요한 분야에서 비용을 크게 줄여 줍니다. 라벨이 수백 개뿐이어도 라벨 없는 데이터 수만 건을 함께 쓰면 완전 지도학습에 근접하는 성능이 보고되면서 실용적 대안으로 자리 잡았습니다. 라벨 부족 상황을 다루는 논문에서 기본 비교군으로 등장합니다.

논문에서는 이렇게 쓰입니다

"라벨 100장만 사용한 준지도학습 모델이 전체 라벨을 사용한 지도학습 모델 대비 94% 수준의 정확도를 달성하였다."

정답이 붙은 데이터를 극히 조금만 쓰고도 전부 쓴 경우와 비슷한 성능이 나왔다는 결과 보고입니다.

조금 더 깊게 보면

대표적 전략으로는 모델이 스스로 붙인 확신 높은 예측을 임시 정답으로 삼는 의사 라벨링, 같은 입력에 서로 다른 변형을 가해도 예측이 일관되도록 벌점을 주는 일관성 정규화, 그리고 결정 경계가 데이터가 희박한 영역을 지나야 한다는 저밀도 분리 가정이 있습니다. 최근 방식들은 강한 데이터증강과 일관성 정규화를 결합해 성능을 끌어올립니다. 라벨 없는 데이터의 분포가 라벨 데이터와 다르면 오히려 성능이 떨어질 수 있다는 점도 확인되어 있습니다.

주의할 점

자기지도학습은 라벨을 전혀 쓰지 않고 데이터 자체에서 과제를 만들어 표현을 학습하는 사전학습 단계인 반면, 준지도학습은 소량의 진짜 라벨을 목표 과제에 직접 함께 사용합니다. 의사 라벨의 오류가 누적되는 확증 편향 문제도 주의해야 합니다.

관련 용어