레이블 스무딩 (label smoothing)

컴퓨터과학·AI
한 줄 정의: 정답 라벨의 확률을 1 대신 조금 낮춰 모델의 과신을 막는 정규화 기법입니다.

쉽게 풀면

보통 분류 학습에서는 정답 클래스에 1, 나머지에 0을 줍니다. 그러면 모델은 정답 쪽 확률을 무한히 1에 가깝게 밀어붙이려 하면서 지나치게 확신하는 습관이 듭니다. 레이블 스무딩은 정답에 0.9, 나머지 클래스들에 나눠서 0.1 같은 식으로 약간의 여지를 남겨 둡니다.

왜 중요한가

간단한 한 줄 수정만으로 일반화 성능과 확률값의 신뢰성을 함께 개선할 수 있어 영상 인식과 기계 번역의 표준 설정으로 자리 잡았습니다. 라벨에 잡음이 섞인 데이터에서 모델이 잘못된 정답을 통째로 외우는 것을 완화하는 효과도 있습니다. 대규모 모델 학습 설정을 기술하는 논문의 실험 절에서 흔히 언급됩니다.

논문에서는 이렇게 쓰입니다

"레이블 스무딩 계수 0.1을 적용하자 검증 정확도가 0.6%p 상승하고 기대 보정 오차도 함께 감소하였다."

정답 라벨에 약간의 여유를 주었더니 성능과 확률값 신뢰성이 모두 좋아졌다는 결과입니다.

조금 더 깊게 보면

목표 분포를 원-핫 벡터와 균등 분포의 가중 평균으로 바꾸는 것과 같으며, 이는 교차엔트로피 손실에 균등 분포로의 KL 항을 더한 형태로 해석됩니다. 로짓이 무한대로 발산하지 않게 억제하므로 학습이 안정되고 표현 공간에서 같은 클래스의 표본들이 더 조밀한 군집을 이루는 경향이 보고되었습니다. 다만 이 조밀화가 클래스 간 미세한 차이 정보를 지워 지식증류의 교사 모델로 쓸 때는 성능이 떨어질 수 있다는 점도 알려져 있습니다.

주의할 점

드롭아웃이나 정규화가 모델의 가중치나 활성값에 개입하는 것과 달리, 레이블 스무딩은 학습 목표값 자체를 바꾼다는 점이 다릅니다. 계수를 과하게 키우면 클래스 간 구분 신호가 흐려져 오히려 성능이 떨어집니다.

관련 용어