가중치 감쇠 (weight decay)

컴퓨터과학·AI
한 줄 정의: 학습할 때마다 모델의 가중치를 일정 비율씩 줄여 과적합을 막는 정규화 기법이에요.

쉽게 풀면

신경망의 가중치가 지나치게 커지면 훈련 데이터에만 딱 맞고 새 데이터에서는 성능이 떨어지기 쉬워요. 가중치 감쇠는 학습의 매 단계에서 가중치를 조금씩 0 쪽으로 줄여서 이런 과적합을 막아요. 거의 모든 딥러닝 학습 설정에 들어가는 기본 기법이에요.

왜 중요한가

대규모 모델 학습에서 가장 흔히 조정하는 하이퍼파라미터 중 하나라 논문의 실험 설정에 거의 항상 값이 적혀 있어요. 옵티마이저와 함께 성능을 좌우하는 요소로 연구돼요.

논문에서는 이렇게 쓰입니다

"모든 모델은 AdamW 옵티마이저로 학습하였으며 가중치 감쇠 계수는 0.01로 설정하였다."

실험 설정에서 가중치 감쇠 값을 보고한 전형적인 문장이에요.

조금 더 깊게 보면

일반 확률적 경사 하강법에서는 손실 함수에 가중치 제곱합(L2 벌점)을 더하는 것과 매 단계 가중치를 일정 비율 줄이는 것이 수학적으로 같아요. 하지만 Adam처럼 기울기 크기에 따라 학습률을 조절하는 옵티마이저에서는 두 방식의 결과가 달라져요. Loshchilov와 Hutter는 가중치 감쇠를 기울기 계산과 분리해 적용하는 AdamW를 제안했고, 이것이 오늘날 트랜스포머 학습의 표준이 되었어요. 편향과 정규화 층 파라미터에는 보통 감쇠를 적용하지 않아요.

주의할 점

정규화는 과적합을 줄이는 모든 방법을 아우르는 말이고, 가중치 감쇠는 그중 가중치를 직접 줄이는 구체적 기법이에요. "L2 정규화와 같다"는 설명은 SGD에서만 정확하다는 점에 주의해야 해요.

관련 용어