이중 하강 (double descent)
한 줄 정의: 모델을 키울수록 오차가 한 번 나빠졌다가 다시 좋아지는 현상입니다.
쉽게 풀면
고전적인 교과서는 모델이 커질수록 시험 오차가 U자 모양을 그린다고 가르칩니다. 그런데 파라미터 수가 데이터 수를 넘어설 만큼 계속 키우면, 최악의 지점을 지난 뒤 오차가 다시 떨어지기 시작합니다. 곡선이 아래로 두 번 내려가기 때문에 이중 하강이라고 부릅니다.
왜 중요한가
수억 개 파라미터를 가진 거대 모델이 과적합으로 망가지지 않고 오히려 잘 일반화되는 이유를 설명하려는 핵심 논의입니다. 고전 통계학습이론의 예측과 실제 심층학습 현장의 관찰이 어긋나는 지점을 정면으로 다루기 때문에, 현대 머신러닝 이론 논문에서 빈번하게 인용됩니다.
논문에서는 이렇게 쓰입니다
"모델 폭을 늘리자 보간 임계점 부근에서 검증 오차가 정점을 찍은 뒤 다시 감소하는 이중 하강 양상이 관찰되었다."
모델 크기를 계속 키웠더니 오차가 한 번 치솟았다가 다시 낮아지는 패턴이 나타났다는 뜻입니다.
조금 더 깊게 보면
오차가 정점을 찍는 지점은 대개 모델이 훈련 데이터를 정확히 통과시키기 시작하는 보간 임계점 근처입니다. 그 지점을 넘어서면 훈련 데이터를 완벽히 맞히는 해가 무수히 많아지고, 경사하강법이 그중 노름이 작은 매끄러운 해로 수렴하는 암묵적 정규화가 일반화를 돕는 것으로 설명됩니다. 모델 크기뿐 아니라 학습 시간이나 데이터 양을 축으로 삼아도 비슷한 봉우리가 나타나, 각각 에포크별·표본별 이중 하강으로 구분해 부릅니다.
주의할 점
모든 설정에서 항상 관찰되는 법칙이 아니라, 잡음 수준과 정규화 강도에 따라 봉우리가 사라지기도 합니다. 편향-분산 트레이드오프가 틀렸다는 뜻이 아니라, 파라미터가 데이터보다 많은 영역에서는 분산 항의 거동이 고전적 직관과 달라진다는 점을 보여 주는 현상입니다.