복권 가설 (lottery ticket hypothesis)
쉽게 풀면
무작위로 초기화된 커다란 신경망을 복권 뭉치에 비유한 가설입니다. 그 안에는 처음부터 운 좋게 좋은 초깃값을 받은 작은 연결망, 즉 당첨 복권이 들어 있고, 그 부분만 따로 떼어 같은 초깃값으로 다시 학습시키면 원래 모델에 버금가는 성능이 나온다는 주장입니다. 큰 모델이 필요한 이유는 표현력 때문이 아니라 당첨 복권을 많이 사기 위해서라는 해석을 낳았습니다.
왜 중요한가
모델 경량화 연구의 방향을 크게 바꾼 가설입니다. 학습이 끝난 뒤 가지치기하는 기존 방식과 달리, 학습 이전에도 유망한 부분망이 사실상 정해져 있을 수 있다는 가능성을 제기했기 때문입니다. 신경망의 학습 동역학과 초기화의 역할을 이해하려는 이론 연구에서도 자주 인용됩니다.
논문에서는 이렇게 쓰입니다
복권 가설이 제시한 절차를 그대로 따라 작은 부분망만으로 같은 성능을 얻었다는 실험 결과입니다.
조금 더 깊게 보면
2019년 프랭클과 카빈이 제안했으며, 표준 절차는 학습 후 가중치 크기가 작은 연결을 제거하고 남은 연결을 원래 초깃값으로 되감아 재학습하는 반복적 가지치기입니다. 대규모 모델에서는 초기화 시점이 아니라 학습 초반 몇 번의 갱신 이후 시점으로 되감는 편이 안정적이라는 되감기(rewinding) 변형이 제시되었습니다. 찾아낸 당첨 복권이 서로 다른 데이터셋이나 과제 사이에서 전이되는지에 대한 연구도 활발합니다.
주의할 점
당첨 복권을 찾으려면 어차피 큰 모델을 한 번 학습해야 하므로, 학습 비용 자체가 줄어드는 것은 아닙니다. 모델 프루닝이 압축 기법 자체를 가리킨다면 복권 가설은 그 기법이 통하는 이유에 대한 설명 가설이라는 점에서 층위가 다릅니다.