복권 가설 (lottery ticket hypothesis)

컴퓨터과학·AI
한 줄 정의: 큰 신경망 안에는 혼자서도 같은 성능을 내는 작은 부분망이 숨어 있다는 가설입니다.

쉽게 풀면

무작위로 초기화된 커다란 신경망을 복권 뭉치에 비유한 가설입니다. 그 안에는 처음부터 운 좋게 좋은 초깃값을 받은 작은 연결망, 즉 당첨 복권이 들어 있고, 그 부분만 따로 떼어 같은 초깃값으로 다시 학습시키면 원래 모델에 버금가는 성능이 나온다는 주장입니다. 큰 모델이 필요한 이유는 표현력 때문이 아니라 당첨 복권을 많이 사기 위해서라는 해석을 낳았습니다.

왜 중요한가

모델 경량화 연구의 방향을 크게 바꾼 가설입니다. 학습이 끝난 뒤 가지치기하는 기존 방식과 달리, 학습 이전에도 유망한 부분망이 사실상 정해져 있을 수 있다는 가능성을 제기했기 때문입니다. 신경망의 학습 동역학과 초기화의 역할을 이해하려는 이론 연구에서도 자주 인용됩니다.

논문에서는 이렇게 쓰입니다

"반복적 크기 기반 가지치기로 찾은 부분망을 원래 초깃값으로 되돌려 재학습하자 원 모델과 대등한 정확도가 회복되었다."

복권 가설이 제시한 절차를 그대로 따라 작은 부분망만으로 같은 성능을 얻었다는 실험 결과입니다.

조금 더 깊게 보면

2019년 프랭클과 카빈이 제안했으며, 표준 절차는 학습 후 가중치 크기가 작은 연결을 제거하고 남은 연결을 원래 초깃값으로 되감아 재학습하는 반복적 가지치기입니다. 대규모 모델에서는 초기화 시점이 아니라 학습 초반 몇 번의 갱신 이후 시점으로 되감는 편이 안정적이라는 되감기(rewinding) 변형이 제시되었습니다. 찾아낸 당첨 복권이 서로 다른 데이터셋이나 과제 사이에서 전이되는지에 대한 연구도 활발합니다.

주의할 점

당첨 복권을 찾으려면 어차피 큰 모델을 한 번 학습해야 하므로, 학습 비용 자체가 줄어드는 것은 아닙니다. 모델 프루닝이 압축 기법 자체를 가리킨다면 복권 가설은 그 기법이 통하는 이유에 대한 설명 가설이라는 점에서 층위가 다릅니다.

관련 용어