스케일링 법칙 (scaling law)
한 줄 정의: 모델 크기·데이터 양·연산량이 커질수록 손실이 거듭제곱 꼴로 줄어든다는 경험적 관계입니다.
쉽게 풀면
모델을 키우면 성능이 얼마나 좋아지는지를 그래프로 그려 보니, 로그 축에서 거의 반듯한 직선이 나온다는 발견입니다. 덕분에 아직 만들어 보지 않은 훨씬 큰 모델의 성능도 작은 모델 몇 개의 실험만으로 꽤 정확히 예측할 수 있습니다. 반대로 주어진 예산에서 모델을 얼마나 키우고 데이터를 얼마나 모아야 최선인지도 계산할 수 있습니다.
왜 중요한가
거대 모델 개발이 막연한 도박이 아니라 예산 계획이 가능한 공학이 되게 만든 결과입니다. 정해진 연산 예산에서 파라미터 수와 학습 토큰 수의 최적 배분을 정하는 근거로 쓰이며, 실제로 이 분석이 모델 설계 관행을 크게 바꾸었습니다. 대규모 모델 논문의 서론에 거의 빠지지 않고 인용됩니다.
논문에서는 이렇게 쓰입니다
"스케일링 법칙에 따른 외삽 결과를 근거로 주어진 연산 예산에서의 최적 파라미터 수와 학습 토큰 수를 결정하였다."
작은 실험에서 얻은 추세선으로 큰 모델의 설계값을 미리 정했다는 뜻입니다.
조금 더 깊게 보면
카플란 등의 2020년 연구가 모델 크기·데이터·연산 각각에 대한 거듭제곱 관계를 제시했고, 2022년 친칠라 연구가 같은 연산 예산에서는 기존 관행보다 데이터를 훨씬 많이 쓰는 편이 낫다는 수정된 배분을 보였습니다. 관계식은 대체로 되돌릴 수 없는 오차를 뜻하는 상수항에 거듭제곱 항이 더해진 형태로 적합됩니다. 다만 이 곡선은 사전학습 손실에 대한 것이므로 실제 과제 성능으로의 번역은 단순하지 않습니다.
주의할 점
경험적 적합식이지 물리 법칙이 아니며, 데이터 품질이나 구조가 바뀌면 계수와 지수가 달라집니다. 이중 하강이 모델 크기에 따른 오차의 비단조적 봉우리를 다루는 반면, 스케일링 법칙은 충분히 큰 영역에서의 매끄러운 추세를 기술합니다.