보편 근사 정리 (universal approximation theorem)
쉽게 풀면
신경망이 왜 그렇게 다양한 문제를 풀 수 있는지에 대한 수학적 답입니다. 뉴런을 충분히 많이 두기만 하면, 층이 하나뿐인 신경망으로도 어떤 매끄러운 함수든 오차를 임의로 작게 만들 수 있다는 것이 증명되어 있습니다. 다만 이 정리는 그런 신경망이 존재한다는 사실만 알려줄 뿐, 그것을 어떻게 찾는지는 말해 주지 않습니다.
왜 중요한가
신경망이 임의의 입력-출력 관계를 표현할 수 있는 도구라는 점을 보장해 주므로, 모델 선택의 이론적 근거로 자주 인용됩니다. 동시에 표현력과 학습 가능성이 별개라는 점을 분명히 하여, 실제 성능이 구조·최적화·데이터에 달려 있다는 논의로 이어집니다. 깊은 신경망이 왜 얕은 신경망보다 유리한지를 다루는 후속 연구의 출발점이기도 합니다.
논문에서는 이렇게 쓰입니다
이론적으로 표현할 수 있다는 것과 실제로 학습해 낼 수 있다는 것은 다르다는 지적입니다.
조금 더 깊게 보면
1989년 시벤코가 시그모이드 활성화 함수에 대해, 호르닉 등이 더 일반적인 조건에서 증명했습니다. 핵심은 은닉 유닛의 개수에 제한을 두지 않는 대신 함수의 정의역을 유계 닫힌 영역으로 제한한다는 점입니다. 이후 층의 너비를 고정하고 깊이를 늘리는 형태의 정리도 제시되었으며, 같은 정확도를 얻는 데 필요한 유닛 수가 깊이에 따라 크게 줄어들 수 있다는 깊이 분리 결과가 심층 구조의 이점을 설명하는 데 쓰입니다.
주의할 점
이 정리는 필요한 뉴런 수에 아무 제한을 두지 않기 때문에, 현실적인 크기의 신경망이 항상 잘 근사한다는 뜻은 아닙니다. 활성화 함수가 선형이기만 하면 정리가 성립하지 않는다는 조건도 자주 빠뜨리는 부분입니다.