활성화 함수 (Activation Function)

컴퓨터과학·AI
한 줄 정의: 인공신경망의 각 뉴런에 들어온 입력값의 합을 특정 규칙에 따라 비선형적으로 변환하여 다음 층으로 전달하는 함수입니다.

쉽게 풀면

신경망의 뉴런 하나하나를 "이 정도 신호가 들어오면 반응할지 말지"를 결정하는 스위치라고 생각해봅시다. 활성화 함수는 이 스위치가 켜지는 정도를 계산하는 규칙입니다. 예를 들어 ReLU라는 함수는 "입력이 0보다 크면 그대로 통과시키고, 0 이하면 아예 반응하지 않는다"는 단순한 규칙을 씁니다. 만약 이런 함수가 없다면 아무리 신경망 층을 여러 겹 쌓아도 결국 하나의 직선(선형 변환)을 여러 번 반복한 것과 다르지 않아서, 복잡한 곡선 형태의 패턴을 전혀 학습할 수 없습니다. 활성화 함수가 비선형성을 더해주기 때문에 신경망이 이미지나 언어 같은 복잡한 데이터의 패턴을 표현할 수 있는 것입니다.

왜 중요한가

활성화 함수는 신경망이 단순한 선형 모델을 넘어서 복잡한 패턴을 표현할 수 있게 해주는 핵심 장치이기 때문에, 새로운 모델 구조나 학습 기법을 제안하는 논문에서는 거의 예외 없이 어떤 활성화 함수를 썼는지 명시합니다. 또한 활성화 함수의 선택은 학습 속도, 기울기 소실 여부, 최종 성능에 직접 영향을 미치기 때문에 컴퓨터 비전, 자연어처리, 강화학습 등 딥러닝을 다루는 거의 모든 하위 분야의 연구와 맞닿아 있습니다. 최근에는 GELU, Swish처럼 기존 함수를 개선한 변형들이 대형 언어모델이나 트랜스포머 구조의 성능 향상에 기여했다고 보고되면서, 활성화 함수 자체를 설계·비교하는 연구도 꾸준히 이어지고 있습니다.

논문에서는 이렇게 쓰입니다

"은닉층의 활성화 함수로 ReLU를 사용하여 학습 속도와 수렴 안정성을 개선하였다."

이 문장은 딥러닝 모델 구조를 설명하는 방법론 부분에서 자주 등장합니다. 활성화 함수의 종류(ReLU, 시그모이드, 하이퍼볼릭 탄젠트 등)는 모델의 학습 속도, 안정성, 표현력에 직접적인 영향을 주기 때문에 대부분의 딥러닝 논문에서 명시적으로 밝히는 설계 요소입니다.

"트랜스포머 기반 언어모델의 피드포워드 층에서 ReLU 대신 GELU 활성화 함수를 적용하여 성능이 소폭 향상되었다."

자연어처리 분야의 논문에서는 대형 언어모델의 세부 구조를 설명할 때 활성화 함수의 변형을 비교하는 경우가 많습니다. GELU나 Swish처럼 입력값을 부드럽게 반영하는 함수들은 ReLU보다 안정적인 학습을 돕는다고 보고되어, 최신 언어모델 구조에서 자주 채택됩니다.

"합성곱 신경망의 각 층 뒤에 활성화 함수를 배치하여 비선형성을 확보하고, 배치 정규화와 함께 사용하여 학습을 안정화하였다."

컴퓨터 비전 분야의 논문에서는 합성곱 층과 활성화 함수, 정규화 기법을 조합해 모델 구조를 설명하는 문장이 흔히 등장합니다. 활성화 함수가 각 층 사이에 배치되는 방식은 이미지 인식 모델의 표현력과 학습 안정성을 좌우하는 요소로 다뤄집니다.

조금 더 깊게 보면

활성화 함수를 더 깊이 이해하려면 함수의 미분값, 즉 기울기(gradient)가 어떤 모양을 갖는지를 살펴보는 것이 중요합니다. 시그모이드나 하이퍼볼릭 탄젠트처럼 출력값이 일정 범위로 눌리는(saturating) 함수는 입력이 극단적인 값일 때 기울기가 거의 0에 가까워져 학습이 느려지는 반면, ReLU 계열은 양수 구간에서 기울기가 일정하게 유지되어 이 문제를 완화합니다. 다만 ReLU도 입력이 음수인 구간에서는 기울기가 완전히 0이 되어 뉴런이 아예 학습에 관여하지 않게 되는 현상(죽은 렐루, dying ReLU)이 나타날 수 있는데, Leaky ReLU나 GELU, Swish 같은 변형들은 음수 구간에서도 완만한 기울기를 남겨 이 문제를 줄이려는 시도로 볼 수 있습니다. 논문을 읽을 때는 저자가 어떤 활성화 함수를 왜 선택했는지, 그리고 그 선택이 기울기 흐름이나 수렴 속도와 어떻게 연결되는지를 함께 살펴보면 설계 의도를 더 잘 파악할 수 있습니다.

주의할 점

모든 활성화 함수가 동등하게 잘 작동하는 것은 아닙니다. 시그모이드처럼 입력값이 커지거나 작아질수록 기울기가 거의 0에 가까워지는 함수는 층이 깊어질 때 기울기 소실 문제를 일으키기 쉬워, 최근 딥러닝 모델에서는 ReLU 계열 함수를 더 널리 사용합니다.

관련 용어