립시츠 연속

수학
한 줄 정의: 입력값이 조금 바뀔 때 함수값이 그보다 정해진 비율 이상으로는 절대 급하게 변하지 않는다는, "변화의 속도에 상한선이 있는" 성질입니다.

쉽게 풀면

어떤 함수가 "연속"이라는 것은 입력이 조금 바뀌면 출력도 조금만 바뀐다는 뜻이지만, 그 "조금"이 얼마나 작은지에 대해서는 아무 약속이 없습니다. 립시츠 연속은 여기서 한 걸음 더 나아가, 두 입력값 사이의 거리에 항상 같은 상수(립시츠 상수라고 부름)를 곱한 값보다 출력값의 차이가 절대 커지지 않는다는 조건을 답니다. 쉽게 말해 그래프를 그렸을 때 어느 지점에서도 기울기가 특정 값(립시츠 상수)보다 가파를 수 없다는 뜻입니다. 예를 들어 f(x) = 2x는 항상 기울기가 2이므로 립시츠 상수 2로 립시츠 연속이지만, f(x) = √x는 x=0 근처에서 기울기가 무한히 커지므로 립시츠 연속이 아닙니다.

왜 중요한가

립시츠 연속은 함수의 "급변 정도"를 수치 하나로 통제할 수 있게 해주기 때문에, 최적화 이론에서 알고리즘의 수렴 속도를 증명하거나 미분방정식의 해가 존재하고 유일함을 보이는 증명의 필수 가정으로 널리 쓰입니다. 딥러닝 분야에서는 신경망의 안정성이나 적대적 공격(adversarial attack)에 대한 강건성을 분석할 때, 신경망을 하나의 함수로 보고 그 립시츠 상수를 추정하거나 제한하는 방식으로 이론적 보장을 얻으려는 연구가 활발히 이루어집니다. 이처럼 립시츠 연속은 순수 수학뿐 아니라 최적화, 제어이론, 머신러닝 전반에서 이론적 보장을 얻기 위한 공통의 도구로 기능합니다.

논문에서는 이렇게 쓰입니다

"손실 함수의 그래디언트가 L-립시츠 연속이라고 가정하면, 경사하강법은 학습률 1/L 이하에서 수렴함을 보일 수 있다."

이 문장은 "손실 함수가 얼마나 급격하게 변할 수 있는지에 상한(L)이 있다고 가정하면, 그 정보를 이용해 알고리즘이 안전하게 수렴하는 학습률 범위를 계산할 수 있다"는 뜻입니다. 최적화, 딥러닝, 미분방정식의 해가 유일하게 존재함을 보이는 증명(피카르-린델뢰프 정리) 등에서 핵심 가정으로 자주 등장합니다.

"판별자(discriminator)가 1-립시츠 함수가 되도록 가중치 클리핑을 적용하여, 바서스타인 거리를 안정적으로 근사하도록 하였다."

이 문장은 "생성적 적대 신경망(GAN)의 한 구성 요소가 지나치게 급격하게 변하지 않도록 인위적으로 제한을 걸어, 두 확률분포 사이의 거리를 계산하는 과정이 수학적으로 안정되게 만들었다"는 뜻입니다.

"상미분방정식의 우변 함수가 립시츠 연속이라는 가정 하에, 초기값 문제의 해가 국소적으로 유일하게 존재함을 보였다."

이 문장은 "방정식을 이루는 함수가 너무 급격하게 변하지 않는다는 조건이 성립하면, 주어진 초기 조건에서 시작하는 해가 오직 하나로 정해진다는 사실을 증명했다"는 뜻입니다.

조금 더 깊게 보면

립시츠 상수 L의 값이 작을수록 함수가 완만하게 변한다는 뜻이므로, 여러 논문에서는 립시츠 상수 자체를 줄이거나 정확히 추정하는 것을 연구 목표로 삼기도 합니다. 신경망에서는 각 층의 가중치 행렬에 스펙트럼 정규화(spectral normalization)를 적용하거나 가중치 값을 일정 범위로 잘라내는 방식으로 립시츠 상수를 제한하는 기법이 흔히 쓰입니다. 또한 함수가 미분가능하지 않은 지점에서도 정의될 수 있는 립시츠 연속의 성질을 이용해, 첨점(뾰족한 점)이 있는 함수의 최적화 문제를 다루는 이론적 틀로도 활용됩니다.

주의할 점

립시츠 연속은 일반적인 연속보다 훨씬 강한 조건이며, 심지어 미분가능성과도 다른 개념입니다. 립시츠 연속인 함수가 항상 미분가능한 것은 아니고(꼭짓점이 있는 |x| 같은 함수도 립시츠 연속입니다), 반대로 미분가능해도 도함수가 무한히 커질 수 있다면 립시츠 연속이 아닐 수 있습니다. 또한 "립시츠 연속"이라고만 쓰면 어떤 구간에서, 어떤 립시츠 상수로 성립하는지가 빠져 있으므로, 엄밀한 논문에서는 반드시 상수 L과 적용 범위를 함께 명시해야 합니다.

관련 용어