근위정책최적화 (Proximal Policy Optimization (PPO))
한 줄 정의: 정책 갱신 폭을 클리핑된 목적 함수로 제한하여 학습 안정성과 샘플 효율성을 동시에 확보한 정책 경사 기반 강화학습 알고리즘.
쉽게 풀면
정책을 한 번에 너무 크게 바꾸지 않도록 제한을 걸어, 학습이 갑자기 무너지지 않으면서도 꾸준히 좋아지게 만드는 방법입니다.
논문에서는 이렇게 쓰입니다
PPO는 목적함수를 clip(r_t(θ), 1−ε, 1+ε) 형태로 제한하여 새 정책과 이전 정책 간 확률비가 지나치게 벗어나지 않도록 제약함으로써 안정적인 정책 갱신을 보장한다.
새로 학습된 정책이 이전 정책과 얼마나 다른 행동을 선호하는지의 비율을 일정 범위 안으로 잘라내어, 급격한 정책 변화로 인한 성능 붕괴를 막는다는 뜻입니다.
주의할 점
구현이 비교적 단순하고 안정적이지만, 클리핑 범위 등 하이퍼파라미터에 따라 성능 편차가 클 수 있습니다.