액터-크리틱 (actor-critic)
한 줄 정의: 행동을 고르는 정책망과 그 행동을 평가하는 가치망을 함께 학습시키는 강화학습 구조입니다.
쉽게 풀면
연기하는 배우와 옆에서 평을 해 주는 비평가를 한 팀으로 두는 방식입니다. 액터는 상황을 보고 어떤 행동을 할지 정하고, 크리틱은 그 행동이 기대보다 좋았는지 나빴는지를 점수로 알려 줍니다. 액터는 그 평을 받아 좋았다는 행동은 더 자주, 나빴다는 행동은 덜 하도록 자신의 정책을 고칩니다.
왜 중요한가
정책만 학습하는 방식은 보상의 분산이 커서 학습이 요동치고, 가치만 학습하는 방식은 연속적인 행동을 다루기 어렵습니다. 액터-크리틱은 두 접근의 장점을 결합해 분산을 낮추면서도 연속 행동 공간을 자연스럽게 다룹니다. 로봇 제어부터 언어 모델의 인간 피드백 학습까지 현대 강화학습 알고리즘의 대부분이 이 구조를 따릅니다.
논문에서는 이렇게 쓰입니다
"연속 제어 과제에서 액터-크리틱 구조를 채택하여 정책 경사 추정치의 분산을 줄이고 학습 안정성을 확보하였다."
두 신경망을 함께 쓰는 구조로 학습 신호의 출렁임을 줄였다는 설명입니다.
조금 더 깊게 보면
크리틱은 시간차 오차를 이용해 가치함수를 학습하고, 액터는 그 오차 또는 이득 함수를 가중치로 삼아 정책 경사법의 갱신식을 적용합니다. 가치함수를 기준선으로 빼 주기 때문에 기울기 추정이 불편향을 유지하면서 분산만 줄어드는 것이 핵심입니다. 여러 환경을 병렬로 돌리는 A2C·A3C, 갱신 폭을 제한하는 근접 정책 최적화, 엔트로피 항을 더한 SAC 등이 대표적 변형입니다.
주의할 점
정책 경사법은 정책의 기울기를 따라 올라간다는 원리를 가리키고, 액터-크리틱은 그 기울기의 분산을 줄이기 위해 학습된 가치함수를 끌어들인 구조적 설계입니다. 크리틱이 부정확하면 편향된 신호가 액터로 그대로 전달되므로 두 망의 학습 속도 균형이 중요합니다.