역강화학습 (Inverse Reinforcement Learning (IRL))
한 줄 정의: 전문가의 시연 행동으로부터 그 행동을 최적으로 만드는 보상 함수를 역으로 추정하는 학습 기법.
쉽게 풀면
사람이 어떻게 행동하는지를 보고, '이 사람은 대체 무엇을 좋다고 여기며 행동하는 걸까'라는 숨겨진 보상 기준을 거꾸로 알아내는 방법입니다.
논문에서는 이렇게 쓰입니다
역강화학습은 전문가 궤적이 다른 어떤 정책보다도 높은 누적 보상을 갖도록 만드는 보상 함수 R을 시연 데이터로부터 역으로 추정하는 문제로 정식화된다.
행동 자체를 그대로 따라하는 모방학습과 달리, 그 행동 뒤에 숨은 목적(보상)을 먼저 알아내어 다양한 상황에도 일반화할 수 있게 한다는 차이가 있습니다.
주의할 점
동일한 시연 행동을 설명하는 보상 함수가 여러 개 존재할 수 있는 근본적인 비유일성(ill-posedness) 문제가 있습니다.