보상형성 (Reward Shaping)
한 줄 정의: 희소하거나 지연된 원래의 보상 신호에 추가적인 중간 보상을 설계하여 학습 속도와 안정성을 높이는 강화학습 기법.
쉽게 풀면
목표를 달성했을 때만 보상을 주는 대신, 목표에 가까워질 때마다 조금씩 보상을 줘서 로봇이 더 빨리 배우도록 돕는 방법입니다.
논문에서는 이렇게 쓰입니다
보상 형성은 원래 보상 R에 형성 함수 F(s,a,s')를 추가한 R' = R + F를 사용하며, F가 포텐셜 기반 형태를 취하면 원래 최적 정책이 보존됨이 이론적으로 보장된다.
추가한 보상이 특정 수학적 조건(포텐셜 기반)을 만족하면, 학습을 빠르게 하면서도 원래 목표로 하던 최적 행동이 왜곡되지 않는다는 뜻입니다.
주의할 점
잘못 설계된 보상 형성은 로봇이 원래 목표와 다른 편법적 행동을 학습하는 보상 해킹(reward hacking) 문제를 일으킬 수 있습니다.