행동 복제 (Behavior Cloning)
한 줄 정의: 전문가 시연의 상태-행동 쌍을 지도학습으로 그대로 학습해 정책을 얻는 모방학습 기법입니다.
쉽게 풀면
사람이 로봇이나 자동차를 조작한 기록을 모아, '이 상황에서는 이렇게 움직였다'를 정답으로 삼아 신경망을 학습시키는 방법입니다. 보상 함수를 따로 설계할 필요 없이 시연 데이터만 있으면 된다는 장점이 있습니다. 1989년 Pomerleau의 자율주행 시스템 ALVINN이 초기 대표 사례입니다.
왜 중요한가
구현이 단순하고 데이터만 충분하면 빠르게 쓸 만한 정책을 얻을 수 있어 로봇 조작·자율주행 연구의 기본 기준선으로 널리 쓰입니다. 최근 대규모 로봇 시연 데이터와 결합해 다시 중요해졌습니다.
논문에서는 이렇게 쓰입니다
"원격조작으로 수집한 200개의 시연을 이용해 행동 복제 정책을 학습시켰으며, 이를 기준선으로 제안 방법과 성공률을 비교하였다."
행동 복제가 비교 기준선으로 쓰였음을 보여 줍니다.
조금 더 깊게 보면
행동 복제의 대표적 약점은 공변량 이동(covariate shift)입니다. 학습된 정책이 조금만 실수해도 시연 데이터에 없던 상태로 들어가고, 그곳에서 또 실수가 쌓여 오차가 누적됩니다. 이를 줄이려고 전문가에게 새 상태에서 정답을 다시 묻는 DAgger(Ross 등, 2011) 같은 방법이 제안되었습니다. 또 같은 상황에서 시연자가 여러 방식으로 행동했다면 그 평균을 학습해 어느 쪽도 아닌 행동이 나오는 다봉성 문제도 있습니다.
주의할 점
모방학습은 시연에서 배우는 방법 전체를 가리키고, 행동 복제는 그중 상태를 행동에 바로 대응시키는 지도학습 기법입니다. 역강화학습처럼 보상을 추정하는 방법과 구분해야 합니다.