강화학습기반로봇제어 (Reinforcement Learning (Robotics))
한 줄 정의: 로봇이 환경과의 상호작용을 통해 얻는 보상 신호를 이용해 시행착오로 최적의 행동 정책을 학습하는 기계학습 패러다임.
쉽게 풀면
로봇이 이렇게 저렇게 행동해 보면서 잘하면 칭찬(보상)을, 못하면 벌점을 받아가며 점점 더 잘하는 방법을 스스로 익히는 학습 방식입니다.
논문에서는 이렇게 쓰입니다
강화학습은 마르코프 결정 과정(MDP)의 틀에서 상태 s, 행동 a, 보상 r, 전이 확률 P를 통해 누적 보상의 기댓값을 최대화하는 정책 π(a|s)를 학습하는 문제로 정식화된다.
지금 상태에서 어떤 행동을 했을 때 앞으로 받을 보상의 합이 가장 커지도록 하는 행동 규칙을 반복적인 경험을 통해 찾아낸다는 뜻입니다.
주의할 점
실제 로봇에서 시행착오 학습은 시간과 비용, 안전 위험이 크므로 시뮬레이션 학습 후 전이하는 방식이 흔히 사용됩니다.