모델기반강화학습 (Model-based Reinforcement Learning)
한 줄 정의: 환경의 전이 및 보상 모델을 명시적으로 학습하고, 이 모델을 이용해 미래를 예측하며 계획하거나 정책을 학습하는 강화학습 접근법.
쉽게 풀면
먼저 '이 행동을 하면 어떤 일이 일어날지'에 대한 세상의 모형을 배우고, 그 모형으로 머릿속에서 미리 시뮬레이션해보며 좋은 행동을 찾는 방법입니다.
논문에서는 이렇게 쓰입니다
모델 기반 강화학습은 전이 함수 P(s'|s,a)와 보상 함수 R(s,a)를 학습된 모델로 근사하고, 이를 이용해 계획(planning) 또는 모델 롤아웃을 통해 정책을 개선한다.
실제 환경에서 매번 시행착오를 겪는 대신, 학습한 모델 안에서 가상으로 여러 행동을 시도해봄으로써 실제 경험을 절약할 수 있다는 뜻입니다.
주의할 점
학습된 모델이 실제 환경과 다를 경우 그 오차가 계획 단계에서 누적되어 잘못된 정책으로 이어질 위험이 있습니다.