경험 재생 (experience replay)
한 줄 정의: 과거 경험을 저장해 두었다가 무작위로 꺼내 반복 학습에 재사용하는 강화학습 기법입니다.
쉽게 풀면
에이전트가 겪은 상태·행동·보상·다음 상태의 묶음을 커다란 상자에 차곡차곡 넣어 둡니다. 학습할 때는 방금 겪은 일만 쓰지 않고 이 상자에서 무작위로 몇 개를 꺼내 함께 씁니다. 그러면 연달아 일어난 경험들이 서로 비슷해서 생기는 편향이 깨지고, 값비싼 경험을 한 번 쓰고 버리지 않아도 됩니다.
왜 중요한가
심층 강화학습이 실제로 작동하게 만든 결정적 장치 중 하나입니다. 신경망 학습이 전제하는 독립 동일 분포 가정을 연속된 경험이 위반하는 문제를 완화하고, 데이터 효율을 크게 높여 줍니다. 아타리 게임을 사람 수준으로 푼 심층 Q망의 핵심 구성요소로 널리 알려졌습니다.
논문에서는 이렇게 쓰입니다
"우선순위 경험 재생을 도입해 시간차 오차가 큰 전이를 더 자주 표집하자 동일 환경에서 수렴이 빨라졌다."
배울 것이 많은 경험을 더 자주 꺼내 쓰도록 하자 학습 속도가 개선되었다는 뜻입니다.
조금 더 깊게 보면
버퍼 크기, 표집 배치 크기, 갱신 대비 환경 상호작용 비율이 주요 설계 변수입니다. 균등 표집 대신 시간차 오차 크기에 비례해 뽑는 우선순위 경험 재생이 널리 쓰이며, 이때 생기는 표집 편향은 중요도 가중으로 보정합니다. 목표 달성 실패 경험의 목표를 사후에 바꿔 성공 사례로 재활용하는 사후 경험 재생처럼 희소 보상 문제를 겨냥한 변형도 있습니다.
주의할 점
저장된 경험은 과거 정책이 만든 것이므로 오프폴리시 학습에서만 그대로 쓸 수 있고, 온폴리시 알고리즘에 그대로 적용하면 편향이 생깁니다. 해마의 해마 재현이 개념적 영감을 준 것으로 자주 언급되지만, 이쪽은 알고리즘 구성요소이지 생물학적 현상이 아닙니다.