시간차 학습 (temporal difference learning)
쉽게 풀면
결과를 끝까지 기다렸다가 배우는 대신, 한 걸음 진행해 보고 예측이 어떻게 달라졌는지를 보고 바로 배우는 방법입니다. 축구 경기 전 승률 예측이 전반전 득점 후 확 바뀌었다면, 경기가 끝나기 전에도 처음 예측이 틀렸다는 것을 알 수 있는 것과 같습니다. 이때 두 예측값의 차이를 시간차 오차라고 부르고, 그만큼 예측을 수정합니다.
왜 중요한가
에피소드가 끝날 때까지 기다릴 필요가 없어 온라인으로, 그리고 끝이 없는 과제에서도 학습할 수 있게 해 줍니다. 몬테카를로 방식보다 분산이 작아 학습이 안정적이라는 장점도 큽니다. 무엇보다 이 시간차 오차 신호가 동물 뇌의 도파민 반응과 유사하다는 발견 덕분에 신경과학과 강화학습을 잇는 다리 역할도 합니다.
논문에서는 이렇게 쓰입니다
이 방식이 안정적이지만 자기 예측을 정답처럼 쓰기 때문에 초반에는 치우침이 있다는 관찰입니다.
조금 더 깊게 보면
가장 단순한 TD(0)는 관측한 보상에 다음 상태의 현재 추정 가치를 더한 값을 목표로 삼아 현재 상태의 가치를 갱신합니다. 이렇게 자기 자신의 추정값을 목표에 쓰는 것을 부트스트랩이라 하며, 이 때문에 편향이 생기지만 분산은 줄어듭니다. 여러 걸음을 묶는 n단계 TD와, 모든 길이의 수익을 지수적으로 가중 평균하는 TD(λ) 및 적격 흔적이 이 계열의 표준 확장입니다.
주의할 점
Q러닝은 상태-행동 가치를 최대 연산으로 갱신하는 시간차 학습의 한 구체적 형태이므로, 시간차 학습은 그보다 넓은 학습 원리를 가리킵니다. 보상예측오차는 이 오차 신호를 신경과학적으로 해석한 개념으로, 수학적 정의는 같지만 사용 맥락이 다릅니다.