시간차 학습 (temporal difference learning)

컴퓨터과학·AI
한 줄 정의: 한 걸음 뒤의 예측값을 임시 정답으로 삼아 현재 예측을 조금씩 고쳐 나가는 학습 방식입니다.

쉽게 풀면

결과를 끝까지 기다렸다가 배우는 대신, 한 걸음 진행해 보고 예측이 어떻게 달라졌는지를 보고 바로 배우는 방법입니다. 축구 경기 전 승률 예측이 전반전 득점 후 확 바뀌었다면, 경기가 끝나기 전에도 처음 예측이 틀렸다는 것을 알 수 있는 것과 같습니다. 이때 두 예측값의 차이를 시간차 오차라고 부르고, 그만큼 예측을 수정합니다.

왜 중요한가

에피소드가 끝날 때까지 기다릴 필요가 없어 온라인으로, 그리고 끝이 없는 과제에서도 학습할 수 있게 해 줍니다. 몬테카를로 방식보다 분산이 작아 학습이 안정적이라는 장점도 큽니다. 무엇보다 이 시간차 오차 신호가 동물 뇌의 도파민 반응과 유사하다는 발견 덕분에 신경과학과 강화학습을 잇는 다리 역할도 합니다.

논문에서는 이렇게 쓰입니다

"시간차 학습 기반 가치함수 추정치는 몬테카를로 추정 대비 분산이 작았으나 초기 편향은 더 크게 나타났다."

이 방식이 안정적이지만 자기 예측을 정답처럼 쓰기 때문에 초반에는 치우침이 있다는 관찰입니다.

조금 더 깊게 보면

가장 단순한 TD(0)는 관측한 보상에 다음 상태의 현재 추정 가치를 더한 값을 목표로 삼아 현재 상태의 가치를 갱신합니다. 이렇게 자기 자신의 추정값을 목표에 쓰는 것을 부트스트랩이라 하며, 이 때문에 편향이 생기지만 분산은 줄어듭니다. 여러 걸음을 묶는 n단계 TD와, 모든 길이의 수익을 지수적으로 가중 평균하는 TD(λ) 및 적격 흔적이 이 계열의 표준 확장입니다.

주의할 점

Q러닝은 상태-행동 가치를 최대 연산으로 갱신하는 시간차 학습의 한 구체적 형태이므로, 시간차 학습은 그보다 넓은 학습 원리를 가리킵니다. 보상예측오차는 이 오차 신호를 신경과학적으로 해석한 개념으로, 수학적 정의는 같지만 사용 맥락이 다릅니다.

관련 용어