확률적 역전학습 (Probabilistic Reversal Learning)
한 줄 정의: 보상 확률이 다른 선택지를 학습한 뒤, 예고 없이 확률이 뒤바뀌면 선택을 바꾸는 능력을 보는 과제입니다.
쉽게 풀면
두 선택지 중 하나는 대부분 보상을 주고 다른 하나는 가끔만 보상을 줍니다. 참가자나 동물은 먼저 좋은 선택지를 찾아내야 하는데, 어느 순간 말없이 두 선택지의 보상 확률이 서로 바뀝니다. 이때 몇 번의 우연한 실패에 흔들리지 않으면서도, 규칙이 진짜로 바뀌었을 때는 빠르게 선택을 바꾸는지를 봅니다.
왜 중요한가
보상이 확률적이라서 가끔의 실패를 무시하는 능력과 실제 변화를 감지해 행동을 바꾸는 능력을 함께 요구합니다. 이 때문에 인지 유연성과 보상 기반 학습을 정밀하게 측정하는 대표 과제이며, 강박장애·중독·조현병 등에서 나타나는 유연성 저하 연구에 쓰입니다.
논문에서는 이렇게 쓰입니다
"80:20 보상 확률 과제에서 확률이 역전된 후 사회적 우위 마우스는 열위 마우스보다 적은 시행 만에 새로운 고확률 선택지로 전환하였다."
역전 후 전환에 걸린 시행 수로 개체 간 인지 유연성의 차이를 비교한 결과입니다.
조금 더 깊게 보면
주요 지표는 역전 후 기준 정답률에 도달할 때까지의 시행 수, 역전 횟수, 이전 선택을 고집하는 보속 오류 등입니다. 시행별 선택은 승리-유지 패배-전환 비율로 요약하거나, 강화학습 모델을 적합해 학습률과 탐색 경향 같은 잠재 변수를 추정합니다. 확률적 보상 때문에 결정론적 역전 과제보다 부정적 되먹임에 대한 민감도를 더 잘 드러낸다고 봅니다. 신경 기전 연구에서는 안와전두피질, 선조체, 세로토닌·도파민 신호가 자주 다뤄집니다.
주의할 점
역전 학습이 느린 이유가 유연성 부족인지, 처음 학습이 약했기 때문인지, 동기가 낮았기 때문인지 구분해야 합니다. 보상 확률과 역전 기준이 연구마다 달라 수치를 직접 비교할 때 주의가 필요합니다.