탐색-활용 절충 (exploration-exploitation tradeoff)

컴퓨터과학·AI
한 줄 정의: 새로운 선택지를 시험하는 일과 지금 최선인 선택지를 쓰는 일 사이의 균형 문제입니다.

쉽게 풀면

단골 식당에 계속 가면 실패는 없지만 더 맛있는 집을 영영 모릅니다. 반대로 매번 새 집만 가면 맛없는 식사가 잦아집니다. 학습하는 시스템도 똑같은 문제를 안고 있어서, 아직 정보가 부족한 선택지를 얼마나 시험할지와 이미 좋다고 판단한 선택지를 얼마나 밀어붙일지를 매 순간 저울질해야 합니다.

왜 중요한가

강화학습이 지도학습과 근본적으로 다른 지점이 바로 여기입니다. 지도학습은 정답이 주어지지만 강화학습은 직접 해 보지 않은 행동의 결과를 알 수 없으므로, 데이터를 모으는 행위 자체가 학습의 일부가 됩니다. 추천, 광고, 신약 탐색, 로봇 제어 등 실패 비용이 있는 모든 온라인 의사결정에서 핵심 설계 쟁점입니다.

논문에서는 이렇게 쓰입니다

"탐색-활용 절충을 조절하기 위해 ε 값을 학습 진행에 따라 0.9에서 0.05까지 선형으로 감소시켰다."

학습 초반에는 여러 행동을 많이 시험하고 후반에는 좋은 행동 위주로 쓰도록 비율을 조절했다는 뜻입니다.

조금 더 깊게 보면

가장 단순한 조절 방법은 일정 확률로 무작위 행동을 하는 ε-탐욕이며, 행동 확률을 가치에 비례시키는 볼츠만 탐색, 불확실성이 큰 선택에 가산점을 주는 낙관적 접근, 새로움 자체에 내재적 보상을 주는 호기심 기반 탐색 등이 있습니다. 이론적으로는 최적 선택 대비 누적 손실인 후회를 얼마나 낮게 억제하는지로 전략을 평가합니다. 보상이 아주 드문 환경에서는 무작위 탐색만으로는 사실상 학습이 불가능해 구조적 탐색 기법이 필요합니다.

주의할 점

다중 슬롯머신 문제는 이 절충을 가장 단순한 형태로 형식화한 특정 문제 설정이고, 탐색-활용 절충 자체는 그보다 넓은 일반 원리입니다. 탐색을 늘리면 항상 좋아진다는 식으로 단순화하면 안 되며, 과도한 탐색은 유한한 시행에서 성능을 떨어뜨립니다.

관련 용어