능동 학습 (Active Learning)

컴퓨터과학·AI
한 줄 정의: 모델이 가장 불확실해하거나 정보량이 많다고 판단한 데이터를 스스로 골라 사람에게 라벨링을 요청하는 학습 전략.

쉽게 풀면

모든 데이터에 일일이 라벨을 붙이는 것은 비용이 많이 들기 때문에, 능동 학습은 모델이 이미 잘 아는 쉬운 데이터는 건너뛰고 '이건 잘 모르겠다'고 판단하는 헷갈리는 데이터를 우선적으로 골라 사람에게 라벨링을 요청합니다. 학생이 이미 아는 문제를 계속 풀기보다는 헷갈리는 문제를 골라 선생님에게 질문하는 것과 비슷한 전략이에요. 이렇게 모델의 불확실성이 높은 데이터부터 라벨링하면, 같은 라벨링 비용으로 더 적은 데이터만 가지고도 효율적으로 성능을 끌어올릴 수 있습니다. 라벨링 비용이 크게 드는 의료 영상, 전문 도메인 텍스트 등에서 특히 유용합니다.

왜 중요한가

지도학습 성능은 대체로 라벨링된 데이터의 양과 질에 크게 좌우되지만, 전문가의 판단이 필요한 의료 영상 판독이나 법률·희귀언어 텍스트 주석처럼 라벨링 자체가 비싼 분야가 많습니다. 능동 학습은 제한된 라벨링 예산을 어디에 써야 모델 성능이 가장 크게 개선되는지를 다루는 문제이기 때문에, 데이터 효율적 학습이나 저자원(low-resource) 환경 연구와 자연스럽게 맞닿아 있습니다. 최근에는 파운데이션 모델의 미세조정이나 인간 피드백 수집 과정에서도 어떤 샘플을 우선 검토·주석할지 정하는 데 능동 학습의 아이디어가 활용됩니다.

논문에서는 이렇게 쓰입니다

"라벨링 비용을 줄이기 위해 불확실성 샘플링 기반의 능동 학습 전략을 도입하였다."

모델이 예측에 자신 없어 하는 데이터를 우선적으로 골라 라벨을 붙이는 방식으로 학습 데이터를 효율적으로 구축했다는 뜻이다.

"의료 영상 분할 과제에서 전문의의 주석 부담을 낮추기 위해 위원회 불일치(query-by-committee) 기반 능동 학습을 적용하였다."

여러 모델(또는 여러 예측)의 의견이 갈리는 영상을 우선적으로 골라 전문의에게 판독을 요청함으로써, 적은 수의 주석만으로도 분할 성능을 끌어올렸다는 뜻이다.

"자연어 처리 태스크에서 다양성 기반 샘플링을 능동 학습에 결합하여 특정 클래스에 편중된 라벨링을 방지하였다."

불확실성이 높은 샘플만 고르면 비슷한 유형의 데이터만 반복적으로 선택될 위험이 있어, 데이터의 다양성까지 함께 고려해 라벨링 대상을 골랐다는 뜻이다.

조금 더 깊게 보면

능동 학습에서 다음에 라벨링할 데이터를 고르는 기준을 쿼리 전략(query strategy)이라 하는데, 모델의 예측 확신도가 낮은 샘플을 고르는 불확실성 샘플링(uncertainty sampling), 여러 모델(또는 앙상블)의 예측이 서로 엇갈리는 샘플을 고르는 위원회 질의(query-by-committee), 그리고 라벨링했을 때 모델 파라미터나 오류를 가장 많이 줄여줄 것으로 기대되는 샘플을 고르는 기대 오류 감소(expected error reduction) 등이 대표적입니다. 다만 불확실성만 기준으로 삼으면 서로 비슷한 샘플이 반복적으로 뽑혀 데이터 다양성이 떨어질 수 있어, 실제 연구에서는 대표성(representativeness)이나 다양성 지표를 함께 고려하는 하이브리드 전략이 흔히 쓰입니다. 능동 학습의 효과는 보통 동일한 라벨링 예산(또는 라벨 수) 대비 모델 성능 곡선을 무작위 샘플링과 비교하는 방식으로 검증합니다.

주의할 점

능동 학습으로 선택된 데이터는 전체 데이터 분포를 대표하지 않을 수 있어, 최종 모델을 평가할 때는 별도의 무작위 샘플링 검증셋을 사용하는 것이 안전하다.

관련 용어