직접 선호 최적화 (direct preference optimization)

컴퓨터과학·AI
한 줄 정의: 보상 모델 없이 선호 쌍 데이터로 언어 모델을 바로 최적화하는 정렬 기법입니다.

쉽게 풀면

사람이 두 답변 중 어느 쪽이 더 낫다고 고른 데이터가 있다고 합시다. 기존 방식은 이 데이터로 점수를 매기는 보상 모델을 먼저 만들고 강화학습을 돌렸는데, 이 방법은 중간 단계를 건너뜁니다. 선호된 답변의 확률은 올리고 거부된 답변의 확률은 내리는 형태의 손실함수 하나로 모델을 직접 학습시킵니다.

왜 중요한가

강화학습 파이프라인은 학습이 불안정하고 조정할 것이 많은데, 이 방법은 평범한 지도학습처럼 안정적으로 돌아가면서 비슷한 결과를 냅니다. 계산과 구현 부담이 크게 줄어 소규모 연구팀도 모델 정렬 실험을 할 수 있게 만들었습니다. 그 결과 최근 공개 모델의 정렬 단계에서 사실상 기본 선택지가 되었습니다.

논문에서는 이렇게 쓰입니다

"동일한 선호 데이터셋에서 직접 선호 최적화로 학습한 모델이 근접 정책 최적화 기반 기법과 대등한 승률을 보이면서도 학습 시간은 단축되었다."

별도의 보상 모델과 강화학습 없이도 비슷한 품질을 더 빠르게 얻었다는 비교 결과입니다.

조금 더 깊게 보면

핵심 통찰은 보상 모델과 최적 정책 사이의 관계를 뒤집어, 보상을 학습 중인 정책과 참조 정책의 로그 확률 비로 표현할 수 있다는 것입니다. 이를 선호 확률을 기술하는 브래들리-테리 모형에 대입하면 보상 모델이 사라지고 정책 파라미터에 대한 이진 분류 형태의 손실만 남습니다. 참조 모델에서 너무 멀어지지 않도록 하는 KL 제약은 손실 안에 계수로 내재되어 있어 별도 항이 필요 없습니다.

주의할 점

인간 피드백 기반 강화학습과 목표는 같지만 보상 모델과 온라인 표본 수집을 쓰지 않는다는 점에서 절차가 다릅니다. 고정된 선호 데이터에만 의존하므로 학습이 진행되며 모델이 만들어 내는 새로운 출력의 품질은 직접 평가되지 않는다는 한계가 지적됩니다.

관련 용어