인스트럭션 튜닝 (instruction tuning)

컴퓨터과학·AI
한 줄 정의: 다양한 과제를 자연어 지시문과 모범 답변 쌍으로 학습시켜 지시를 따르게 만드는 미세조정입니다.

쉽게 풀면

사전학습만 마친 언어 모델은 글을 이어 쓰는 데는 능하지만 “이 문단을 세 줄로 요약해 줘” 같은 요청을 제대로 알아듣지 못합니다. 그래서 수많은 과제를 “이렇게 시키면 이렇게 답한다”는 형태로 모아 다시 학습시킵니다. 그러면 학습에 없던 새로운 지시에도 형식을 이해하고 반응하게 됩니다.

왜 중요한가

거대 모델이 실제로 쓸 만한 조수가 되는 첫 관문으로, 사용자가 프롬프트 요령을 익히지 않아도 자연스럽게 쓸 수 있게 해 줍니다. 여러 과제를 지시문 형식으로 통일해 학습하면 학습에 포함되지 않은 과제로도 능력이 옮겨 가는 제로샷 일반화가 크게 향상됩니다. 오늘날 공개되는 대화형 모델의 표준 제작 단계입니다.

논문에서는 이렇게 쓰입니다

"1,800여 개 과제를 지시문 형식으로 변환해 인스트럭션 튜닝을 수행한 결과, 미학습 과제에 대한 제로샷 성능이 크게 향상되었다."

많은 과제를 지시문 형태로 바꿔 학습시키자 배우지 않은 과제까지 잘 처리하게 되었다는 뜻입니다.

조금 더 깊게 보면

학습 자체는 정답 응답에 대한 다음 토큰 예측 손실을 쓰는 지도 미세조정이며, 핵심은 데이터의 과제 다양성과 지시문 표현의 다양성입니다. 사람이 쓴 지시 데이터가 비싸기 때문에 소수의 씨앗 지시문에서 모델이 스스로 지시와 응답을 생성하게 하는 자기지시 방식이 널리 쓰입니다. 보통 이 단계 뒤에 선호 데이터로 조정하는 인간 피드백 기반 강화학습이나 직접 선호 최적화가 이어집니다.

주의할 점

파인튜닝이 특정 과제 하나에 모델을 맞추는 일반 절차라면, 인스트럭션 튜닝은 지시를 따르는 능력 자체를 얻기 위해 여러 과제를 한꺼번에 학습시키는 특수한 형태입니다. 모범 답변을 모방할 뿐이므로 답변의 사실성이나 유해성까지 보장하지는 않습니다.

관련 용어