비전-언어-행동 모델 (Vision-Language-Action Model)
한 줄 정의: 카메라 영상과 언어 지시를 입력받아 로봇 행동을 직접 출력하도록 학습한 대규모 모델입니다.
쉽게 풀면
'빨간 컵을 쟁반에 올려'라고 말하면 카메라로 장면을 보고 로봇 팔의 움직임을 바로 내놓는 모델입니다. 인터넷 규모의 이미지·텍스트로 사전학습한 비전-언어 모델에 로봇 데이터를 더 학습시켜 만듭니다. 2023년 Google DeepMind의 RT-2가 이 이름을 널리 알렸습니다.
왜 중요한가
웹 데이터에서 얻은 상식과 개념 지식을 로봇 제어로 옮겨, 처음 보는 물체나 지시에도 어느 정도 일반화할 수 있다는 점에서 범용 로봇 지능 연구의 중심 흐름이 되었습니다.
논문에서는 이렇게 쓰입니다
"사전학습된 비전-언어-행동 모델을 소량의 현장 시연으로 미세조정하여 새로운 조립 작업에 적용하였다."
대형 VLA를 기반으로 삼고 적은 데이터로 특정 작업에 맞췄다는 뜻입니다.
조금 더 깊게 보면
RT-2는 로봇 행동(말단 위치 변화, 그리퍼 개폐 등)을 이산 토큰으로 바꿔 언어 모델이 글자를 생성하듯 행동을 생성하게 했습니다. 이후 OpenVLA 같은 공개 모델, 행동을 연속값으로 생성하는 확산·흐름 기반 행동 출력부를 붙인 모델 등이 나왔습니다. 추론 속도, 정밀 조작, 안전성 검증이 여전히 과제입니다.
주의할 점
VLA는 시연을 흉내 내는 모방학습 기법 하나가 아니라, 대규모 사전학습 비전-언어 모델을 로봇 정책으로 쓰는 모델 유형을 가리킵니다. 학습에는 모방학습이 흔히 쓰이지만 두 개념을 같은 것으로 보면 안 됩니다.