확산 정책 (Diffusion Policy)
한 줄 정의: 디퓨전 모델로 잡음에서 시작해 로봇 행동 시퀀스를 점차 생성하는 모방학습 정책입니다.
쉽게 풀면
이미지 생성에 쓰이는 디퓨전 모델을 로봇 행동 생성에 적용한 방법입니다. 현재 관찰을 조건으로, 무작위 잡음을 여러 단계에 걸쳐 다듬어 앞으로 할 행동 몇 걸음을 한꺼번에 만들어 냅니다. Chi 등(2023)이 제안해 널리 퍼졌습니다.
왜 중요한가
사람 시연에는 같은 상황에서도 여러 가지 해법이 섞여 있는데, 확산 정책은 이런 다봉 분포를 잘 표현해 단순한 행동 복제보다 안정적인 조작 성능을 보였습니다. 이후 많은 로봇 학습 연구의 기본 정책 구조가 되었습니다.
논문에서는 이렇게 쓰입니다
"확산 정책은 16스텝 행동 구간을 한 번에 예측하여 시연 데이터의 다봉성에도 불구하고 일관된 궤적을 생성하였다."
행동을 묶음(chunk)으로 예측해 궤적이 흔들리지 않았다는 뜻입니다.
조금 더 깊게 보면
확산 정책은 관찰을 조건으로 한 조건부 디노이징 과정을 학습하며, 행동 시퀀스 단위로 예측하고 일부만 실행한 뒤 다시 예측하는 방식(receding horizon)을 씁니다. 여러 번의 디노이징 단계 때문에 추론이 느릴 수 있어, DDIM 같은 빠른 샘플러나 일관성 모델로 속도를 줄이는 연구가 이어졌습니다. CNN 기반과 트랜스포머 기반 구조가 모두 쓰입니다.
주의할 점
확산 정책은 디퓨전 모델을 정책으로 쓰는 특정 모방학습 방법이지 디퓨전 모델 일반이 아닙니다. 시연 데이터를 흉내 내는 방법이므로 시연 품질을 넘어서는 성능을 기대하기는 어렵습니다.