모델 오염공격 (Model Poisoning Attack)
쉽게 풀면
학생이 교과서로 공부해서 시험을 보는 것처럼, 인공지능 모델도 학습 데이터를 통해 판단하는 법을 배웁니다. 만약 누군가 교과서 중간중간에 몰래 잘못된 내용을 끼워 넣는다면 학생은 틀린 지식을 정답이라고 믿게 됩니다. 모델 오염공격은 바로 이렇게 학습 데이터나 학습 과정에 악의적인 조작을 몰래 섞어, 모델이 특정 상황에서 공격자가 원하는 대로 잘못된 판단을 내리게 만드는 공격입니다.
왜 중요한가
인공지능 모델이 자율주행, 스팸 필터링, 이상행위 탐지처럼 중요한 의사결정에 쓰이는 사례가 늘면서, 학습 단계에서의 조작이 실제 서비스의 오작동으로 직결될 수 있습니다. 특히 외부에서 수집한 데이터나 여러 참여자가 함께 학습에 기여하는 구조에서는 오염된 데이터를 걸러내기가 더 어렵습니다. 이런 이유로 인공지능 보안 분야에서 모델 오염공격에 대한 탐지와 방어는 중요한 연구 주제로 다뤄집니다.
논문에서는 이렇게 쓰입니다
데이터의 정답 표시를 몰래 바꿔서 모델의 판단 능력을 떨어뜨린 실험을 설명하고 있습니다.
여러 참여자가 함께 모델을 학습시키는 상황에서 악의적인 업데이트를 걸러내는 방법을 제시했다는 뜻입니다.
조금 더 깊게 보면
모델 오염공격은 크게 학습 데이터를 조작하는 데이터 오염과, 모델 파라미터 업데이트 자체를 조작하는 방식으로 나눌 수 있습니다. 방어 기법으로는 이상치 데이터를 걸러내는 검증 절차, 여러 참여자의 업데이트를 통계적으로 비교해 비정상적인 값을 배제하는 방법 등이 연구되고 있습니다.
주의할 점
모델 오염공격은 학습 단계에서 발생한다는 점에서, 학습이 끝난 모델에 입력을 조작해 오작동을 유도하는 공격과는 구분해서 이해해야 합니다. 오염 여부를 완전히 탐지하는 것은 일반적으로 쉽지 않은 문제로 남아 있습니다.