적대적공격 (Adversarial Attack)
한 줄 정의: 인공지능 모델의 입력값에 사람 눈에는 거의 티가 나지 않는 미세한 변형을 가해 모델이 잘못된 판단을 내리도록 유도하는 공격 기법입니다.
쉽게 풀면
적대적공격은 사람에게는 똑같아 보이는 표지판에 아주 작은 스티커를 붙여서 자율주행차가 정지 표지판을 다른 표지판으로 잘못 인식하게 만드는 것과 비슷합니다. 인공지능 모델은 우리가 눈치채지 못하는 미세한 픽셀 변화나 노이즈에도 크게 흔들릴 수 있는데, 공격자는 이 약점을 이용해 이미지, 음성, 텍스트 등의 입력을 살짝만 조작해 모델이 완전히 다른 결과를 내놓도록 유도합니다.
왜 중요한가
정보보안학과 인공지능 안전성 연구에서 적대적공격은 자율주행, 얼굴인식, 의료 진단 등 실생활에 적용되는 인공지능 시스템의 신뢰성을 위협하는 핵심 문제로 다뤄집니다. 이에 대응하는 적대적 학습(adversarial training) 등 방어 기법 연구도 함께 활발히 진행됩니다.
논문에서는 이렇게 쓰입니다
"본 연구는 이미지 분류 모델에 대해 FGSM 기반 적대적공격을 수행하여 분류 정확도가 크게 저하됨을 보였다."
특정 공격 기법으로 모델의 성능을 실제로 떨어뜨린 실험 결과를 설명한 문장입니다.
"제안 방어 기법은 적대적공격에 대한 모델의 강건성(robustness)을 향상시키기 위해 적대적 예제를 학습 과정에 포함시킨다."
공격을 미리 학습시켜 모델을 더 튼튼하게 만드는 방어 전략을 설명한 문장입니다.
조금 더 깊게 보면
적대적공격은 공격자가 모델 내부 구조를 알고 있는지에 따라 화이트박스(white-box)와 블랙박스(black-box) 공격으로 나뉘며, 대표적인 기법으로는 FGSM, PGD 등이 연구되어 왔습니다. 방어 측에서는 적대적 학습, 입력 전처리, 그래디언트 마스킹 등의 대응 기법이 제안되지만 완전한 방어는 여전히 어려운 문제로 남아 있습니다.
주의할 점
특정 방어 기법이 모든 종류의 적대적공격을 막을 수 있는 것은 아니며, 공격과 방어 기술이 계속 서로를 앞지르며 발전하는 경쟁적 관계에 있다는 점에 유의해야 합니다.