적대적 예제 공격 (Adversarial Example Attack)
쉽게 풀면
사진 속 팬더 이미지에 눈에 보이지 않을 정도의 노이즈를 살짝 섞으면, 사람 눈에는 여전히 팬더로 보이지만 인공지능은 이를 긴팔원숭이로 착각할 수 있습니다. 이것이 바로 적대적 예제 공격입니다. 도로 표지판에 작은 스티커 몇 개를 붙여서 자율주행차의 인식 시스템이 정지 표지판을 속도제한 표지판으로 잘못 읽게 만드는 사례도 같은 원리입니다. 공격자는 모델이 학습한 판단 경계의 취약한 지점을 수학적으로 계산해 그 지점을 정확히 건드립니다. 결과적으로 인간의 직관과 인공지능의 판단이 완전히 어긋나는 상황이 만들어집니다.
왜 중요한가
자율주행, 얼굴 인식, 의료 영상 진단 등 인공지능이 직접적인 의사결정을 내리는 영역이 늘어나면서, 이러한 오작동은 실제 안전 사고로 이어질 수 있습니다. 정보보안학 연구자들은 이 공격이 어떤 조건에서 성립하는지, 그리고 이를 방어할 수 있는 견고한(robust) 모델 설계 방법을 함께 연구합니다. 또한 이 개념은 인공지능 시스템의 신뢰성과 안전성을 평가하는 핵심 기준으로 자리잡고 있습니다.
논문에서는 이렇게 쓰입니다
공격 기법이 특정 알고리즘으로 생성되며, 그 결과 모델 성능이 실제로 얼마나 떨어지는지를 실험으로 검증했다는 의미입니다.
공격에 대응하는 방어책으로, 공격받을 수 있는 예제를 미리 학습 데이터에 포함시켜 모델을 단련시키는 접근을 설명하는 문장입니다.
조금 더 깊게 보면
대표적인 생성 방식으로는 모델의 손실 함수 기울기(gradient)를 이용해 한 번에 노이즈를 계산하는 FGSM과, 이를 여러 번 반복 적용해 더 강력한 변형을 만드는 PGD 등이 있습니다. 공격자가 모델 구조를 알고 있는지 여부에 따라 화이트박스 공격과 블랙박스 공격으로 구분되며, 후자는 모델 내부 정보 없이 입출력만 관찰해 공격을 시도합니다. 방어 방법으로는 앞서 언급한 적대적 훈련 외에도 입력을 전처리해 노이즈를 제거하는 방식, 모델의 예측 신뢰도를 활용해 이상 입력을 탐지하는 방식 등이 연구되고 있습니다.
주의할 점
모든 방어 기법이 모든 종류의 공격에 동일하게 효과적인 것은 아니며, 새로운 공격 기법이 등장하면 기존 방어가 무력화되는 경우가 반복적으로 보고되고 있습니다. 따라서 완벽한 방어가 존재한다고 단정하기보다는, 지속적인 공방이 이어지는 분야로 이해하는 것이 정확합니다.