반사실적 변화맵 생성기를 활용한 적대적 공격 탐지

Adversarial Attack Detection Using a Counterfactual Map Generator
  • 문태진
  • 정민영

초록

인공지능 기술이 자율주행, 의료 영상 분석 등 다양한 분야에서 활용되면서, 이에 대한 적대적 공격(adversarial attack)의 위협 또한 증가하고 있다. 적대적 공격은 사람의 눈에는 보이지 않는 미세한 변화를 입력에 추가하여 인공지능 모델의 출력을 교란시키며, 신뢰성이 중요한 응용 분야에서 심각한 문제를 야기할 수 있다. 이러한 문제를 해결하기 위해 본 연구에서는 LEAR(Learn–Explain–Reinforce) 프레임워크를 기반으로 한 반사실적 변화맵 생성기를 이용한 새로운 적대적 공격 탐지 기법을 제안한다. 제안된 방법은 입력 영상에 대해 반대 클래스 방향의 반사실적 변화맵을 생성하고, 그 변화량의 크기를 분석하여 공격 여부를 판별한다. 실험 결과, 반사실적 변화맵 생성기는 공격으로 인해 모델의 학습 분포 밖(Out-of-Distribution)으로 이동한 입력에 대해 비정상적으로 큰 반사실적 변화를 생성함을 확인하였다. 이를 통해 추가적인 재학습 없이도 반사실적 변화맵의 크기만으로 공격을 효과적으로 탐지할 수 있음을 보였다. 제안된 방법은 단순하면서도 해석 가능성이 높으며, 향후 다양한 고신뢰 인공지능 시스템에서 효율적인 방어 기법으로 활용될 수 있을 것으로 기대된다.

키워드

적대적 공격적대적 생성 신경망반사실적 변화맵딥러닝Adversarial attackGenerative Adversarial NetworkCounterfactual MapDeep Learning
제목
반사실적 변화맵 생성기를 활용한 적대적 공격 탐지
제목 (타언어)
Adversarial Attack Detection Using a Counterfactual Map Generator
저자
문태진정민영
DOI
10.23019/kingpc.21.6.202512.012
발행일
2025-12
유형
Y
저널명
한국차세대컴퓨팅학회 논문지
21
6
페이지
145 ~ 156