롱-테일 탈옥 공격 방어를 위한 도메인 탐지기

Domain Detector for defending against Longtail Jailbreak Attack
  • 장현준
  • 나현식
  • 박대얼
  • 최대선

초록

본 논문은 대규모 언어모델에 대한 롱-테일 탈옥 공격(longtail jailbreak attack) 방어 방법을 제시하며, 기존 사전 탐지 방식이 가지는 취약성을 극복하고자 한다. 이를 위해, 탈옥 공격에 사용되는 특정 도메인을 탐지하고 그 결과에 따라 유동적으로 경고 접두사를 적용하는 도메인 탐지기 기반의 새로운 방어 접근법을 제안한다. 실험 결과, 기존 사전 탐지기는 롱-테일 공격, 특히 인코딩 기반 공격 탐지에서 약 50% 내외의 낮은 정확도에 그친 반면, 제안 방식은 인코딩 기법 85.54%, 다국어 기반 공격 100%의 높은 탐지 정확도를 달성하며 높은 성능 향상을 입증하였다. 이러한 높은 탐지 정확도를 기반으로 경고 접두사를 적용한 결과, 최종적으로 96.56%의 방어 성공률, 0.40%의 오탐률, 0.9542의 F1-score를 달성하며 강력한 방어 효과를 입증하였다. 이는 사전 예방과 실시간 처리라는 기존 탐지 기법의 장점을 유지하면서도 모델 내부 접근이 제한된 환경에서의 보안성을 향상시킨다는 점에서 의의가 있으며, 롱-테일 탈옥 공격에 대한 새로운 사전 방어 전략을 통해 대규모 언어모델의 안정적 활용 가능성을 높이고, 보안 정책의 유연성과 실용성을 동시에 확보할 수 있음을 입증한다.

키워드

Large Language Model SecurityJailbreak AttackLongtail Jailbreak AttackJailbreak Pre-detection
제목
롱-테일 탈옥 공격 방어를 위한 도메인 탐지기
제목 (타언어)
Domain Detector for defending against Longtail Jailbreak Attack
저자
장현준나현식박대얼최대선
DOI
10.13089/JKIISC.2025.35.3.623
발행일
2025-06
저널명
정보보호학회논문지
35
3
페이지
623 ~ 638