상세 보기
롱-테일 탈옥 공격 방어를 위한 도메인 탐지기
Domain Detector for defending against Longtail Jailbreak Attack
- 장현준;
- 나현식;
- 박대얼;
- 최대선
초록
본 논문은 대규모 언어모델에 대한 롱-테일 탈옥 공격(longtail jailbreak attack) 방어 방법을 제시하며, 기존 사전 탐지 방식이 가지는 취약성을 극복하고자 한다. 이를 위해, 탈옥 공격에 사용되는 특정 도메인을 탐지하고 그 결과에 따라 유동적으로 경고 접두사를 적용하는 도메인 탐지기 기반의 새로운 방어 접근법을 제안한다. 실험 결과, 기존 사전 탐지기는 롱-테일 공격, 특히 인코딩 기반 공격 탐지에서 약 50% 내외의 낮은 정확도에 그친 반면, 제안 방식은 인코딩 기법 85.54%, 다국어 기반 공격 100%의 높은 탐지 정확도를 달성하며 높은 성능 향상을 입증하였다. 이러한 높은 탐지 정확도를 기반으로 경고 접두사를 적용한 결과, 최종적으로 96.56%의 방어 성공률, 0.40%의 오탐률, 0.9542의 F1-score를 달성하며 강력한 방어 효과를 입증하였다. 이는 사전 예방과 실시간 처리라는 기존 탐지 기법의 장점을 유지하면서도 모델 내부 접근이 제한된 환경에서의 보안성을 향상시킨다는 점에서 의의가 있으며, 롱-테일 탈옥 공격에 대한 새로운 사전 방어 전략을 통해 대규모 언어모델의 안정적 활용 가능성을 높이고, 보안 정책의 유연성과 실용성을 동시에 확보할 수 있음을 입증한다.
키워드
Large Language Model Security; Jailbreak Attack; Longtail Jailbreak Attack; Jailbreak Pre-detection
- 제목
- 롱-테일 탈옥 공격 방어를 위한 도메인 탐지기
- 제목 (타언어)
- Domain Detector for defending against Longtail Jailbreak Attack
- 저자
- 장현준; 나현식; 박대얼; 최대선
- 발행일
- 2025-06
- 저널명
- 정보보호학회논문지
- 권
- 35
- 호
- 3
- 페이지
- 623 ~ 638