본문으로 건너뛰기

토큰별 증류로 적응형 프롬프트 인젝션 방어

SecOPD는 깨끗한 입력의 교사 확률로 공격 응답의 토큰별 학습 신호를 만들어 PISmith ASR을 9.0%로 낮췄다.

용어 해설

프롬프트 인젝션(Prompt Injection)
웹사이트·파일·이메일 같은 신뢰할 수 없는 외부 데이터에 공격자가 지시문을 삽입해 AI 에이전트의 행동을 바꾸려는 공격이다. 모델은 외부 데이터를 맥락으로 사용하되 그 안의 지시를 명령으로 실행하지 않아야 한다.
적응형 공격(Adaptive Attack)
방어 모델의 프롬프트 형식과 반응을 고려해 공격 문구를 반복적으로 최적화하는 공격이다. 고정된 공격 문구보다 방어 모델에 맞춘 변형을 사용하므로 정적 평가보다 실제 취약성을 엄격하게 측정한다.
온폴리시 증류(On-Policy Distillation)
학생 모델이 자신의 정책으로 생성한 출력에 대해 교사 모델이 토큰별 확률 정보를 제공하고, 학생이 교사의 분포를 따르도록 학습하는 방법이다. 전체 응답 하나가 아니라 각 토큰에 학습 신호를 배정한다.
토큰 수준 피드백(Token-Level Feedback)
모델 출력 전체에 하나의 보상을 주는 대신 생성된 각 토큰의 적절성을 따로 평가하는 학습 신호다. 한 응답 안에서도 정상 작업에 기여한 토큰은 유지하고 공격 지시를 따른 토큰은 억제할 수 있다.
공격 성공률(Attack Success Rate)
공격 입력이 의도한 목표를 모델에게 실행시키는 비율이다. 값이 낮을수록 방어 성능이 높으며, 이 논문에서는 SEP와 AgentDojo에서 공격 성공 여부를 집계해 백분율로 표현한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 21.수집 2026. 08. 27.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.