용어 해설
- 프롬프트 인젝션(Prompt Injection)
- — 웹사이트·파일·이메일 같은 신뢰할 수 없는 외부 데이터에 공격자가 지시문을 삽입해 AI 에이전트의 행동을 바꾸려는 공격이다. 모델은 외부 데이터를 맥락으로 사용하되 그 안의 지시를 명령으로 실행하지 않아야 한다.
- 적응형 공격(Adaptive Attack)
- — 방어 모델의 프롬프트 형식과 반응을 고려해 공격 문구를 반복적으로 최적화하는 공격이다. 고정된 공격 문구보다 방어 모델에 맞춘 변형을 사용하므로 정적 평가보다 실제 취약성을 엄격하게 측정한다.
- 온폴리시 증류(On-Policy Distillation)
- — 학생 모델이 자신의 정책으로 생성한 출력에 대해 교사 모델이 토큰별 확률 정보를 제공하고, 학생이 교사의 분포를 따르도록 학습하는 방법이다. 전체 응답 하나가 아니라 각 토큰에 학습 신호를 배정한다.
- 토큰 수준 피드백(Token-Level Feedback)
- — 모델 출력 전체에 하나의 보상을 주는 대신 생성된 각 토큰의 적절성을 따로 평가하는 학습 신호다. 한 응답 안에서도 정상 작업에 기여한 토큰은 유지하고 공격 지시를 따른 토큰은 억제할 수 있다.
- 공격 성공률(Attack Success Rate)
- — 공격 입력이 의도한 목표를 모델에게 실행시키는 비율이다. 값이 낮을수록 방어 성능이 높으며, 이 논문에서는 SEP와 AgentDojo에서 공격 성공 여부를 집계해 백분율로 표현한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.