본문으로 건너뛰기

다중 턴 대화에서 숨겨진 악성 의도 탐지와 차단: TurnGate

다중 턴 대화에서 악성 의도가 누적되어 실행 가능한 피해로 확산될 수 있다. 기존 시스템은 주로 단일 턴의 의도 탐지에 의존하는 반면, TurnGate는 각 턴별 신호를 분석해 최초의 해로운 지점을 식별하고 차단한다. MTID 데이터셋과 실험을 통해 TurnGate의 강건성이 다양한 도메인·공격 경로·대상 모델에서도 유지됨을 보인다.

용어 해설

해로운 작동 가능점 닫힘 지점(harm-enabling closure point)
다중 턴 대화에서 공격자가 악의 의도에 의해 피해를 유발할 수 있는 시나리오가 최조로 결정되는 턴 지점을 의미한다. 이 지점 이후에는 이미 누적된 맥락이 악용될 가능성이 커지므로 차단의 필요성이 커진다.
턴 레벨 개입(turn-level intervention)
각 턴에서 위험 신호를 탐지하고 대응하는 기능으로, harm-enabling closure point에 도달하기 전에 차단할 수 있도록 설계된다.
MTID(다중 턴 의도 데이터셋)(MTID (Multi-Turn Intent Dataset))
MTID는 악의 의도 롤아웃과 벤치마크에 필요한 악의 의도 턴 시퀀스, benign hard negatives, earliest harm-enabling turns를 주석한 데이터셋이다.
과도한 거부(over-refusal)
benign한 대화에서도 지나치게 거부하는 경향을 가리키며, 사용자 경험을 해치지 않으면서도 해로운 의도를 차단하는 균형이 필요하다.
가드레일(guardrails)
모델의 거부 정책 및 안전 규칙 프레임워크로, 악성 의도 탐지 및 차단의 실전 적용 시 일관된 대답 흐름을 보장한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 12.수집 2026. 05. 14.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.