용어 해설
- 해로운 작동 가능점 닫힘 지점(harm-enabling closure point)
- — 다중 턴 대화에서 공격자가 악의 의도에 의해 피해를 유발할 수 있는 시나리오가 최조로 결정되는 턴 지점을 의미한다. 이 지점 이후에는 이미 누적된 맥락이 악용될 가능성이 커지므로 차단의 필요성이 커진다.
- 턴 레벨 개입(turn-level intervention)
- — 각 턴에서 위험 신호를 탐지하고 대응하는 기능으로, harm-enabling closure point에 도달하기 전에 차단할 수 있도록 설계된다.
- MTID(다중 턴 의도 데이터셋)(MTID (Multi-Turn Intent Dataset))
- — MTID는 악의 의도 롤아웃과 벤치마크에 필요한 악의 의도 턴 시퀀스, benign hard negatives, earliest harm-enabling turns를 주석한 데이터셋이다.
- 과도한 거부(over-refusal)
- — benign한 대화에서도 지나치게 거부하는 경향을 가리키며, 사용자 경험을 해치지 않으면서도 해로운 의도를 차단하는 균형이 필요하다.
- 가드레일(guardrails)
- — 모델의 거부 정책 및 안전 규칙 프레임워크로, 악성 의도 탐지 및 차단의 실전 적용 시 일관된 대답 흐름을 보장한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.




