TL;DR
Jailbreak 프롬프트는 안전장치를 회피해 유해 출력을 유발하므로 실전 배포에서 탐지가 필수다. 본 논문은 추가 학습 없이도 모델 내부의 중간층 토큰별 예측 엔트로피 궤적에서 구조적 신호를 찾아 안전 모니터링 근거를 제공한다.
왜 중요한가
Jailbreak 프롬프트는 안전장치를 회피해 유해 출력을 유발하므로 실전 배포에서 탐지가 필수다. 본 논문은 추가 학습 없이도 모델 내부의 중간층 토큰별 예측 엔트로피 궤적에서 구조적 신호를 찾아 안전 모니터링 근거를 제공한다.
핵심 기여
Training-free 분석 프레임워크
Frozen LLM의 intermediate activations를 logit lens로 투사해 token-level predictive entropy 궤적을 계산하고, 이로부터 학습 없는 연속형 탐지 점수를 산출하는 파이프라인을 구축했다.
정적 통계보다 동적 추세가 더 판별력 있음
Prompt-level 평균·분산 같은 static features는 모델 간 스케일 의존성이 커서 일관된 신호를 제공하지 못했고, 반면 Kendall’s τ, Spearman’s ρ, monotonicity 같은 rank‑based trend features가 jailbreak과 benign을 안정적으로 분리했다.
신호의 깊이 의존성 규명
해당 판별 신호가 네트워크 전체에 균등하지 않고 중간(intermediate) 층(대략 50–85% depth)에 집중되며 최종 출력층에서 약화됨을 실험적으로 확인했다.
다양한 모델·벤치마크에서의 일관성
Llama-3.1-8B, Qwen3-8B, Gemma-7b와 AdvBench/HarmBench/StrongREJECT 등 벤치마크에서 학습 없이도 rank‑based features가 건축학적 일관성을 보였다.
핵심 아이디어 이해하기
Transformer는 각 토큰 위치에서 hidden state를 형성하고, 최종 layer의 unembedding과 softmax를 거쳐 다음 토큰 확률을 출력한다. 이때 softmax( z ) 연산은 각 단어별 logit z_i에 대해 e^{z_i}/Σ_j e^{z_j}를 계산한다. 큰 logit은 지수 함수에 의해 더 크게 강조되어 확률 분포에서 우세한 항목을 만들고, 합이 1이 되어 확률로 해석된다. 이 기본 메커니즘 때문에 중간 표현을 어휘 공간으로 투사하면 해당 시점의 '다음 토큰에 대한 모델의 믿음과 불확실성'을 측정할 수 있다.
방법론
전체 접근 방식: 입력 프롬프트 x = (x_1,...,x_T)를 한 번의 forward pass로 처리한 뒤, K=8개의 probe layers에서 각 토큰 위치 t의 hidden state h_t^{(ℓ)}를 최종 unembedding W_U에 곱해 logit z_t^{(ℓ)} = W_U h_t^{(ℓ)}를 얻는다. 그 후 softmax(z_t^{(ℓ)})로 확률 분포 p^{(ℓ)}(·|x_{<t})를 계산하고 Shannon entropy H_t^{(ℓ)} = -Σ_v p(v) log p(v)를 구해 token-level entropy trace H^{(ℓ)} = (H_1^{(ℓ)},...,H_{T-1}^{(ℓ)})를 구성한다.
주요 결과
메인 벤치마크: 대표적 성능으로 ∼69% depth 층에서 Llama-3.1-8B와 Qwen3-8B의 monotonicity mean AUROC가 0.941으로 보고되었다(Llama 평균 0.941, Qwen3 평균 0.941, Gemma-7b는 0.759). Kendall’s τ와 Spearman’s ρ는 세 모델에서 각각 평균 AUROC 약 0.782~0.800 범위를 보였다. Static features(mean, max 등)는 모델별로 최대 0.272까지 변동하며 일관성 결여를 보였다.
기술 상세
아키텍처 구조: 대상 모델은 Transformer 기반의 LLM(Llama-3.1-8B:32 layers, Qwen3-8B:36 layers, Gemma-7b:28 layers). 각 probe layer ℓ에서 hidden state h_t^{(ℓ)}∈ℝ^d를 최종 unembedding W_U∈ℝ^{|V|×d}에 곱해 vocab logits z_t^{(ℓ)} = W_U h_t^{(ℓ)}를 얻고 softmax로 확률을 계산한다. 이 과정은 logit lens 적용이며 추가 파라미터 업데이트 없이 수행된다.
한계점
논문에 명시된 한계: (1) 중간층 활성화에 대한 white-box 접근이 필요해 엄격한 black-box 배포에서는 적용 불가; (2) benign 프롬프트 분포가 adversarial 구조와 겹치면 분리 성능이 크게 저하됨(JailbreakBench benign 결과); (3) logit lens는 representation misalignment로 인해 왜곡을 초래할 수 있으며, fine-tuned lens가 필요한 경우가 있을 수 있음; (4) 더 크거나 다른 정렬을 거친 LLM에서는 다른 엔트로피 동역학이 나타날 수 있어 일반화가 제한될 수 있음.
실무 활용
코드와 실험 구성은 공개되어 있어, 화이트박스 접근이 가능한 환경에서 실시간 안전 모니터링 보조 신호로 사용 가능하다. 다만 JailbreakBench benign 같이 구조적으로 유사한 benign 분포에서는 분리 성능이 급격히 저하되어 보완 신호와 결합이 필요하다.
- 화이트박스 환경에서 입력 프롬프트의 중간층 엔트로피 궤적을 실시간 산출해 jailbreak 의심 프롬프트를 랭킹·우선 차단
- 안전 파이프라인에서 output-based 검사와 결합하여 false positive/negative를 줄이는 보조 피쳐로 사용
- 모델 진단 용도: 특정 층에서의 엔트로피 트렌드가 어떻게 형성되는지 분석해 안전 훈련 효과 검증
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Logit Lens
- — 중간 hidden state를 최종 unembedding 행렬(W_U)에 투사해 각 층에서의 다음 토큰 분포를 얻는 기법이다. W_U · h_t^{(ℓ)} 연산으로 벡터를 어휘 공간으로 변환하고 softmax로 확률을 계산하여 중간층의 '예측'과 불확실성을 측정하는 데 사용된다.
- Predictive Entropy
- — 각 토큰 위치에서 모델이 예측하는 다음 토큰 분포의 Shannon entropy이다. 분포 p(v)에서 -Σ_v p(v) log p(v)를 계산해 불확실성 크기를 수치화하며, 토큰별 불확실성 궤적을 통해 입력이 유해(jailbreak)인지 여부의 동적 신호를 포착한다.
- Rank-based Trend Measures
- — 토큰별 엔트로피 시계열의 순위 상관 구조를 측정하는 지표군이다. 예: Kendall’s τ, Spearman’s ρ. 엔트로피 절대값 대신 위치에 따른 증가/감소 경향을 포착해 모델 간 스케일 차이 영향을 줄이고 구조적 패턴을 비교 가능하게 만든다.
- Intermediate Layer
- — Transformer의 입력에서 출력으로 가는 중간 단계에 해당하는 층들이다. 본 논문에서는 중간층의 hidden state를 logit lens로 투사해 토큰별 predictive entropy 궤적을 추출했고, jailbreak 관련 구조는 주로 중간층에서 가장 뚜렷하게 관찰된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

