본문으로 건너뛰기
HF Daily Papers조회 1

LLM 예측기의 내부 표현을 이용한 보정·감사와 거짓 탐지

representation-pooling 프로브가 LLM 예측의 캘리브레이션과 거짓 탐지에서 행동 기반 추론보다 우수하며 84% 방향 예측과 질문 라우팅으로 30–47% 토큰 절감이 관찰됐다.

용어 해설

내부 표현 프로빙(Representation Probing)
모델의 중간 활성화(activation)를 집계하여 분류기나 회귀기를 학습시킴으로써 모델의 숨겨진 신호를 읽어내는 기법이다. 본문에서는 중간 층의 활성화를 pooling하여 예측의 신뢰도나 행동 변화를 추정하는 데 사용되며 출력 확률만으로는 포착하기 어려운 불확실성 표지를 포착하는 수단으로 중요하다.
사고 흐름(Chain-of-Thought)(Chain-of-Thought)
모델이 내부적으로 생성하는 단계적 추론 텍스트를 의미하며 사람이 이해 가능한 추론 경로를 제공하는 역할을 한다. 이 논문에서는 Chain-of-Thought(trace)가 프롬프트 조작에 대해 항상 민감하지 않음을 보이는 비교 대상으로 사용되어 추론의 '진실성'을 평가하는 핵심 개념으로 쓰였다.
모델 캘리브레이션(Calibration)
모델이 예측한 확률과 실제 정답률 간의 일치성을 측정하는 개념으로, 확률 값이 실제 발생률을 얼마나 잘 반영하는지 평가한다. 본문에서는 출력 확률에 기초한 캘리브레이션과 내부 표현 기반 프로브의 캘리브레이션을 비교하여 후자가 더 우수함을 보였다.
근거 제거 실험(Evidence Ablation)
프롬프트에서 특정 근거 문장을 제거하여 그 제거가 모델 예측과 추론 기록에 미치는 영향을 관찰하는 실험적 기법이다. 본문에서는 이 기법을 통해 Chain-of-Thought가 근거 제거의 영향을 드러내지 못하는 사례와 내부 표현의 민감성을 대조했다.
강제 응답 패스(Forced Answering)
정식 추론(Chain-of-Thought)을 시작하기 전에 모델에 한 번의 전처리 패스를 수행하여 이미 결정된 답변 분포와 신뢰도를 회복하는 절차이다. 본문에서는 이 사전 패스가 실제로 모델의 '커밋된' 응답을 재현하며 이를 이용한 라우팅으로 토큰을 절감할 수 있음이 관찰됐다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 09.수집 2026. 07. 16.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.