용어 해설
- 내부 표현 프로빙(Representation Probing)
- — 모델의 중간 활성화(activation)를 집계하여 분류기나 회귀기를 학습시킴으로써 모델의 숨겨진 신호를 읽어내는 기법이다. 본문에서는 중간 층의 활성화를 pooling하여 예측의 신뢰도나 행동 변화를 추정하는 데 사용되며 출력 확률만으로는 포착하기 어려운 불확실성 표지를 포착하는 수단으로 중요하다.
- 사고 흐름(Chain-of-Thought)(Chain-of-Thought)
- — 모델이 내부적으로 생성하는 단계적 추론 텍스트를 의미하며 사람이 이해 가능한 추론 경로를 제공하는 역할을 한다. 이 논문에서는 Chain-of-Thought(trace)가 프롬프트 조작에 대해 항상 민감하지 않음을 보이는 비교 대상으로 사용되어 추론의 '진실성'을 평가하는 핵심 개념으로 쓰였다.
- 모델 캘리브레이션(Calibration)
- — 모델이 예측한 확률과 실제 정답률 간의 일치성을 측정하는 개념으로, 확률 값이 실제 발생률을 얼마나 잘 반영하는지 평가한다. 본문에서는 출력 확률에 기초한 캘리브레이션과 내부 표현 기반 프로브의 캘리브레이션을 비교하여 후자가 더 우수함을 보였다.
- 근거 제거 실험(Evidence Ablation)
- — 프롬프트에서 특정 근거 문장을 제거하여 그 제거가 모델 예측과 추론 기록에 미치는 영향을 관찰하는 실험적 기법이다. 본문에서는 이 기법을 통해 Chain-of-Thought가 근거 제거의 영향을 드러내지 못하는 사례와 내부 표현의 민감성을 대조했다.
- 강제 응답 패스(Forced Answering)
- — 정식 추론(Chain-of-Thought)을 시작하기 전에 모델에 한 번의 전처리 패스를 수행하여 이미 결정된 답변 분포와 신뢰도를 회복하는 절차이다. 본문에서는 이 사전 패스가 실제로 모델의 '커밋된' 응답을 재현하며 이를 이용한 라우팅으로 토큰을 절감할 수 있음이 관찰됐다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.