TL;DR
저자는 외부 검색이나 RAG 없이 prompting만으로 language model의 사실 회수를 개선할 수 있는지 확인하기 위해, 증거 문장의 내용과 개수는 고정하고 순서만 바꾼 통제 실험을 수행했습니다. granite-4.1-3b에서 3840개의 프롬프트 상태를 만들고 정답 확률과 log-odds가 비슷한 상태를 비교한 결과, |delta log-odds|를 2.7263으로 제한한 매칭에서도 응답 행동의 차이가 남았으며 99.9% 클립 뒤에도 2.4193의 효과가 관찰됐습니다. 다만 통제 실험은 하나의 모델과 합성 과제에 한정됐고 full next-token distribution이나 hidden state를 비교하지 않았으므로, 결과는 프롬프트 민감성에 대한 기술적 관찰이지 보편적 메커니즘의 입증은 아닙니다.
실용적 조언
- 재현할 때는 저장소의 단일 Python 실험 파일과 raw outputs를 기준으로 Granite 4.1 3B, raw Hugging Face Transformers, float32 eager attention, use_cache=False, 무샘플링 조건을 먼저 맞추는 편이 적절합니다.
- 결과를 비교할 때는 증거 값과 개수, 문자 길이, baseline token length를 고정하고 증거 라인의 순서만 바꿔야 합니다. 정답 확률만 보지 말고 rank, entropy, log-odds와 생성 결과를 함께 기록해야 프롬프트 상태 간 차이를 재검증할 수 있습니다.
섹션별 상세
용어 해설
- 프롬프트 상태(Prompt State)
- — 같은 모델과 사실 질문이라도 입력 문장의 구성이나 증거 배열이 달라지면서 모델이 다음 토큰을 선택하는 내부·출력 조건이 달라진 상태를 뜻합니다. 이 글에서는 서로 다른 프롬프트 상태의 국소적 확신과 이후 응답 행동을 비교합니다.
- 로그 오즈(Log-Odds)
- — 어떤 선택지의 확률을 그 반대 선택지의 확률과 비교한 값에 로그를 취한 지표입니다. 확률 차이를 단순 비교하는 대신 확신의 상대적 크기를 표현하기 때문에, 저자는 정답 토큰에 대한 프롬프트 상태 간 차이를 맞추는 데 활용했습니다.
- 엔트로피(Entropy)
- — 모델의 다음 토큰 확률 분포가 얼마나 퍼져 있는지를 나타내는 불확실성 지표입니다. 특정 토큰에 확률이 몰리면 값이 낮아지고 여러 후보에 비슷하게 분산되면 높아지며, 이 실험에서는 프롬프트 상태의 국소적 확신을 비교하는 보조 측정값으로 사용됐습니다.
- 교사 강제 다음 토큰 점수화(Teacher-Forced Next-Token Scoring)
- — 정답으로 지정된 이전 토큰을 모델 입력에 계속 제공하면서 다음 토큰의 확률을 계산하는 평가 방식입니다. 자유 생성 결과의 변동을 줄이고, 각 프롬프트 상태에서 특정 정답 토큰을 얼마나 높게 평가하는지 직접 비교하기 위해 사용됐습니다.
- Mixture of Experts
- — 하나의 거대한 신경망을 여러 전문가 블록으로 나누고 입력마다 일부 전문가를 선택해 계산하는 모델 구조입니다. 저자는 Granite의 dense 구조와 별도로 Gemma 4 26B-A4B 같은 MoE 모델에서도 더 넓은 프롬프트 민감성 패턴이 관찰됐다고 적었습니다.
언급된 도구
raw Transformers 환경에서 Granite 4.1 3B의 teacher-forced next-token scoring을 실행하는 데 사용됐습니다.
Gemma 4 26B-A4B를 GGUF 형식으로 실행한 초기 탐색 실험에 사용됐습니다.
실험 코드와 정량 분석의 상당 부분을 작성했으며, 저자와의 대화 과정에서 실험 설계가 구체화됐습니다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.