본문으로 건너뛰기

프롬프트 순서가 사실 회수 행동을 바꾸는 실험

증거 순서만 바꿔도 비슷한 확률의 프롬프트 상태가 다른 응답을 낳았다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

저자는 외부 검색이나 RAG 없이 prompting만으로 language model의 사실 회수를 개선할 수 있는지 확인하기 위해, 증거 문장의 내용과 개수는 고정하고 순서만 바꾼 통제 실험을 수행했습니다. granite-4.1-3b에서 3840개의 프롬프트 상태를 만들고 정답 확률과 log-odds가 비슷한 상태를 비교한 결과, |delta log-odds|를 2.7263으로 제한한 매칭에서도 응답 행동의 차이가 남았으며 99.9% 클립 뒤에도 2.4193의 효과가 관찰됐습니다. 다만 통제 실험은 하나의 모델과 합성 과제에 한정됐고 full next-token distribution이나 hidden state를 비교하지 않았으므로, 결과는 프롬프트 민감성에 대한 기술적 관찰이지 보편적 메커니즘의 입증은 아닙니다.

실용적 조언

  • 재현할 때는 저장소의 단일 Python 실험 파일과 raw outputs를 기준으로 Granite 4.1 3B, raw Hugging Face Transformers, float32 eager attention, use_cache=False, 무샘플링 조건을 먼저 맞추는 편이 적절합니다.
  • 결과를 비교할 때는 증거 값과 개수, 문자 길이, baseline token length를 고정하고 증거 라인의 순서만 바꿔야 합니다. 정답 확률만 보지 말고 rank, entropy, log-odds와 생성 결과를 함께 기록해야 프롬프트 상태 간 차이를 재검증할 수 있습니다.

섹션별 상세

01
저자는 RAG나 웹 검색으로 외부 근거를 주입하는 대신, 모델 가중치에 저장된 사실을 순수 prompting만으로 더 정확하게 회수할 수 있는지 확인하려고 실험을 시작했습니다. 최종 실험은 ibm-granite/granite-4.1-3b를 raw Hugging Face Transformers에서 float32 eager attention, use_cache=False, 무샘플링 조건으로 실행했습니다. 자유 생성 대신 teacher-forced next-token scoring으로 다음 토큰 확률을 측정해 프롬프트 변화가 사실 회수에 미치는 영향을 분리하려 했습니다. 이 접근은 외부 검색을 붙인 시스템의 성능이 아니라 모델 자체의 프롬프트 조건 민감성을 측정한다는 점에 의미가 있습니다.
02
동일한 사실 집합을 유지한 채 증거 문장의 순서만 바꾸면 모델의 행동이 크게 달라지는지가 핵심 관찰이었습니다. 예를 들어 K7에 연결된 이름들의 동일한 멀티셋을 여러 순서로 배열하고, 각 증거군에 대해 768개의 무작위 순열을 생성해 다섯 개 증거군에서 총 3840개의 baseline prompt state를 만들었습니다. 문장 값과 개수, 문자 길이, baseline token length는 같았지만 순서가 달랐고, 그중 국소 확신이 매우 비슷한 상태끼리 짝을 지어 응답 차이를 비교했습니다. 결과는 프롬프트의 작은 비내용적 변화가 정답 확률만으로는 예상하기 어려운 행동 차이와 연결될 수 있음을 시사했습니다.
03
국소 측정에서 rank=1이고 정답 확률이 0.80에서 0.995 사이인 상태들을 매칭했으며, |delta log-odds| 기준은 2.7263이었습니다. 99.9% 클립으로 더 엄격하게 제한해도 차이는 2.4193으로 줄었을 뿐 사라지지 않았습니다. 저자는 같은 넓은 패턴이 서로 다른 코드, backend, CPU-GPU 조건과 모델 구조에서 반복됐다고 적었지만, 통제된 무작위 순서 실험 자체는 Granite 4.1 3B에서만 수행했습니다. 따라서 수치는 프롬프트 상태와 응답 기하의 관계를 보여주는 기술적 근거이지만, 모든 language model에 적용되는 보편 법칙으로 확장되지는 않았습니다.
04
커뮤니티에 공유된 글의 핵심 쟁점은 관찰된 효과와 그 원인을 구분해야 한다는 점입니다. 실험은 확률·로그 오즈·엔트로피·rank를 이용했지만 완전한 다음 토큰 분포나 hidden state를 맞춘 것은 아니며, 내부 메커니즘도 밝혀지지 않았습니다. 합성 이름과 손으로 설계한 perturbation을 사용했고, 다른 모델과 증거군, 전체 분포 매칭 같은 추가 통제가 남아 있습니다. 저자는 재현 가능한 작은 실험으로 범위를 제한하는 대신, 결과를 기술적 묘사 수준의 근거로 제시했습니다.

용어 해설

프롬프트 상태(Prompt State)
같은 모델과 사실 질문이라도 입력 문장의 구성이나 증거 배열이 달라지면서 모델이 다음 토큰을 선택하는 내부·출력 조건이 달라진 상태를 뜻합니다. 이 글에서는 서로 다른 프롬프트 상태의 국소적 확신과 이후 응답 행동을 비교합니다.
로그 오즈(Log-Odds)
어떤 선택지의 확률을 그 반대 선택지의 확률과 비교한 값에 로그를 취한 지표입니다. 확률 차이를 단순 비교하는 대신 확신의 상대적 크기를 표현하기 때문에, 저자는 정답 토큰에 대한 프롬프트 상태 간 차이를 맞추는 데 활용했습니다.
엔트로피(Entropy)
모델의 다음 토큰 확률 분포가 얼마나 퍼져 있는지를 나타내는 불확실성 지표입니다. 특정 토큰에 확률이 몰리면 값이 낮아지고 여러 후보에 비슷하게 분산되면 높아지며, 이 실험에서는 프롬프트 상태의 국소적 확신을 비교하는 보조 측정값으로 사용됐습니다.
교사 강제 다음 토큰 점수화(Teacher-Forced Next-Token Scoring)
정답으로 지정된 이전 토큰을 모델 입력에 계속 제공하면서 다음 토큰의 확률을 계산하는 평가 방식입니다. 자유 생성 결과의 변동을 줄이고, 각 프롬프트 상태에서 특정 정답 토큰을 얼마나 높게 평가하는지 직접 비교하기 위해 사용됐습니다.
Mixture of Experts
하나의 거대한 신경망을 여러 전문가 블록으로 나누고 입력마다 일부 전문가를 선택해 계산하는 모델 구조입니다. 저자는 Granite의 dense 구조와 별도로 Gemma 4 26B-A4B 같은 MoE 모델에서도 더 넓은 프롬프트 민감성 패턴이 관찰됐다고 적었습니다.

언급된 도구

Hugging Face Transformers중립

raw Transformers 환경에서 Granite 4.1 3B의 teacher-forced next-token scoring을 실행하는 데 사용됐습니다.

llama.cpp중립

Gemma 4 26B-A4B를 GGUF 형식으로 실행한 초기 탐색 실험에 사용됐습니다.

ChatGPT중립

실험 코드와 정량 분석의 상당 부분을 작성했으며, 저자와의 대화 과정에서 실험 설계가 구체화됐습니다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 19.수집 2026. 08. 19.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.