본문으로 건너뛰기

로그잇 기여 점수(LOCOS)를 이용한 비문자적 검색 헤드 식별

대형 언어 모델이 긴 문맥에서 정답을 단어 그대로 복사하지 않고 문맥 의미를 합성해 응답하는 경우가 빈번하다. 이러한 비문자적(non-literal) 검색을 수행하는 attention head를 정확히 찾는 일은 모델 내부 동작을 해석하고 장기 문맥 성능 문제를 고치는 데 핵심적이다. 본 논문은 OV 회로의 쓰기(output-value) 방향이 정답 unembedding에 어떻게 기여하는지를 직접 측정해 기존의 attention 기반 검출이 놓치는 헤드를 발견할 수 있음을 보였다.

용어 해설

OV 회로(OV circuit)
Attention head는 QK 회로로 어디를 읽는지 결정하고 OV 회로로 읽은 표현을 residual stream에 쓴다. 본문에서는 OV 회로가 읽은 위치의 표현을 정답 토큰의 unembedding 방향으로 어떻게 투영하는지가 비문자적(non-literal) 검색의 핵심이라고 설정했다. OV 회로는 어떤 정보를 쓰는지(what)와 어디를 읽는지(where)를 분리해 이해하는 근거가 된다.
로그잇 기여 점수(LOCOS)(Logit-Contribution Scoring (LOCOS))
각 헤드의 위치별 OV 출력이 정답 토큰의 unembedding 방향으로 기여하는 스칼라를 계산해, needle과 off-needle의 기여를 공간적으로 대조하여 점수를 산출하는 방법이다. 이 방식은 한 번의 forward pass로 비문자적 검색 헤드를 탐지할 수 있도록 설계되었다. LOCOS는 attention 기반 검출이 놓치는 '무엇을 쓰는가'를 직접 측정한다.
공간 대조(Spatial Contrast)
정답을 생성하는 시점에서 needle(정답을 포함한 구간)과 동일 길이의 off-needle 영역에 대한 logit 기여를 비교해 그 차이를 점수로 사용하는 집계 방식이다. 이 대조는 동일 디코딩 스텝 내부에서 위치별 기여를 비교하므로 토큰 빈도나 전반적 편향을 상쇄한다. LOCOS의 핵심 집계 규칙으로 단일 정답 스텝으로부터 유의미한 신호를 확보한다.
바늘-건초더미(NIAH)(Needle-in-a-haystack (NIAH))
짧은 정답 스팬(needle)을 긴 방해 문맥(haystack) 안에 삽입해 모델이 정답을 직접 복사할지 의미를 파악해 합성할지를 평가하는 실험 설정이다. NIAH에서는 정답 토큰이 source에 문자 그대로 존재하므로 attention 기반 탐지가 잘 작동한다. 본문은 NIAH와 달리 의미 기반 복원이 필요한 NoLiMa를 중심으로 비문자적 검색을 평가했다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 01.수집 2026. 07. 04.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.