용어 해설
- OV 회로(OV circuit)
- — Attention head는 QK 회로로 어디를 읽는지 결정하고 OV 회로로 읽은 표현을 residual stream에 쓴다. 본문에서는 OV 회로가 읽은 위치의 표현을 정답 토큰의 unembedding 방향으로 어떻게 투영하는지가 비문자적(non-literal) 검색의 핵심이라고 설정했다. OV 회로는 어떤 정보를 쓰는지(what)와 어디를 읽는지(where)를 분리해 이해하는 근거가 된다.
- 로그잇 기여 점수(LOCOS)(Logit-Contribution Scoring (LOCOS))
- — 각 헤드의 위치별 OV 출력이 정답 토큰의 unembedding 방향으로 기여하는 스칼라를 계산해, needle과 off-needle의 기여를 공간적으로 대조하여 점수를 산출하는 방법이다. 이 방식은 한 번의 forward pass로 비문자적 검색 헤드를 탐지할 수 있도록 설계되었다. LOCOS는 attention 기반 검출이 놓치는 '무엇을 쓰는가'를 직접 측정한다.
- 공간 대조(Spatial Contrast)
- — 정답을 생성하는 시점에서 needle(정답을 포함한 구간)과 동일 길이의 off-needle 영역에 대한 logit 기여를 비교해 그 차이를 점수로 사용하는 집계 방식이다. 이 대조는 동일 디코딩 스텝 내부에서 위치별 기여를 비교하므로 토큰 빈도나 전반적 편향을 상쇄한다. LOCOS의 핵심 집계 규칙으로 단일 정답 스텝으로부터 유의미한 신호를 확보한다.
- 바늘-건초더미(NIAH)(Needle-in-a-haystack (NIAH))
- — 짧은 정답 스팬(needle)을 긴 방해 문맥(haystack) 안에 삽입해 모델이 정답을 직접 복사할지 의미를 파악해 합성할지를 평가하는 실험 설정이다. NIAH에서는 정답 토큰이 source에 문자 그대로 존재하므로 attention 기반 탐지가 잘 작동한다. 본문은 NIAH와 달리 의미 기반 복원이 필요한 NoLiMa를 중심으로 비문자적 검색을 평가했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.





