용어 해설
- 암기-활용 격차(Knowing–Using Gap)
- — 파인튜닝 과정에서 모델이 새로운 사실을 빠르게 암기하지만 그 정보를 다중홉 추론 등 다운스트림 연산에서 즉시 활용하지 못하는 현상으로, 정확도 차이와 일반화 등장 시점의 지연으로 정량화된다.
- 셀프 패칭(Self-Patching)
- — 한 실행(run)의 특정 토큰 위치에서 얻은 은닉 상태를 다른 실행의 특정 계층·위치에 복사하여 삽입하고 출력 변화 ΔI로 인과적 영향을 측정하는 개입 기법으로, 지식의 저장 위치와 계산 경로 정렬 여부를 진단하는 데 사용된다.
- 지식-회로 정렬 불일치(Knowledge–Circuit Misalignment)
- — 파인튜닝으로 저장된 표현이 존재하지만 추론에 필수적인 중간 계층의 계산 경로로 라우팅되지 않아 일반화가 실패하는 상태를 가리키며, 이 상태는 계층 간 패칭으로 역전될 수 있다.
- 액티베이션 패칭(Activation Patching)
- — 한 맥락에서 얻은 내부 활성화(activation)를 다른 맥락의 동일 위치에 삽입해 모델 동작 변화를 관찰하는 실험 기법으로, 표현이 출력에 미치는 인과적 영향력을 측정하는 데 사용된다.
코드 예제
Algorithm 1: Self-patching scan
Input: model M, prompts Ps, Pt, anchor E, answer y*, score I.
For each layer pair (ls, lt):
Locate anchor tokens Ts = T(Ps, E) and Tt = T(Pt, E).
Cache source state z = h^{ls}_{Ts}(Ps).
Run Pt and replace \tilde{h}^{lt}_{Tt} \leftarrow z.
Continue the forward pass to obtain \tilde{M}(Pt).
Record \Delta I = I(\tilde{M}(Pt), y*) - I(M(Pt), y*).
Output: layer-pair map A[ls, lt] = \Delta I.이 코드는 self-patching 스캔 절차를 절차형으로 정리한 의사코드로, 소스 계층의 앵커 토큰 상태를 캐시해 타깃 계층의 동일 위치에 덮어쓰고 출력 정답 지표의 변화 ΔI를 기록하는 흐름을 보여준다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.






