TL;DR
이 글은 Qwen3.6-27B에서 학습된 Jacobian Lens를 113일 뒤 출시된 Qwen3.8-27B에 재학습 없이 적용해 checkpoint 간 전이를 측정했습니다. 40개의 두 단계 추론 prompt에서 layer 48의 잠재 entity median rank는 원래 모델 4, 전이 모델 17이었고, layer 24에서는 전이 모델이 38로 원래 모델의 121보다 높았으며 p < 1e-3가 나왔습니다. WikiText 700개 위치에서는 중간층 비용이 1.2~1.3배, layer 48 부근 비용이 약 2배로 늘어 surface next-token readout의 후반부 손실이 더 컸습니다. 3.6 모델에서 얻은 paradox 계열 방향을 3.8 모델의 layer 18~47 Residual Stream에서 제거하자 paradox 단어는 사라졌지만 Escher 계단의 lithograph, closed loop, illusion 묘사는 유지됐습니다. 한 모델 계열과 한 버전 전이에 국한된 결과이므로 보편적 호환성은 아니지만, release마다 refit을 가정하는 대신 기존 렌즈를 rank와 steering 성능으로 점검하는 monitoring 절차를 뒷받침합니다.
주요 논점
같은 구조와 tokenizer를 유지한 모델 업데이트에서는 기존 Jacobian Lens가 새 checkpoint의 잠재 개념을 어느 정도 계속 읽을 수 있다는 결과입니다. layer별 rank와 개념 제거 실험이 함께 전이를 뒷받침하므로, 매번 refit을 가정하기보다 실제 성능을 측정하는 운영 방식이 합리적입니다.
측정 결과는 Qwen3.6-27B에서 Qwen3.8-27B로 이어지는 한 사례에 한정됩니다. 렌즈의 오적합, 학습 변화, 모델 계열 차이를 분리하지 못했으므로 일반적인 checkpoint transfer 법칙으로 확대하기에는 검증 범위가 부족합니다.
합의점 vs 논쟁점
논쟁점
- 한 번의 모델 업데이트에서 Jacobian Lens가 유지됐다는 결과를 다른 모델 계열이나 더 큰 checkpoint 변화에도 적용할 수 있는지는 확인되지 않았습니다. 같은 tokenizer와 64개 층 구조가 전이에 기여했을 가능성도 남아 있습니다. 따라서 이 결과는 보편적 호환성보다 측정 가능한 전이 사례로 해석하는 편이 안전합니다.
실용적 조언
- 모델 버전이 바뀔 때 기존 Interpretability Lens를 즉시 폐기하거나 그대로 신뢰하지 말고, 고정된 prompt 세트에서 layer별 rank를 먼저 비교하는 절차를 두는 것이 좋습니다. 이 글의 설정처럼 전이 readout과 raw Logit Lens를 같은 모델과 같은 위치에서 평가하면 렌즈 자체의 이점을 분리해 볼 수 있습니다. 40개의 two-hop prompt, WikiText 위치 평가, paired sign test를 monitoring pipeline의 기본 구성으로 활용할 수 있습니다.
- 개념 방향을 이용한 steering을 운영 환경에 적용할 때는 생성 결과에서 목표 개념만 사라졌는지와 주변 의미가 유지됐는지를 함께 확인해야 합니다. 이 실험은 layer 18~47에서 특정 방향을 제거하고도 lithograph, closed loop, illusion 관련 내용이 남는지 점검했습니다. 모델 계열과 버전 간 차이가 커질수록 동일한 방향의 효과가 약해질 수 있으므로, 개념 제거 전후의 출력과 층별 탐지 성능을 함께 기록하는 편이 필요합니다.
섹션별 상세
이미지 분석

상단 표의 주황색 열은 여러 층에서 Jacobian Lens가 paradox 계열 토큰을 높은 순위로 읽는 모습을 나타내며, 하단 표에서는 같은 방향을 Residual Stream에서 제거한 뒤 해당 열이 structure 등 다른 토큰으로 바뀝니다. 두 표의 비교는 오래된 checkpoint에서 얻은 개념 방향이 새 모델의 생성 과정에서도 특정 개념의 표면 출현을 억제할 수 있다는 본문의 steering 결과와 직접 연결됩니다.
Qwen3.6-27B의 렌즈 방향만 사용한 실행과 “paradox” 방향을 제거한 실행에서 층별 토큰 판독 결과를 비교한 표입니다.

이미지는 clean run에서 boxed column의 토큰이 paradox로 유지되는 반면, ablated run에서는 같은 위치가 structure로 바뀌는 패턴을 보여줍니다. 다른 열의 staircase, geometric, illusion 관련 토큰이 상당 부분 남아 있어 개념 단어를 제거하면서도 전체 묘사의 핵심 내용은 유지됐다는 해석을 뒷받침합니다.
모델 실행별 층 단위 top-word 판독과 개념 방향 제거 결과를 나란히 나타낸 실험 표입니다.
용어 해설
- 해석 가능성 렌즈(Interpretability Lens)
- — 모델 내부의 특정 표현이나 계산을 사람이 읽을 수 있는 토큰 예측 또는 개념 방향으로 변환하는 분석 도구입니다. 특정 checkpoint에 맞춰 학습되므로 모델 버전이 바뀌어도 같은 내부 표현을 읽는지는 별도 검증이 필요합니다.
- Jacobian 렌즈(Jacobian Lens)
- — 모델의 중간 residual stream이 최종 출력에 미치는 변화를 Jacobian 방향으로 읽어 내부의 잠재 개념이나 다음 토큰 정보를 추정하는 렌즈입니다. 이 글에서는 Qwen3.6-27B에서 얻은 방향을 Qwen3.8-27B에 그대로 적용해 checkpoint 간 전달성을 측정합니다.
- Logit 렌즈(Logit Lens)
- — 중간층의 hidden state를 최종 출력층에 직접 통과시켜 각 층에서 어떤 토큰이 예측되는지 읽는 방법입니다. 글의 실험에서는 Jacobian 렌즈의 기준선으로 사용됐으며, 두 모델의 중간층에서 잠재 entity를 낮은 순위로만 찾았습니다.
- Residual Stream
- — Transformer 층 사이에서 여러 attention 및 MLP 계산 결과가 누적되는 표현 경로입니다. 실험에서는 특정 개념 방향을 이 공간에서 직교화한 뒤 일부 층의 표현에서 제거해 생성 결과의 개념 출현 여부를 확인했습니다.
- Teacher Forcing
- — 정답 시퀀스의 이전 토큰을 입력으로 사용하면서 각 위치의 다음 토큰 예측을 평가하는 방식입니다. WikiText 700개 위치에서 이 방식으로 측정한 결과, checkpoint를 옮긴 Jacobian readout의 비용이 중간층에서 1.2~1.3배, 48층 부근에서 약 2배가 됐습니다.
언급된 도구
Qwen3.6-27B용으로 공개된 Jacobian Lens와 관련 자료의 출처로 사용됐습니다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
