본문으로 건너뛰기

Qwen checkpoint 사이에서 Jacobian Lens가 살아남는가

Qwen3.6-27B의 Jacobian Lens가 Qwen3.8-27B에서도 잠재 개념을 읽고 steering까지 수행했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이 글은 Qwen3.6-27B에서 학습된 Jacobian Lens를 113일 뒤 출시된 Qwen3.8-27B에 재학습 없이 적용해 checkpoint 간 전이를 측정했습니다. 40개의 두 단계 추론 prompt에서 layer 48의 잠재 entity median rank는 원래 모델 4, 전이 모델 17이었고, layer 24에서는 전이 모델이 38로 원래 모델의 121보다 높았으며 p < 1e-3가 나왔습니다. WikiText 700개 위치에서는 중간층 비용이 1.2~1.3배, layer 48 부근 비용이 약 2배로 늘어 surface next-token readout의 후반부 손실이 더 컸습니다. 3.6 모델에서 얻은 paradox 계열 방향을 3.8 모델의 layer 18~47 Residual Stream에서 제거하자 paradox 단어는 사라졌지만 Escher 계단의 lithograph, closed loop, illusion 묘사는 유지됐습니다. 한 모델 계열과 한 버전 전이에 국한된 결과이므로 보편적 호환성은 아니지만, release마다 refit을 가정하는 대신 기존 렌즈를 rank와 steering 성능으로 점검하는 monitoring 절차를 뒷받침합니다.

주요 논점

01찬성소수

같은 구조와 tokenizer를 유지한 모델 업데이트에서는 기존 Jacobian Lens가 새 checkpoint의 잠재 개념을 어느 정도 계속 읽을 수 있다는 결과입니다. layer별 rank와 개념 제거 실험이 함께 전이를 뒷받침하므로, 매번 refit을 가정하기보다 실제 성능을 측정하는 운영 방식이 합리적입니다.

02중립소수

측정 결과는 Qwen3.6-27B에서 Qwen3.8-27B로 이어지는 한 사례에 한정됩니다. 렌즈의 오적합, 학습 변화, 모델 계열 차이를 분리하지 못했으므로 일반적인 checkpoint transfer 법칙으로 확대하기에는 검증 범위가 부족합니다.

합의점 vs 논쟁점

논쟁점

  • 한 번의 모델 업데이트에서 Jacobian Lens가 유지됐다는 결과를 다른 모델 계열이나 더 큰 checkpoint 변화에도 적용할 수 있는지는 확인되지 않았습니다. 같은 tokenizer와 64개 층 구조가 전이에 기여했을 가능성도 남아 있습니다. 따라서 이 결과는 보편적 호환성보다 측정 가능한 전이 사례로 해석하는 편이 안전합니다.

실용적 조언

  • 모델 버전이 바뀔 때 기존 Interpretability Lens를 즉시 폐기하거나 그대로 신뢰하지 말고, 고정된 prompt 세트에서 layer별 rank를 먼저 비교하는 절차를 두는 것이 좋습니다. 이 글의 설정처럼 전이 readout과 raw Logit Lens를 같은 모델과 같은 위치에서 평가하면 렌즈 자체의 이점을 분리해 볼 수 있습니다. 40개의 two-hop prompt, WikiText 위치 평가, paired sign test를 monitoring pipeline의 기본 구성으로 활용할 수 있습니다.
  • 개념 방향을 이용한 steering을 운영 환경에 적용할 때는 생성 결과에서 목표 개념만 사라졌는지와 주변 의미가 유지됐는지를 함께 확인해야 합니다. 이 실험은 layer 18~47에서 특정 방향을 제거하고도 lithograph, closed loop, illusion 관련 내용이 남는지 점검했습니다. 모델 계열과 버전 간 차이가 커질수록 동일한 방향의 효과가 약해질 수 있으므로, 개념 제거 전후의 출력과 층별 탐지 성능을 함께 기록하는 편이 필요합니다.

섹션별 상세

이 글은 특정 checkpoint에 맞춘 Interpretability Lens가 모델 업데이트 뒤에도 작동하는지 Qwen3.6-27B와 Qwen3.8-27B 사이에서 측정했습니다. 두 모델은 64개 층, 같은 hidden dimension, 같은 tokenizer를 공유하지만 출시 시점은 113일 차이이며 학습 관계는 공개되지 않았습니다. 40개의 두 단계 추론 prompt와 WikiText 700개 위치를 사용해 전이된 Jacobian readout과 raw Logit Lens를 함께 비교했습니다.
전이된 Jacobian Lens는 새 모델에서도 prompt에 직접 나오지 않은 중간 entity를 높은 순위로 회수했습니다. layer 48의 median rank는 원래 모델에서 4, 전이 모델에서 17이었고, layer 24에서는 각각 121과 38로 전이 모델이 더 나았으며 paired sign test에서 p < 1e-3가 나왔습니다. 반면 raw Logit Lens는 같은 구간에서 두 모델 모두 대략 1e3~1e4 순위에 머물러, 단순한 중간 hidden state 투영보다 Jacobian readout의 전이가 유리한 결과를 보였습니다.
3.6 모델에서 얻은 “paradox”, “paradoxical”, 悖论, 矛盾 방향을 층별로 직교화한 뒤 3.8 모델의 Residual Stream에서 layer 18~47에 걸쳐 제거했습니다. 그 결과 두 모델 모두 “Describe Escher’s impossible staircase”에 대한 생성에서 paradox라는 단어가 사라졌지만 lithograph, closed loop, illusion에 해당하는 설명의 일관성은 유지됐습니다. 오래된 checkpoint에서 추출한 방향이 새 checkpoint에서도 해당 개념을 찾아 개입할 수 있다는 결과입니다.
실험 범위는 하나의 Jacobian Lens 계열, 하나의 Qwen 모델 계열, 한 번의 버전 전이로 제한됩니다. 따라서 렌즈의 오적합과 모델 변화의 효과를 완전히 분리하지 못하고, 다른 모델 계열이나 더 큰 버전 차이에 대한 결론도 내리지 않습니다. 다만 lens를 매 release마다 무조건 다시 맞추기보다 rank와 steering 성능을 자동 점검하는 monitoring pipeline을 구성할 실증적 근거를 제공합니다.

이미지 분석

Qwen3.6-27B의 렌즈 방향만 사용한 실행과 “paradox” 방향을 제거한 실행에서 층별 토큰 판독 결과를 비교한 표입니다.
Chart

상단 표의 주황색 열은 여러 층에서 Jacobian Lens가 paradox 계열 토큰을 높은 순위로 읽는 모습을 나타내며, 하단 표에서는 같은 방향을 Residual Stream에서 제거한 뒤 해당 열이 structure 등 다른 토큰으로 바뀝니다. 두 표의 비교는 오래된 checkpoint에서 얻은 개념 방향이 새 모델의 생성 과정에서도 특정 개념의 표면 출현을 억제할 수 있다는 본문의 steering 결과와 직접 연결됩니다.

Qwen3.6-27B의 렌즈 방향만 사용한 실행과 “paradox” 방향을 제거한 실행에서 층별 토큰 판독 결과를 비교한 표입니다.

모델 실행별 층 단위 top-word 판독과 개념 방향 제거 결과를 나란히 나타낸 실험 표입니다.
Chart

이미지는 clean run에서 boxed column의 토큰이 paradox로 유지되는 반면, ablated run에서는 같은 위치가 structure로 바뀌는 패턴을 보여줍니다. 다른 열의 staircase, geometric, illusion 관련 토큰이 상당 부분 남아 있어 개념 단어를 제거하면서도 전체 묘사의 핵심 내용은 유지됐다는 해석을 뒷받침합니다.

모델 실행별 층 단위 top-word 판독과 개념 방향 제거 결과를 나란히 나타낸 실험 표입니다.

용어 해설

해석 가능성 렌즈(Interpretability Lens)
모델 내부의 특정 표현이나 계산을 사람이 읽을 수 있는 토큰 예측 또는 개념 방향으로 변환하는 분석 도구입니다. 특정 checkpoint에 맞춰 학습되므로 모델 버전이 바뀌어도 같은 내부 표현을 읽는지는 별도 검증이 필요합니다.
Jacobian 렌즈(Jacobian Lens)
모델의 중간 residual stream이 최종 출력에 미치는 변화를 Jacobian 방향으로 읽어 내부의 잠재 개념이나 다음 토큰 정보를 추정하는 렌즈입니다. 이 글에서는 Qwen3.6-27B에서 얻은 방향을 Qwen3.8-27B에 그대로 적용해 checkpoint 간 전달성을 측정합니다.
Logit 렌즈(Logit Lens)
중간층의 hidden state를 최종 출력층에 직접 통과시켜 각 층에서 어떤 토큰이 예측되는지 읽는 방법입니다. 글의 실험에서는 Jacobian 렌즈의 기준선으로 사용됐으며, 두 모델의 중간층에서 잠재 entity를 낮은 순위로만 찾았습니다.
Residual Stream
Transformer 층 사이에서 여러 attention 및 MLP 계산 결과가 누적되는 표현 경로입니다. 실험에서는 특정 개념 방향을 이 공간에서 직교화한 뒤 일부 층의 표현에서 제거해 생성 결과의 개념 출현 여부를 확인했습니다.
Teacher Forcing
정답 시퀀스의 이전 토큰을 입력으로 사용하면서 각 위치의 다음 토큰 예측을 평가하는 방식입니다. WikiText 700개 위치에서 이 방식으로 측정한 결과, checkpoint를 옮긴 Jacobian readout의 비용이 중간층에서 1.2~1.3배, 48층 부근에서 약 2배가 됐습니다.

언급된 도구

Neuronpedia중립

Qwen3.6-27B용으로 공개된 Jacobian Lens와 관련 자료의 출처로 사용됐습니다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 16.수집 2026. 08. 16.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.