본문으로 건너뛰기

DiffusionGemma의 벡터 상태는 대체로 해석 가능한 토큰 중첩으로 작동

DiffusionGemma의 분포 벡터는 일부 병렬 계산에 쓰이지만 대체로 토큰 중첩으로 해석되며 높은 monitorability를 유지한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

DiffusionGemma는 토큰을 한 단계씩 생성하는 대신 여러 역확산 단계 사이에 토큰 캔버스와 위치별 확률 분포 벡터를 전달하므로, 이 벡터가 불투명한 잠재 추론을 운반하는지가 monitorability의 핵심 쟁점이다. 연구진은 Top-k 절단에서 나타난 성능 저하 상당 부분이 벡터 정보 제거가 아니라 degenerate loop를 일으킨 샘플러 설정 때문임을 확인했고, 더 완만한 샘플러에서는 Top-1만 남겨도 성능을 유지할 수 있음을 확인했다. 다만 letter arithmetic과 palindrome 과제에서는 여러 토큰 후보를 분포에 중첩해 대응하는 결과를 병렬로 계산하거나 후보 전환을 유도하는 사례가 발견됐다. Probe, steering, J-Lens 같은 해석 기법은 Gemma에서 DiffusionGemma로 대부분 이전됐으며, 전체적으로 DiffusionGemma는 높은 monitorability를 유지하지만 CODI처럼 토큰 중첩으로 설명하기 어려운 잠재 상태까지 같은 결론을 확장할 근거는 부족하다.

섹션별 상세

Autoregressive LLM은 토큰을 한 단계씩 생성하므로 Chain-of-Thought를 통해 답변 형성 과정을 비교적 직접 추적할 수 있다. 반면 DiffusionGemma는 여러 역확산 단계 사이에 토큰 캔버스와 위치별 확률 분포 벡터를 함께 전달하며, 자기 자신에 대해서는 bidirectional attention을 사용한다. 이 벡터가 해석 불가능한 계산을 운반한다면 모델의 직렬 계산 깊이가 외부 관찰에서 가려질 수 있지만, 연구진은 실제 DiffusionGemma에서 그 가능성이 얼마나 큰지 점검했다.
DiffusionGemma의 분포 상태를 Top-k 항목으로 잘랐을 때 성능이 크게 낮아졌다는 기존 결과는 분포 벡터가 필수 계산을 담당한다는 인상을 줄 수 있었다. 그러나 연구진은 기본 샘플러가 모델을 학습 분포 밖으로 밀어내며 같은 토큰을 반복하는 degenerate loop를 만든다는 점을 확인했고, diffusion step을 48에서 96으로 늘리고 temperature 범위를 0.8–0.4에서 1.0–0.5로 넓히며 entropy bound를 0.1에서 0.02로 낮췄다. 더 부드러운 샘플러를 적용하자 절단 상태에서도 성능 저하가 크게 줄어, 기존 손실 상당 부분이 벡터 정보의 제거보다 샘플링 실패에서 비롯됐음을 시사했다.
Top-k 절단 조건에서 soft, top-8, top-4, top-2, top-1을 비교한 누적 막대그래프다.
Chart표준 sampler에서는 truncation이 강해질수록 degenerate loop 비율이 약 39%에서 약 80%까지 증가하는 반면, gentle sampler에서는 실패 비율이 대체로 26%에서 31% 범위에 머문다. 색상은 degenerate loop, budget-capped mid-answer, wrong answer를 구분하며, 성능 저하가 벡터 정보 제거만으로 설명되지 않고 sampler 안정성에 크게 좌우됨을 나타낸다.
근거
  • Top-k 절단에서 발생한 성능 저하의 상당 부분은 분포 정보 제거가 아니라 degenerate loop를 유발한 샘플러 설정에서 비롯됐다. Top-k truncation 절의 샘플러 비교와 48 → 96 diffusion step, temperature 0.8–0.4 → 1.0–0.5, entropy bound 0.1 → 0.02 조정
연구진은 분포 벡터가 실제 계산에 쓰이는지 확인하기 위해 알파벳에서 임의의 대문자를 고른 뒤 세 칸 뒤의 문자를 출력하는 letter arithmetic 과제를 구성했다. 중간 denoising 단계에서 자연스러운 입력인 G보다 낮은 확률을 가진 H에 질량을 주입하자, 모델은 다음 단계에서 자연스러운 목표 J의 질량을 낮추고 H에서 세 칸 뒤인 K의 질량을 높였다. 여러 입력 문자를 동시에 주입했을 때 대응하는 목표들의 반응이 우연 수준보다 자주 함께 나타났지만, letter × 3이나 absolute value 과제에서는 유의한 병렬 효과가 확인되지 않았다.
k=3 조건에서 현재 알파벳 토큰과 다음 응답 토큰 사이의 반응 분포를 나타낸 heatmap이다.
Chart행은 다음 응답 위치의 문자이고 열은 현재 입력 문자이며, K 행과 특정 대각선 주변의 붉은 영역은 입력 변화가 대응하는 목표 문자에 집중적으로 전달됨을 나타낸다. 이는 알파벳을 세 칸 이동시키는 연산이 위치별 분포 상태에서 입력 후보와 목표 후보 사이의 구조적 대응으로 유지됨을 뒷받침한다.
H에 확률 질량을 주입한 뒤 DiffusionGemma의 입력 분포와 응답 분포가 어떻게 바뀌는지 비교한 사례다.
Screenshot기본 실행에서는 G가 자연스러운 operand이고 J가 목표 응답이지만, 개입 실행에서는 H에 질량을 추가해도 G가 1위인 상태를 유지한다. 그럼에도 다음 응답 슬롯에서 H+3인 K의 질량이 0.907로 올라가고 J의 질량이 낮아져, 낮은 순위의 입력 후보가 대응하는 목표 후보를 선택적으로 활성화하는 과정이 나타난다.
동시에 여러 operand를 주입했을 때 대응하는 target이 모두 반응하는 비율을 operand 수별로 비교한 그래프다.
Chart관측된 동시 반응 비율은 operand 수가 1, 2, 3일 때 각각 약 0.82, 0.62, 0.47이며, 점선으로 표시된 무작위 chance 수준인 0.50, 0.25, 0.125보다 높다. operand 수가 늘면서 비율은 낮아지지만, 여러 후보의 선형적 중첩을 동시에 운반하는 계산 가능성이 우연보다 높게 유지된다.
근거
  • 알파벳 letter arithmetic에서는 낮은 확률의 입력 문자를 주입하면 대응하는 목표 문자의 확률이 다음 단계에서 증가했다. Example intervention 이미지와 letter arithmetic 절의 H 주입 사례에서 H+3인 K로 답변 슬롯이 이동
  • DiffusionGemma는 여러 입력 문자를 동시에 주입했을 때 대응하는 목표들에 우연보다 높은 병렬 반응을 보였다. Parallel computation 절의 injection fraction 그래프와 95% confidence intervals
분포 벡터의 자율적 사용은 word-level palindrome 과제에서도 관찰됐다. 모델은 계절적 문구와 idiom이라는 두 후보를 동시에 유지하다가 diffusion 진행 중 idiom의 질량이 커지면서 최종 캔버스를 전환했으며, idiom 후보의 분포 질량을 중간 단계 이후 제거하면 전환이 막혔다. 이는 특정 후보가 단순한 출력 부산물이 아니라 다른 후보를 밀어내는 계산 과정에 인과적으로 관여할 수 있음을 뜻하지만, 그 표현은 여전히 사람이 읽을 수 있는 토큰 후보들의 중첩에 가깝다.
Palindrome 과제에서 idiom과 seasonal 후보의 분포 질량이 denoising step에 따라 변하는 모습을 기본 실행과 개입 실행으로 나눈 그래프다.
Chart기본 실행에서는 seasonal 후보가 초기에 유지되다가 약 5~7단계 사이에 idiom 후보가 질량을 얻으며 최종 답변을 차지한다. idiom 질량을 t2 이후 지속적으로 제거한 경우에는 seasonal 후보가 계속 유지되어, 분포 속 후보의 경쟁이 최종 전환에 인과적으로 관여함을 나타낸다.
근거
  • Palindrome 과제에서 idiom 후보의 분포 질량을 제거하면 계절적 후보에서 idiom으로의 전환이 막혔다. Seasonal vs idiom ablation 그래프의 기본 실행과 t2+ 이후 idiom 질량 제거 비교
Gemma와 DiffusionGemma의 내부 표현은 층이 깊어질수록 cosine similarity와 CKA가 낮아졌고, Gemma에서 DiffusionGemma로의 continued training과 bidirectional attention 전환이 모두 유사도 감소에 기여했다. 그럼에도 SAE-Probes benchmark의 56개 이진 개념 데이터셋으로 학습한 logistic-regression probe는 대부분 DiffusionGemma에 이전됐으며, bidirectional 모드에서 DiffusionGemma에 직접 학습하고 적용한 probe는 오히려 더 높은 AUC를 기록했다. 표현의 전면적인 동일성은 약해졌지만 개념 분리와 선형 해석에 필요한 구조는 상당 부분 남아 있었다.
표현의 기능적 이전 가능성을 확인하기 위해 RepE 기반 steering과 J-Lens도 Gemma에서 DiffusionGemma로 옮겨 적용했다. Gemma에서 학습한 개념 방향을 DiffusionGemma의 residual stream에 주입했을 때 blinded judge가 조정된 출력을 대체로 구분했고, J-Lens도 여러 층과 위치에서 중간 토큰을 top-20 안에 복원하는 성능을 유지했다. 따라서 DiffusionGemma에서는 모델 행동을 바꾸는 표현 방향과 미래 출력을 읽는 선형 lens가 모델 변경에도 상당히 재사용될 수 있다.
gemma-4와 DiffusionGemma 사이의 층별 matched cosine 및 linear CKA 유사도를 비교한 선 그래프다.
Chart초기 층에서는 세 비교 조건의 유사도가 높지만, 깊은 층으로 갈수록 모델 차이와 attention 방식 차이가 표현 유사도를 낮춘다. 특히 gemma-4와 DiffusionGemma의 bidirectional 조건은 후반 층에서 cosine과 CKA가 크게 하락해, 두 모델의 표현 조직이 깊은 층에서 상당히 달라짐을 나타낸다.
Gemma에서 학습한 개념 probe를 Gemma와 DiffusionGemma에 적용한 held-out AUC를 나타낸 heatmap이다.
ChartG causal last에서 학습한 probe는 G causal last에서 0.83, DG causal last에서 0.79, DG bidirectional last에서 0.79의 AUC를 기록했다. DG causal last에서 학습한 probe도 G causal last에서 0.79, DG causal last에서 0.82를 기록해, 내부 표현의 층별 차이에도 개념 분리 구조가 상당 부분 이전됨을 나타낸다.
Gemma-4와 DiffusionGemma에 동일한 steering 방향을 적용했을 때의 blind judge 정확도를 비교한 heatmap이다.
ChartGemma-4에서 학습한 방향을 각 모델에 적용한 점수는 0.80과 0.79였고, DG causal에서 학습한 방향은 각각 0.85와 0.83이었다. DG bidirectional에서 학습한 방향은 0.73과 0.70으로 낮았지만, 전체적으로 steering 방향이 모델 간에 작동해 표현의 인과적 기능도 일정 부분 보존됨을 나타낸다.
J-Lens를 각 모델의 residual stream과 target 표현에 교차 적용한 복원 점수 heatmap이다.
ChartG causal last에서 학습한 lens는 G causal last에서 0.83, DG causal last에서 0.79, DG bidirectional last에서 0.79를 기록했다. DG bidirectional last에서 학습한 lens는 DG bidirectional last에서 0.88로 가장 높았고, 일부 교차 조건에서도 0.71 이상의 점수를 기록해 미래 출력 정보를 읽는 구조가 모델 간에 이전됨을 나타낸다.
gemma-4와 DiffusionGemma의 J-Lens를 서로 다른 target 표현에 적용한 복원 점수 heatmap이다.
Chart세 source 표현에서 gemma-4 pr80 write와 DiffusionGemma pr80 write target에 대한 점수가 각각 G causal 0.80과 0.79, DG causal 0.85와 0.83, DG bidirectional 0.73과 0.70으로 나타난다. source 모델이 달라도 두 target 모델에서 점수 패턴이 비슷해 J-Lens 기반의 미래 연산 읽기가 DiffusionGemma에서도 유지됨을 나타낸다.
근거
  • Gemma에서 학습한 probe, steering 방향, J-Lens가 DiffusionGemma에서도 대부분 기능을 유지했다. Probe retention, steering retention, J-Lens retention 히트맵과 비교 패널
DiffusionGemma의 bidirectional attention은 일부 토큰 의미를 원인 토큰보다 앞선 위치에 배치하는 비인과적 표현을 가능하게 했다. 연구진은 J-space에서 피연산자보다 앞선 위치에 해당 피연산자가 나타나는 사례를 찾았고, 논리적 순서가 필요한 과제에서는 캔버스의 확정 순서가 대체로 과제 방향을 따르면서도 causal 생성 편향을 보인다고 측정했다. 또한 답변이 먼저 확정되고 이후 Chain-of-Thought가 채워지는 post-hoc rationalization 가능성을 점검한 결과, 답변의 확정 시점과 CoT의 load-bearingness가 과제 난도와 함께 움직이며 부하가 큰 문제에서는 CoT가 확정된 뒤 답변이 안정되는 경향이 나타났다.
문제 난도, 답변 susceptibility, commitment time 사이의 관계를 네 과제군별 산점도로 나타낸 그래프다.
Chartcommitment time은 blind difficulty rating과 양의 상관을 보이며, 왼쪽 패널의 Spearman ρs는 +0.37이고 p=.0197이다. susceptibility와 commitment time 사이의 관계도 과제에 따라 달라지며, 일부 패널에서 ρs가 +0.60, p=.0001까지 나타나 어려운 문제와 CoT에 의존하는 답변이 더 늦게 안정되는 경향을 수치화한다.
쉬운 bat-and-ball 문제와 어려운 perfect-square 문제에서 정상 생성과 CoT 무작위 고정 조건을 비교한 사례다.
Screenshot쉬운 문제에서는 답변이 denoising 초기에 5 cents로 확정되고 CoT를 무작위 토큰으로 바꿔도 susceptibility가 0.00으로 유지된다. 어려운 문제에서는 답변이 여러 seed에서 36, 38, 46으로 뒤집히고 susceptibility가 0.70으로 나타나, 답변이 CoT 위치의 정보에 실제로 의존하는 사례와 그렇지 않은 사례를 대비한다.
근거
  • 답변의 확정 시점은 CoT의 load-bearingness와 상관되며, 부하가 큰 문제에서는 CoT가 확정된 뒤 답변이 안정되는 경향이 나타났다. Post-hoc rationalization 절의 commitment time, susceptibility, 답변 및 CoT entropy 그래프
전체 결과는 DiffusionGemma가 일반적인 추론 과제에서 분포 벡터를 불투명한 비선형 잠재 추론 장치로 사용한다는 증거를 찾지 못했다는 결론으로 모인다. Top-1 수준까지 안정적인 샘플링이 가능하고, 예외적인 letter arithmetic 및 palindrome 사례에서도 벡터가 토큰 후보의 중첩으로 해석되는 범위가 컸다. 다만 CODI처럼 토큰의 단순 중첩으로 보기 어려운 벡터 상태를 전달하는 모델에는 이 결론을 그대로 확장할 수 없으므로, 잠재 상태를 직접 해석하는 방법의 개발이 여전히 필요하다.

용어 해설

잠재 추론(Latent Reasoning)
토큰을 순차적으로 생성하는 대신 모델 내부의 벡터 상태를 여러 계산 단계 사이에 전달하며 추론하는 방식이다. 벡터가 어떤 의미와 계산을 담는지 직접 읽기 어려워지므로, 모델의 사고 과정을 감시하고 검증하는 monitorability가 낮아질 수 있다.
모니터링 가능성(Monitorability)
모델이 답을 만드는 중간 과정을 외부 관찰자가 추적하고 해석할 수 있는 정도다. Chain-of-Thought의 토큰이나 내부 표현을 검사해 답변 형성에 실제로 사용된 정보를 확인하는 데 중요하다.
Diffusion Model
노이즈가 섞인 상태를 여러 역확산 단계에 걸쳐 점진적으로 정제해 최종 출력을 만드는 모델이다. DiffusionGemma에서는 각 단계 사이에 현재 토큰뿐 아니라 위치별 출력 분포 벡터도 전달한다.
Top-k 절단(Top-k Truncation)
출력 분포에서 확률이 가장 높은 k개 항목만 남기고 나머지 질량을 제거하는 처리다. DiffusionGemma의 벡터 상태에 적용하면 해석 가능한 후보만 유지할 수 있지만, 샘플러 설정이 부적절하면 반복 출력이 발생할 수 있다.
중첩 표현(Superposition)
서로 다른 여러 후보나 개념이 하나의 벡터 표현 안에 동시에 저장되는 현상이다. 이 글에서는 알파벳 후보들이 분포로 함께 유지되고 선형 연산을 거쳐 대응하는 결과 후보로 이동하는 형태로 관찰된다.
CKA
표현 행렬 사이의 유사성을 측정하는 방법으로, 전체 표현 공간의 회전에는 영향을 덜 받는다. Gemma와 DiffusionGemma의 층별 표현이 얼마나 비슷한지 비교하는 데 사용됐으며, 깊은 층으로 갈수록 유사도가 낮아졌다.
J-Lens
잔차 스트림의 특정 활성화가 미래 출력에 미치는 평균 효과를 Jacobian으로 추정한 뒤, 최종 층의 어휘 공간으로 선형 변환하는 해석 기법이다. 이 글에서는 Gemma에서 학습한 J-Lens가 DiffusionGemma에도 어느 정도 이전되는지 평가했다.

기술

  • DiffusionGemma
  • Gemma
  • Gemma-4
  • SAE-Probes benchmark
  • logistic-regression probes
  • CKA
  • RepE
  • J-Lens
  • WikiText
  • CODI

활용 사례

  • Diffusion 모델의 latent reasoning 감시 가능성 평가
  • 분포 상태를 이용한 병렬 계산 분석
  • LLM 표현 probe의 모델 간 이전
  • Residual stream activation steering
  • J-Lens를 이용한 미래 토큰 표현 추적
  • Chain-of-Thought가 실제 답변 계산에 기여하는지 검증
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 16.수집 2026. 08. 16.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.