TL;DR
DiffusionGemma는 토큰을 한 단계씩 생성하는 대신 여러 역확산 단계 사이에 토큰 캔버스와 위치별 확률 분포 벡터를 전달하므로, 이 벡터가 불투명한 잠재 추론을 운반하는지가 monitorability의 핵심 쟁점이다. 연구진은 Top-k 절단에서 나타난 성능 저하 상당 부분이 벡터 정보 제거가 아니라 degenerate loop를 일으킨 샘플러 설정 때문임을 확인했고, 더 완만한 샘플러에서는 Top-1만 남겨도 성능을 유지할 수 있음을 확인했다. 다만 letter arithmetic과 palindrome 과제에서는 여러 토큰 후보를 분포에 중첩해 대응하는 결과를 병렬로 계산하거나 후보 전환을 유도하는 사례가 발견됐다. Probe, steering, J-Lens 같은 해석 기법은 Gemma에서 DiffusionGemma로 대부분 이전됐으며, 전체적으로 DiffusionGemma는 높은 monitorability를 유지하지만 CODI처럼 토큰 중첩으로 설명하기 어려운 잠재 상태까지 같은 결론을 확장할 근거는 부족하다.
섹션별 상세
- Top-k 절단에서 발생한 성능 저하의 상당 부분은 분포 정보 제거가 아니라 degenerate loop를 유발한 샘플러 설정에서 비롯됐다. — Top-k truncation 절의 샘플러 비교와 48 → 96 diffusion step, temperature 0.8–0.4 → 1.0–0.5, entropy bound 0.1 → 0.02 조정
- 알파벳 letter arithmetic에서는 낮은 확률의 입력 문자를 주입하면 대응하는 목표 문자의 확률이 다음 단계에서 증가했다. — Example intervention 이미지와 letter arithmetic 절의 H 주입 사례에서 H+3인 K로 답변 슬롯이 이동
- DiffusionGemma는 여러 입력 문자를 동시에 주입했을 때 대응하는 목표들에 우연보다 높은 병렬 반응을 보였다. — Parallel computation 절의 injection fraction 그래프와 95% confidence intervals
- Palindrome 과제에서 idiom 후보의 분포 질량을 제거하면 계절적 후보에서 idiom으로의 전환이 막혔다. — Seasonal vs idiom ablation 그래프의 기본 실행과 t2+ 이후 idiom 질량 제거 비교
- Gemma에서 학습한 probe, steering 방향, J-Lens가 DiffusionGemma에서도 대부분 기능을 유지했다. — Probe retention, steering retention, J-Lens retention 히트맵과 비교 패널
- 답변의 확정 시점은 CoT의 load-bearingness와 상관되며, 부하가 큰 문제에서는 CoT가 확정된 뒤 답변이 안정되는 경향이 나타났다. — Post-hoc rationalization 절의 commitment time, susceptibility, 답변 및 CoT entropy 그래프
용어 해설
- 잠재 추론(Latent Reasoning)
- — 토큰을 순차적으로 생성하는 대신 모델 내부의 벡터 상태를 여러 계산 단계 사이에 전달하며 추론하는 방식이다. 벡터가 어떤 의미와 계산을 담는지 직접 읽기 어려워지므로, 모델의 사고 과정을 감시하고 검증하는 monitorability가 낮아질 수 있다.
- 모니터링 가능성(Monitorability)
- — 모델이 답을 만드는 중간 과정을 외부 관찰자가 추적하고 해석할 수 있는 정도다. Chain-of-Thought의 토큰이나 내부 표현을 검사해 답변 형성에 실제로 사용된 정보를 확인하는 데 중요하다.
- Diffusion Model
- — 노이즈가 섞인 상태를 여러 역확산 단계에 걸쳐 점진적으로 정제해 최종 출력을 만드는 모델이다. DiffusionGemma에서는 각 단계 사이에 현재 토큰뿐 아니라 위치별 출력 분포 벡터도 전달한다.
- Top-k 절단(Top-k Truncation)
- — 출력 분포에서 확률이 가장 높은 k개 항목만 남기고 나머지 질량을 제거하는 처리다. DiffusionGemma의 벡터 상태에 적용하면 해석 가능한 후보만 유지할 수 있지만, 샘플러 설정이 부적절하면 반복 출력이 발생할 수 있다.
- 중첩 표현(Superposition)
- — 서로 다른 여러 후보나 개념이 하나의 벡터 표현 안에 동시에 저장되는 현상이다. 이 글에서는 알파벳 후보들이 분포로 함께 유지되고 선형 연산을 거쳐 대응하는 결과 후보로 이동하는 형태로 관찰된다.
- CKA
- — 표현 행렬 사이의 유사성을 측정하는 방법으로, 전체 표현 공간의 회전에는 영향을 덜 받는다. Gemma와 DiffusionGemma의 층별 표현이 얼마나 비슷한지 비교하는 데 사용됐으며, 깊은 층으로 갈수록 유사도가 낮아졌다.
- J-Lens
- — 잔차 스트림의 특정 활성화가 미래 출력에 미치는 평균 효과를 Jacobian으로 추정한 뒤, 최종 층의 어휘 공간으로 선형 변환하는 해석 기법이다. 이 글에서는 Gemma에서 학습한 J-Lens가 DiffusionGemma에도 어느 정도 이전되는지 평가했다.
기술
- DiffusionGemma
- Gemma
- Gemma-4
- SAE-Probes benchmark
- logistic-regression probes
- CKA
- RepE
- J-Lens
- WikiText
- CODI
활용 사례
- Diffusion 모델의 latent reasoning 감시 가능성 평가
- 분포 상태를 이용한 병렬 계산 분석
- LLM 표현 probe의 모델 간 이전
- Residual stream activation steering
- J-Lens를 이용한 미래 토큰 표현 추적
- Chain-of-Thought가 실제 답변 계산에 기여하는지 검증
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
