본문으로 건너뛰기
r/deeplearning조회 1

생성 언어 기반 인과 귀속 그래프로 본 Qwen3-1.7B의 추론 궤적

생성된 텍스트의 토큰별 그래디언트 귀속을 DAG로 추적하고 희소 가지치기를 적용해 Qwen3-1.7B에서 추론 궤적을 시각화한 연구·데모이다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이 작업은 내부 활성화 대신 생성된 텍스트 자체를 단위로 삼아 gradient attribution으로 토큰 기여도를 계산하고 DAG tracing으로 인과 경로를 구성한 뒤 sparse pruning으로 핵심 경로만 남기는 파이프라인을 Qwen3-1.7B에 적용해 생성된 추론의 궤적을 시각화한 것이다. 정적 이미지와 애니메이션 데모는 생성 텍스트가 단계적으로 어떤 정보 경로를 형성하는지를 보여 주며, GitHub에 공개된 InfoLens 코드를 통해 동일한 절차를 재현할 수 있다. Thought Anchors 계열과 비교하면 이 방법은 의미적 사전 지식 의존도를 낮춰 자동화된 인과 구조 추출에 초점을 맞추며, 시각화 외에도 정보 전파 연구나 에이전트 디버깅 도구로 활용될 가능성이 있다. 단 이 접근은 그래디언트 산출 방식과 가지치기 임계값에 민감하므로 정량적 검증과 방법론 안정성 확보가 필요하다.

실용적 조언

  • 시각화 목적이라면 gradient attribution으로 초기 가중치를 산출한 뒤 DAG tracing으로 주요 경로를 구성하고, 마지막으로 sparse pruning 임계값을 조정해 가독성을 확보할 것을 권장한다.
  • 재현 실험을 위해서는 원문에서 공개한 InfoLens 데모와 GitHub 저장소의 코드를 참조해 동일한 입력과 모델(Qwen3-1.7B)을 사용해 비교해야 한다.

섹션별 상세

01
기존의 mechanistic interpretability는 내부 활성화나 회로(circuit)를 직접 추적하는 데 초점이 있었는데, 이 글은 생성된 언어 자체를 대상으로 한 귀속 그래프로 동일한 과정을 살펴본다. 구체적으로 생성된 토큰들 사이의 인과적 기여도를 그래디언트 기반 귀속으로 계산하고 이를 노드와 간선으로 표현해 유향 비순환 그래프(DAG) 형태로 구성한다. 그 결과 얻은 그래프는 내부 회로 해석과 다른 구조적 특징을 보이며 사람이 읽을 수 있는 추론 궤적(reasoning trajectory)처럼 보인다고 보고한다. 이 접근법은 활성화 기반 분석 대신 텍스트 기반의 인과 구조를 통해 모델 추론의 흐름을 재구성할 수 있음을 시사한다.
02
구현 방식은 세 단계로 요약된다: 먼저 출력에 대한 입력 토큰 및 중간 텍스트 요소의 기여도를 gradient attribution으로 수치화하고, 그 다음에 DAG tracing으로 원인-결과 관계를 따라 주요 경로를 구성하며, 마지막으로 sparse pruning으로 기여도가 낮은 간선과 노드를 제거해 핵심 경로를 남긴다. 저자는 이 파이프라인을 Qwen3-1.7B 모델에 적용했고, 정적 이미지와 애니메이션으로 표현된 귀속 그래프가 생성된 추론의 단계적 구조를 드러냈다. 데모와 GitHub 소스코드가 공개되어 있어 동일한 절차를 재현하거나 입력 문장에 따라 그래프가 어떻게 변하는지 직접 확인할 수 있다.
03
Thought Anchors 계열 연구와의 비교가 본문에서 제시되며, 두 접근의 차이는 사전 의미 지식 의존성 여부에 있다. Thought Anchors는 의미적 프레임에 기반한 앵커 토큰을 활용해 추론 구조를 보강하는 반면 이 방법은 거의 사전 의미 지식 없이도 그래디언트와 DAG 조합으로 인과적 흐름을 도출한다. 따라서 이 접근법은 사전 라벨링이나 의미적 태깅이 어려운 상황에서도 자동으로 텍스트 기반 인과 구조를 찾아낼 수 있다는 장점을 가진다. 다만 의미적 해석을 전제로 한 기법과 비교해 해석의 신뢰도와 정밀도 측면에서 상이한 트레이드오프가 존재할 수 있다.
04
저자는 이 관점이 시각화 이상의 응용으로 확장될 가능성을 제시하며, 구체적으로 생성 중 정보가 텍스트를 통해 어떻게 전파되는지 연구하거나 언어와 모델의 정보동역학을 계량화하는 데 사용할 수 있다고 적었다. 실무적으로는 대화형 에이전트의 긴 추론 과정에서 중요 토큰 경로를 추적해 디버깅하거나 설명 가능성(explainability) 도구로 통합할 수 있다는 잠재성이 있다. 반면 본 접근은 그래디언트 산출 방식과 가지치기 기준에 민감하므로 방법론적 안정성 확보와 정량적 검증이 추가로 필요하다.

이미지 분석

생성 토큰 간의 그래디언트 귀속을 바탕으로 구성된 정적 유향 그래프 이미지로서 노드와 간선이 추론 경로를 드러낸다.
Diagram

이 이미지는 각 생성 단계의 토큰이 최종 출력에 미친 기여도를 노드와 간선의 연결로 시각화해 중요한 중간 단계들을 식별하게 한다. 그래프 구조는 DAG tracing으로 형성되었으며 색상이나 굵기로 기여도의 상대적 크기를 표현해 중핵 경로를 눈으로 구분할 수 있게 한다. 따라서 이 다이어그램은 텍스트 기반 인과 흐름을 한눈에 파악하는 근거 자료로 활용될 수 있다.

생성 토큰 간의 그래디언트 귀속을 바탕으로 구성된 정적 유향 그래프 이미지로서 노드와 간선이 추론 경로를 드러낸다.

동적 애니메이션으로 생성 과정에서 귀속 그래프가 어떻게 확장되고 가지치기되는지를 보여 주는 GIF이다.
Diagram

애니메이션은 생성 토큰이 순차적으로 추가될 때 그래프의 노드와 간선이 형성되는 과정을 단계별로 보여 주며, sparse pruning이 적용되었을 때 불필요한 연결이 제거되는 모습도 나타난다. 이 동적 시각화는 정적 이미지보다 시간축에 따른 인과 흐름 변화를 직관적으로 파악할 수 있게 해 실험적 비교나 데모용으로 적합하다.

동적 애니메이션으로 생성 과정에서 귀속 그래프가 어떻게 확장되고 가지치기되는지를 보여 주는 GIF이다.

용어 해설

귀속 그래프(Attribution Graph)
문장 내 토큰 혹은 생성 과정의 요소들이 결과 토큰에 기여한 정도를 노드와 간선으로 표현한 구조로, 입력 토큰이나 중간 표상이 출력에 미치는 인과적 영향을 시각적으로 추적하는 데 쓰인다.
생성된 추론 궤적(Generated Reasoning Trace)
모델이 생성한 자연어 추론 과정 자체를 시간 흐름에 따라 캡처한 서술로, 숨겨진 활성화 대신 생성된 텍스트 조각 간의 인과적 연결망을 분석해 모델의 내부 논리 흐름을 재구성한다.
그래디언트 기반 귀속(Gradient Attribution)
출력 스칼라에 대한 입력 또는 중간 표현의 기여도를 출력에 대한 그래디언트로 측정하는 방법으로, 토큰·컨텍스트 요소가 결과에 얼마나 영향을 줬는지를 수치화해 그래프의 가중치로 사용할 수 있다.
유향 비순환 그래프 추적(DAG Tracing)
노드 간 인과 관계를 유향 비순환 그래프로 구성하여 추론 흐름을 따라가면서 주요 경로를 식별하는 기법으로, 생성 텍스트의 시간적 순서와 인과 연결을 구조화하는 데 사용된다.
희소 가지치기(Sparse Pruning)
전체 연결망에서 기여도가 낮은 간선이나 노드를 제거해 그래프를 단순화하는 절차로, 노이즈를 줄이고 핵심적인 인과 경로만 남겨 시각화와 분석의 가독성을 높인다.

언급된 도구

InfoLens추천링크

생성 텍스트 기반 귀속 그래프를 만들고 시각화하는 데모 및 도구

Qwen3-1.7B중립

귀속 그래프 사례 적용 대상 LLM

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 21.수집 2026. 07. 21.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.