본문으로 건너뛰기

Bubble 없이 추론 흔적을 복원하는 Trace-Inverter-4B 공개

최종 답변만으로 reasoning trace를 복원하도록 Qwen3-4B를 증류해 Token F1 0.6500을 기록했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 Claude의 reasoning bubble까지 본 Trace-Inverter-4B가 만든 reconstructed trace를 이용해, 문제와 최종 답변만 입력받는 Trace-Inverter-4B-NoBubble을 Qwen3-4B 기반으로 학습했다. 중복 제거 후 12,094개 예시를 LoRA BF16으로 한 epoch 학습했으며, 16GB RTX 4090 Laptop GPU 한 대를 사용했다. 10개 결정론적 평가에서 NoBubble 모델은 bubble 없는 OOD 기준보다 높은 Token F1 0.6500과 ROUGE-L 0.3916을 기록해, bubble 조건 교사 모델의 성능상 이점 일부를 회복했다. 다만 평가 규모가 작고 비교 checkpoint의 출력 경로를 수정했으므로, 더 큰 데이터셋과 재현 가능한 실행 설정을 통한 추가 검증이 필요하다.

실용적 조언

  • 최종 답변과 user_query만 저장된 데이터에서 reasoning trace가 필요한 경우, bubble을 입력에 포함한 교사 모델로 synthetic trace를 만든 뒤 bubble을 제거한 학생 모델을 별도로 학습하는 구성을 고려할 수 있다. 이 실험은 12,094개 학습 예시와 한 장의 16GB GPU, LoRA BF16 한 epoch만으로 해당 구성을 시험했다. 다만 10개의 결정론적 평가 예시만 사용했으므로 실제 적용 전에는 더 큰 held-out set과 다양한 과업으로 재검증해야 한다.
  • Trace-Inverter-4B 같은 checkpoint를 비교할 때는 chat template와 tool call 처리 방식이 측정 대상에 영향을 주는지 먼저 확인해야 한다. 이 글에서는 reconstructed content가 tool call 안에 들어가는 문제를 수정해 일반 출력으로 반환된 trace text를 평가했다. 동일한 patch와 generation 경로를 고정하지 않으면 모델의 학습 성능이 아니라 실행 plumbing의 차이를 비교할 위험이 있다.

섹션별 상세

01
작성자는 bubble-assisted trace inverter가 생성한 reconstructed trace를 감독 신호로 사용해, 문제와 Claude answer만 입력받는 Trace-Inverter-4B-NoBubble을 학습했다. 중복 제거 후 13,428개 예시를 확보했고 그중 12,094개를 학습에 사용했다. LoRA BF16 방식으로 16GB RTX 4090 Laptop GPU 한 대에서 한 epoch를 학습한 뒤 standalone checkpoint로 병합했다.
02
비교 결과 10개의 결정론적 held-out 예시에서 Qwen3-4B Base는 Token F1 0.4059와 ROUGE-L 0.2081을 기록했다. bubble을 포함한 Trace-Inverter-4B는 각각 0.6821과 0.4276이었고, bubble을 제거한 OOD 실행은 0.6061과 0.3710이었다. 새로 학습한 Trace-Inverter-4B-NoBubble은 bubble 없이 0.6500과 0.3916을 기록해, 입력 조건을 제거했음에도 교사 모델의 성능 격차 일부를 회복했다.
03
저자는 절대 수치가 10개 예시만으로 결정적이지 않지만 상대적인 비교는 의미가 있다고 평가했다. Gettier problem 예시에서 기본 Qwen3-4B는 JTB와 네 번째 조건을 설명하는 일반적인 단계부터 시작했지만, OOD Trace-Inverter-4B는 핵심 과업과 epistemic luck을 더 구조적으로 분해했다. NoBubble 모델의 출력은 일부 단계가 비어 있었지만, 최종 답변만 기록된 실제 서비스 데이터에서 synthetic trace를 복원하는 용도에 충분한 가능성을 보였다.
04
비교 과정에서는 Jackrong의 checkpoint가 기본 상태에서 reconstructed content를 일반 모델 출력이 아니라 tool call 내부에 넣을 수 있어 loading과 generation 경로를 수정했다. 작성자는 모델 가중치를 바꾸지 않고 chat template의 해석 차이 대신 실제 trace text를 측정하도록 배관만 패치했다고 밝혔다. 재현을 위해 정확한 patch와 reconstruction 과정은 저장소에 기록했다.

용어 해설

추론 흔적 역변환기(Trace Inverter)
문제와 최종 답변만 입력받아 모델이 생성했을 법한 합성 reasoning trace를 복원하는 언어 모델이다. 이 글에서는 Claude answer와 reasoning bubble을 함께 본 교사 모델의 출력을 이용해, bubble 없이 같은 작업을 수행하도록 별도 모델을 학습하는 구조를 가리킨다.
추론 흔적(Reasoning Trace)
최종 답변에 이르기까지의 중간 사고 과정을 텍스트로 기록한 결과다. 이 실험에서는 실제 사고 기록 대신 문제와 답변에서 재구성한 synthetic trace를 감독 신호로 사용해, 최종 답변만 남은 데이터에서도 학습 가능한 신호를 확보했다.
지식 증류(Knowledge Distillation)
더 많은 정보나 높은 성능을 가진 교사 모델의 출력물을 이용해 별도의 학생 모델을 학습하는 방법이다. 여기서는 bubble까지 본 Trace-Inverter-4B가 만든 reconstructed trace를 Qwen3-4B에 제공하고, 학생 모델은 문제와 Claude answer만 입력으로 사용했다.
분포 외 평가(Out-of-Distribution)
모델이 학습 때와 다른 입력 조건이나 데이터 분포에서 얼마나 작동하는지 확인하는 평가 방식이다. bubble을 포함한 데이터로 만들어진 Trace-Inverter-4B에 bubble을 제거해 실행한 비교군이 이 실험의 OOD 조건에 해당한다.
reasoning bubble(Reasoning Bubble)
모델의 최종 답변과 함께 제공되는 중간 reasoning 텍스트를 뜻한다. 교사 모델은 문제와 Claude answer 및 bubble을 모두 볼 수 있었지만, Trace-Inverter-4B-NoBubble 학생 모델의 학습 입력에서는 bubble을 완전히 제거했다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 22.수집 2026. 08. 22.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.