왜 중요한가
사람이 공간 문제를 해결할 때 머릿속에서 장면을 그려보는 것처럼 모델에게도 실행 가능한 시각적 작업 공간을 제공하면 기하학적 추론이 더 정확해진다. MentalThink는 텍스트 추론의 유연성을 유지하면서 SVG의 구조적 정밀도를 결합해 시각 환각을 줄이고 공간 관계를 검증 가능한 형태로 외현화한다. 이 접근은 특히 회전·원근·관점 변환이 중요한 복합 공간 추론 과제에서 유의미한 성능 개선을 보였다.
핵심 기여
Think-with-SVG 파이프라인 제안
모델이 추론 중에 SVG 코드를 생성·렌더링·해석하도록 상태 공간을 확장해 언어적 추론과 시각적 외현화를 결합했다. 이 방식은 코드의 문법 유효성 검사를 통해 내부 가설을 결정론적으로 검증할 수 있게 만들었다. 결과적으로 다회차 추론 과정에서 시각적 가설을 반복 수정하는 루프가 형성되어 공간적 일관성이 향상되었다.
두 단계 학습 체계 설계(SFT → Multi-turn RL)
먼저 SFT로 SVG 문법과 시각 외현화 능력을 확보하고 이후 GRPO 기반의 다회차 RL로 추론 동역학을 최적화했다. SFT는 형식적·문법적 정합성을 보장하는 반면 RL은 단계별 검증과 수정 행위를 보상해 실제 문제 해결 역량을 끌어올렸다. 이 결합은 형식 보상(렌더 가능성)과 정답 보상(최종 정답 일치)을 혼합한 보상 설계로 구현되었다.
결정론적 SVG 렌더링 환경을 상태 전이에 통합
SVG 코드를 DOM 파싱·레이아웃 처리·래스터화하는 렌더링 변환을 환경으로 포함시켜 코드 출력이 픽셀 관찰로 환원되는 피드백 루프를 구축했다. 이 루프는 모델이 이전 단계에서 생성한 시각적 가설을 다음 단계의 입력으로 활용하게 하여 일관된 검증 과정을 가능하게 했다. 환경은 문법 및 렌더 가능성 검사로 하드 실패를 감지해 트래젝터리 종료 조건으로 사용되었다.
공간 추론 벤치마크에서 실험적 우위 입증
VSIBench에서 55.1%, MindCube에서 76.0% 등 여러 공간 이해·추론 벤치마크에서 SFT 단계를 넘어 RL 최적화 모델이 상당한 성능 향상을 기록했다. 논문은 또한 SVG 포함 데이터의 유무, 일반 공간 인지 데이터 추가, RL 적용 여부를 분리한 소거 실험을 제시해 각 요소의 기여를 정량화했다. 이러한 결과는 SVG 기반 중간 표현이 특히 기하학적·조합적 과제에서 강한 inductive bias로 작동함을 보여주었다.
핵심 아이디어 이해하기
문제 출발점은 다중모달 추론에서 텍스트 기반 Chain-of-Thought가 시각적 기하학 정보를 구조적으로 유지하지 못해 기하학적 오류와 환각을 유발한다는 점이다. 텍스트는 장면의 위계나 정확한 좌표 정보를 표기하기 어려워 복잡한 공간 관계를 장기 기억 속에서 일관되게 유지하기에 한계가 있었다. 이러한 제약은 특히 관점 변환·객체 정렬·순서 추론 같은 과제에서 오류 전파로 이어졌다.
해결 원리는 추론 과정의 일부 단계를 기계가 해석 가능한 시각 언어로 외현화하는 것이다. SVG는 좌표·치수·그룹화 같은 구조적 속성을 코드로 명시하므로 모델이 출력하는 문자열이 바로 시각적 장면으로 렌더링될 수 있다. 이 렌더링이 결정론적으로 픽셀 관찰로 다시 들어오면 모델은 이전 가설을 시각적으로 검증하고 다음 단계의 출력을 그 검증 결과에 조건화할 수 있다.
따라서 think-with-SVG는 언어의 상징적 표현력과 코드 기반 시각 표현의 정밀함을 결합해 추론의 '시각적 작업 영역'을 제공한다. 이로 인해 모델은 관점 고정, 좌표계 설정, 객체 간 상대 위치 계산 같은 기하학적 연산을 내부적으로 수행하고, 필요 시 SVG를 수정해 가설을 교정함으로써 최종 답안을 도출한다.
관련 Figure

이 그림은 세 가지 대표 사례를 통해 think-with-SVG가 실제로 관점 기준 좌표계 설정, 초기 레이아웃 생성 후 수정, 다중 뷰 통합을 통해 일관된 장면 구성에 기여함을 보여준다. 사례별로 SVG 스케치가 어떻게 가설을 외현화하고 반복 수정으로 이어지는지 시각적 근거를 제공해 결과 해석과 질적 분석을 뒷받침한다.
동적 관점 전환, 반사적 시각 정제, 조합적 장면 구성 같은 SVG 기반 추론 패턴을 예시로 보여주는 사례 모음이다.
방법론
전체 접근은 정책 πθ가 언어적 서술 ℓ과 선택적 SVG 코드 σ를 교대로 생성하며 상태를 전이시키는 다회차 상호작용으로 정의되었다. 상태 ssvg는 질의 q, 시각 입력 v, 그리고 (ℓ,σ) 쌍의 시퀀스를 포함하며 정책은 이 확장된 상태공간에서 행동을 샘플링한다. 행동에 SVG 코드가 포함되면 환경은 이를 파싱·레이아웃·래스터화해 결정론적 이미지 Iσ를 반환하고 이 이미지를 다음 상태에 첨가한다.
학습은 두 단계로 수행되었다. 첫 단계에서 SFT는 전문가가 생성한 추론 궤적을 최대우도 방식으로 학습해 모델이 문법적으로 유효한 SVG를 생성하도록 초기화한다(ℒSFT = −Eτ∑t log πθ(ξt|st)). 두 번째 단계에서 GRPO 기반의 강화학습을 적용해 다회차 검증·수정 행위를 장려했다. 보상은 형식 보상(rformat, 렌더 가능성 여부)과 최종 정답 보상(ranswer)을 가중 합해 사용했고 계수로 λfmt=0.25, λans=0.75가 지정되었다.
추론 루프는 가설 생성→SVG 렌더링→컨텍스트 업데이트→다음 단계로 이어지는 순환 구조로 동작하며 최대 추론 횟수 Tmax=5로 제한을 두었다. 렌더 불가나 문법 오류 발생 시 하드 실패로 트래젝터리를 종료해 정책이 유효한 코드 생성을 우선하도록 설계했다. 실험 구성은 Qwen2.5-VL-7B 백본 위에 MentalThink를 구현하고 SFT 데이터 약 200k 샘플과 RL용 프롬프트를 사용해 훈련을 진행했다.
관련 Figure

이 그림은 모델이 질문을 받아 언어적 추론과 SVG 코드 생성을 교대로 수행하고 SVG 렌더링 결과를 다시 맥락으로 삽입해 최종 정답을 도출하는 순환 구조를 보여준다. 각 단계에서의 코드 생성, 렌더링, 검증 동작이 어떻게 상태 전이에 포함되는지와 멀티턴 루프의 역할을 직관적으로 제시해 방법론의 동작 원리를 보강한다. 이 도식은 방법론의 핵심 구성요소인 SFT 단계와 RL 단계, 그리고 SVG 환경의 위치를 연결해 이해를 돕는다.
Think-with-SVG 파이프라인의 개념적 흐름도와 예시 추론 궤적을 시각화한 도식이다.
주요 결과
주요 성능 지표는 VSIBench와 MindCube 등 공간 추론 벤치마크에서 측정되었고 MentalThink-RL 모델은 VSIBench 55.1%와 MindCube 76.0%를 기록했다. 표준 오픈소스 기반 모델(Qwen2.5-VL-7B) 대비 MindCube에서 40.0 포인트, VSIBench에서 24.1 포인트의 개선이 보고되어 think-with-SVG의 효과가 수치적으로 뚜렷했다. SFT 단계만 적용한 중간 모델도 성능 상승을 보였으나, 다회차 RL 적용 시 복합 논리 과제에서 추가 이득이 관찰되었다.
소거 실험 결과는 세 구성요소의 상호보완성을 보여주었다. SVG-Reasoning 데이터 추가로 평균 점수는 31.0%에서 44.4%로 상승했고 일반 공간 인지 데이터 추가로 53.9%까지 올랐다. 최종적으로 RL을 결합하면 평균 55.1%로 정점에 도달했으며 Appearance Order, Relative Direction 같은 특정 세부 지표에서 큰 폭의 개선이 보고되었다.
기술 상세
전체 아키텍처는 Qwen2.5-VL-7B 백본을 기반으로 하여 입력으로 이미지와 텍스트를 받고 출력으로 언어적 단위 ℓ와 선택적 SVG 코드 σ를 생성하는 멀티모달 정책 구조로 구성되었다. SVG 코드의 문법적·구조적 정합성은 SFT 단계에서 학습되었고, 모델 출력은 훈련 중 렌더링 파이프라인을 통해 실제 이미지로 변환되어 다음 입력으로 주입되었다. 이 과정은 모델이 코드 기반의 시각적 가설을 직접 해결 루프에 포함시키게 했다.
수학적 관점에서 SFT는 음의 로그우도 손실로 표현되며 ℒSFT(θ) = −Eτ∼DSFT ∑t log πθ(ξtsvg | stsvg)를 최소화했다. RL 단계에서는 기대 보상 J(θ)=Eτ∼πθ[R(τ)]를 최대화하며 Group Relative Policy Optimization을 적용해 정책 업데이트의 안정성을 확보했다. 보상 설계는 단계별 형식 보상 rformat(렌더 가능 여부)과 최종 정답 보상 ranswer를 조합해 r t = λfmt rformat(σt) + λans ranswer(aT)·I(t=T)로 정의되었다.
학습 하이퍼파라미터는 SFT에서 학습률 5×10−5, 글로벌 배치 256을 사용했고 RL 단계에서는 학습률 2×10−6, 글로벌 배치 64로 보수적으로 전환했다. 훈련 인프라는 32대의 NVIDIA H800 GPU 클러스터로 구성되었고 최대 추론 길이 Tmax는 5로 제한해 다회차 검증의 균형을 맞추었다. 데이터 구성은 약 200k SFT 샘플(Visual-Syntactic Alignment 50k, Visual Thought Externalization 50k, Fundamental Spatial Perception 100k)과 RL용 프롬프트로 이루어졌다.
또한 렌더링 파이프라인은 σ → DOM 파싱 → 기하학적 primitive 집합 구성 → 래스터화의 순으로 정의되어 σ의 문법적 유효성(Renderable(σ)=True)을 보장하는 검증 단계가 포함되었다. 하드 실패 조건으로 문법 불일치가 발생하면 해당 궤적을 종료하며 형식 보상을 통해 정책이 유효한 SVG 생성을 우선하도록 유도했다.
한계점
논문이 명시한 주요 제약은 고품질의 CoT 데이터와 유효한 SVG 코드를 동시에 포함한 자연 발생 데이터가 부족하다는 점이다. 따라서 현실적 응용을 위해서는 데이터 합성 및 필터링 전략이 필요하며, 이 작업이 충분히 정교하지 않으면 모델이 형식적 정합성에는 성공해도 의미 있는 시각적 가설을 만들지 못할 위험이 있다. 추가로 모델이 언제 자동으로 SVG를 호출해야 하는지 결정하는 자발성 문제는 남아 있어 실전 배포에서는 정책의 트리거 기준을 별도로 다뤄야 한다.
키워드
용어 해설
- SVG 기반 사고 파이프라인(Think-with-SVG)
- — 모델이 추론 중에 SVG 코드를 중간 표현으로 생성하고 렌더링해 시각적 가설을 반복적으로 검증하는 절차를 의미한다. 이 방식은 텍스트 기반 Chain-of-Thought에 SVG의 구조적 정밀성을 결합해 공간 관계를 명확히 표현한다. MentalThink에서는 이 파이프라인이 모델의 다회차 시각 추론 능력을 촉진하는 핵심 메커니즘으로 작용한다.
- SVG 렌더링 환경(SVG Rendering Environment)
- — SVG 코드(벡터 명령)를 파싱하고 레이아웃을 구성한 뒤 래스터화하여 픽셀 관찰을 반환하는 결정론적 변환 파이프라인을 뜻한다. 이 환경은 모델의 코드 출력이 실제 시각적 피드백으로 돌아오게 하여 가설의 검증과 수정을 가능하게 만든다. MentalThink는 이 환경을 상태 전이의 일부로 취급해 다회차 정책 학습을 수행했다.
- 그룹 상대 정책 최적화(Group Relative Policy Optimization)
- — 다회차 추론 정책을 안정적으로 학습하기 위해 사용된 강화학습 알고리즘 계열로, 그라디언트 변동을 제어하면서 집단 수준의 상대적 성능 향상을 목표로 한다. MentalThink에서는 GRPO를 사용해 SFT로 확보한 문법적 출력 능력을 실제 문제 해결 능력으로 연결시켰다. 이 방식은 최종 정답 보상과 형식 보상을 혼합해 최적화를 진행했다.
- SVG 보강 추론(SVG-Augmented Reasoning)
- — 언어적 추론 단계에 구조화된 SVG 코드 출력을 결합해 시각적·기하학적 상태를 명시적으로 표현하는 추론 형태를 말한다. 이 접근은 요소의 위치·치수·계층 정보를 코드로 표현해 검증 가능한 시각적 워크스페이스를 제공한다. 결과적으로 텍스트만으로는 흔히 발생하는 기하학적 오류와 시각적 환각을 줄이는 효과가 관찰됐다.
- Supervised Fine-Tuning(SFT)
- — 전이된 기반 모델을 전문가 레이블(여기서는 SVG-포함 추론 궤적)로 감독 학습시켜 특정 출력 형식과 문법을 맞추는 단계이다. MentalThink는 SFT로 유효한 SVG 문법과 초기 시각 외현화 능력을 학습시킨 뒤 RL 단계로 논리적 정교화를 진행했다. SFT 데이터는 약 20만 샘플로 구성되어 시각-문법 정렬에 중점을 두었다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.