TL;DR
복합 이미지 생성과 편집은 단일 모델 호출로 해결할 수 없는 연쇄적인 국소 작업들(생성, 분할, 추출, 편집, 합성, OCR, 보강)을 요구한다. 본 연구는 각 단계에서 중간 결과를 검사하고 자산을 추적하며 다음 도구 호출을 동적으로 결정하는 실행 가능한 경로 학습을 통해 이러한 복잡한 워크플로를 자동화했다. 이 접근은 단일 모델 기반 편집이 놓치는 상태 유지와 도구 간 의존성 문제를 직접 다루어 실무적 편집·합성 작업의 자동화 가능성을 크게 확장했다.
왜 중요한가
복합 이미지 생성과 편집은 단일 모델 호출로 해결할 수 없는 연쇄적인 국소 작업들(생성, 분할, 추출, 편집, 합성, OCR, 보강)을 요구한다. 본 연구는 각 단계에서 중간 결과를 검사하고 자산을 추적하며 다음 도구 호출을 동적으로 결정하는 실행 가능한 경로 학습을 통해 이러한 복잡한 워크플로를 자동화했다. 이 접근은 단일 모델 기반 편집이 놓치는 상태 유지와 도구 간 의존성 문제를 직접 다루어 실무적 편집·합성 작업의 자동화 가능성을 크게 확장했다.
핵심 기여
대규모 실행 가능한 도구 사용 데이터셋 CanvasCraft 구축
CanvasCraft는 140K의 완전 주석 SFT 트레이스와 10K의 RL 과제 명세를 포함해 도구 체인, 중간 자산, 파라미터, 최종 이미지까지 실행 가능한 워크플로 전체를 기록했다. 데이터셋은 11개 이질적 시각 도구를 포괄하며 난이도(R/L/D)별로 샘플을 분류해 장기 계획과 도구 다양성 학습을 지원한다. 특히 품질 검증 단계를 포함해 JSON 파라미터 유효성, 자산 참조 일관성, 실행 성공 여부를 보장한 점이 특징이다.
도구 보강 멀티모달 에이전트 CanvasAgent 설계와 두 단계 학습
CanvasAgent는 시각 상태를 관찰하고 중간 결과를 점검하며 도구 호출을 생성하는 도구 오케스트레이터 역할을 수행한다. 학습은 먼저 CanvasCraft-SFT로 Supervised Fine-Tuning을 수행해 합법적 호출 포맷과 자산 참조 규칙을 학습하고, 이후 GRPO 기반 강화학습으로 장기 계획과 도구 선택·파라미터화를 개선했다. 이 두 단계 설계는 초기의 안정성과 이후의 탐색 능력을 결합해 실행성 높은 정책을 확보했다.
과정·결과를 결합한 하이브리드 보상 설계
하이브리드 보상은 최종 이미지의 정렬성(R_align)과 미학(R_aes) 점수에 더해 트레이젝토리 합리성(R_traj)과 규칙 기반 실행성(R_rule)을 결합해 보상값을 산출한다. 규칙 보상은 호출 형식 검증, 인자 스키마 유효성, 자산 참조 유효성, 도구별 사양 검사, 실제 실행 성공 여부를 항목별로 점수화하고 효율성 패널티로 과잉 호출을 억제한다. 이 구성은 보상 해킹을 줄이고 최종 산출물 품질과 실행 프로세스의 유효성을 동시에 개선하는 방향으로 학습을 유도했다.
핵심 아이디어 이해하기
복합 이미지 편집은 여러 단계의 도구 호출을 통한 상태 전이가 핵심이다. 기존의 단일 호출 기반 생성·편집 방식은 중간 산출물을 명시적으로 관리하지 않아 후속 작업이 필요할 때 상태 불일치가 발생했다. 따라서 본 연구는 중간 자산을 명시적으로 식별하고 참조하는 실행 가능한 트레이스(executable trajectory)를 학습 대상으로 삼았다. SFT 단계는 전문가가 만든 트레이스를 통해 합법적 도구 호출 형식, 인자 스키마, 자산 참조 관행을 모델에 각인시킨다. 이로 인해 모델은 도구 이름과 구조화된 파라미터를 안정적으로 생성할 수 있게 되었으며, 이후 강화학습 단계에서의 탐색이 불법 호출로 인한 실패에 덜 민감해진다. 그러나 SFT만으로는 장기적 도구 조합이나 더 나은 순서 탐색을 발견하기 어렵다. 강화학습 단계에서는 GRPO를 사용해 같은 과제에서 다수의 롤아웃을 비교하고 상대적 보상으로 정책을 갱신한다. 하이브리드 보상은 결과 기반 점수와 과정 기반 점수를 동시에 반영해, 단순히 많은 도구를 호출하는 정책이 아닌 목표 달성과 과정 유효성을 모두 만족하는 정책을 선호한다. 이 조합은 롤아웃 동안 중간 관찰을 이용해 계획을 수정하고, 불필요한 호출을 줄이며 필요한 도구를 적시에 사용하는 행동을 유도한다. 결과적으로 도구 오케스트레이션 관점에서 핵심 직관은 무엇보다 '시각 상태의 명시적 추적'과 '과정 기반 검증'이다. 중간 산출물을 자산으로 관리하면 후속 도구가 정확한 입력을 참조할 수 있고, 규칙적 실행 검사와 LLM 판정의 결합 보상은 정책이 실행가능성·미학·정렬성 사이의 절충을 학습하도록 만든다. 이는 복합 편집 과제를 단일 블랙박스 호출로 해결하려던 기존 접근과 본질적으로 다른 작업 정의를 제시한다.
방법론
데이터 구성은 도구 체인 템플릿 설계, 적합 이미지 샘플링, 역공학을 통한 사용자 지시문 생성, 실제 도구 실행 및 품질 검증의 파이프라인으로 이루어졌다. CanvasCraft-SFT는 각 단계별 추론(reason), 도구 호출(tool_call), 구조화된 파라미터, 중간 자산, 최종 이미지를 포함하는 완전 주석 트레이스를 제공해 지도학습 초기화를 가능하게 했다. CanvasCraft-RL은 기대 도구 집합과 난이도(R/L/D)를 주어 에이전트가 다양한 도구 순서와 파라미터를 탐색하도록 설계되었다. 학습 프레임워크는 두 단계로 구성되었다. 첫 단계 SFT는 CanvasCraft-SFT로 다음 토큰 예측을 수행해 합법적 호출 포맷과 자산 참조 규칙을 학습시켰다. 두 번째 단계에서는 GRPO(Group Relative Policy Optimization)를 사용해 CanvasCraft-RL 상에서 여러 롤아웃의 상대 보상에 따라 정책을 업데이트함으로써 장기 계획 능력과 도구 선택 전략을 향상시켰다. 도구 스택은 11개로 통합되었으며 각 도구는 구조화된 입력·출력을 가진 JSON 스타일 스키마로 구현되었다. 주요 도구에는 Generation(FLUX.2-Klein-4B), Edit(FLUX 기반), Grounding(Grounding-DINO), Segmentation(SAM), Extract(Python script), Overlay, Crop, OCR(Paddle-OCR), Rotate, Flip, SR(Real-ESRGAN) 등이 포함되었다. 도구별로 요구 인자와 출력 타입이 정의되어 있어 포맷 보상과 실행 보상이 정확히 검증될 수 있었다. 보상 설계는 결과 기반 점수(R_align, R_aes)와 과정 기반 점수(R_traj, R_rule)를 가중합하는 하이브리드 구조를 채택했다. R_rule은 포맷 보상, 액션 유효성, 효율성 패널티로 세분화되어 각 호출의 이름·스키마·자산 참조·사양 적합성·실행 성공을 점수화한다. 효율성 패널티는 실패, 반복 호출, 과도한 길이, 비용 기준 초과, 기대 도구 누락을 각 항목으로 penalize해 불필요한 호출을 억제했다.
관련 Figure

이 그림은 CanvasCraft의 SFT·RL 서브셋, CanvasAgent의 SFT 초기화 및 GRPO 최적화 흐름, 실행 중 중간 자산 추적과 도구 호출 순환을 시각적으로 연결한다. 각 구성요소가 어떤 입력과 출력을 주고받는지, 그리고 평가 지표(정렬·미학·트레이젝토리·규칙)가 학습에 어떻게 반영되는지를 구조적으로 보여준다.
CanvasCraft와 CanvasAgent의 전체 파이프라인 개요를 도식화한 그림으로 데이터셋 구성, 두 단계 학습, 에이전트 실행 흐름을 한 눈에 나타낸다.

그림은 SFT 데이터가 단순한 입출력 쌍이 아니라 각 단계의 <reason>과 <tool_call>, 중간 산출물을 포함하는 실행 가능한 트레이스로 구성된다는 점을 시각적으로 강조한다. 품질 검증 조건(파싱 가능성, 파라미터 유효성, 자산 일관성, 실행 성공성)이 필터링 단계로 명시되어 데이터 신뢰도를 확보하는 절차를 보여준다.
CanvasCraft-SFT 샘플 생성 파이프라인을 단계별로 나타낸 도표로 도구 체인 설계, 이미지 샘플링, 역공학적 지시문 생성, 실제 도구 실행과 품질 점검을 포함한다.

해당 그림은 RL용 샘플이 기대 도구 세트와 난이도 라벨을 제공해 에이전트가 다양한 도구 순서와 파라미터를 탐색하도록 설계되었다는 점을 명확히 한다. 또한 DeepSeek-V4-Flash와 인간 검수를 통해 모호하거나 일관성 없는 샘플이 제거되는 파이프라인의 정제 과정을 보여준다.
CanvasCraft-RL의 생성 파이프라인을 보여주는 도표로 과제 차원(R/L/D) 설계와 초기 이미지 생성, 도구 집합 주석, 인간 검수 과정을 포함한다.
주요 결과
주요 비교군으로는 SFT만 학습된 변종, SFT+GRPO로 학습된 CanvasAgent, 일반 MLLM에 도구를 장착한 모델들이 평가되었다. CanvasAgent(SFT+RL)는 전체 하이브리드 보상에서 0.821을 획득해 SFT 전용(0.557)과 미학·정렬성·트레이젝토리 점수에서 유의한 상승을 보였다. 평균 도구 호출 수는 SFT만 1.320에서 SFT+RL에서 5.436으로 증가해 RL이 더 풍부한 다단계 조작을 유도했음이 확인되었다. 어블레이션에서 SFT+RL 조합이 최적 성능을 냈고 보상 구성 요소의 역할이 분명히 드러났다. 결과 신호를 제거하면 정렬성과 미학이 하락하고 과정 점수는 유지되는 반면, 과정 신호를 제거하면 트레이젝토리 점수가 급감해 실행 가능성 기반 규칙의 중요성이 확인되었다. RL 단독 학습은 SFT 초기화 없이 불안정한 탐색으로 정렬성·미학 점수가 낮아 SFT 기반 초기화의 필요성이 실험적으로 입증되었다. 사람 평가에서는 제한된 샘플(12개)에서 CanvasAgent가 다른 모델보다 Task Alignment, Key Details Alignment, Aesthetic Quality에서 높은 평균 점수를 얻었다. 자동 판정(LLM-as-judge)과 사람 평가가 일관된 경향을 보였고 이는 LLM 판정자와 규칙 검증을 결합한 보상 설계가 인간 지각과 부분적으로 정렬된다는 근거를 제공했다. 단 정량적 결과는 논문에 제시된 평가셋과 메트릭에 한정되므로 다른 환경 일반화는 추가 검증이 필요하다.
관련 Figure

이 도표는 실제 사례를 통해 어떻게 도구 체인이 설계되고 역공학으로 지시문이 만들어지며 도구 실행을 통해 중간 산출물이 생성되는지를 단계별로 보여준다. 사례는 다중 이미지 입력과 텍스트 추출·번역·재구성·합성을 포함해 논문의 적용 범위와 복잡도를 구체적으로 보강한다.
SFT와 RL 샘플 예시를 포함한 그림으로, 사용자 지시문, 중간 자산, 도구 호출 시퀀스, 최종 이미지와 평가 항목을 사례별로 제시한다.
기술 상세
전체 아키텍처는 기반 멀티모달 LLM(Qwen3-VL-8B-Instruct 기준)을 도구 인터페이스로 확장한 형태이다. 모델 출력은 자유 텍스트와 JSON-형식의 <tool_call> 블록을 포함할 수 있으며, 각 도구 호출은 명시적 인자와 자산 레퍼런스를 포함해 외부 도구 런타임에서 실행 가능하도록 설계되었다. 실행 성공 시 생성된 산출물은 자산 집합에 추가되어 이후 단계의 입력으로 사용된다. 핵심 메커니즘은 SFT로 획득한 합법적 호출 포맷과 GRPO 기반 정책 최적화의 결합이다. SFT는 CanvasCraft-SFT의 140K 트레이스를 통해 포맷 보상과 초기 행동 분포를 확보했고 GRPO는 CanvasCraft-RL의 10K 과제를 사용해 여러 롤아웃의 상대 보상으로 정책을 갱신했다. GRPO는 추가 가치 모델 없이 그룹 내 상대 보상으로 안정적 업데이트를 제공하도록 설계되었다. 하이브리드 보상 수식은 다음과 같다: R(τ)=0.3·R_align(τ)+0.1·R_aes(τ)+0.2·R_traj(τ)+0.4·R_rule(τ). 여기서 R_align과 R_aes는 LLM 판정자로부터의 결과 점수이며 R_traj는 트레이스의 합리성을 평가하는 판정자 점수이다. R_rule은 포맷(R_format)·액션 유효성(R_action)·효율성 패널티(λ_eff·P_eff)를 결합하며, R_action은 N개의 호출에 대해 각 호출의 이름 유효성, 인자 스키마 충족, 자산 레퍼런스 유효성, 도구별 사양 확인, 실행 성공 여부를 가중합한 쿼션으로 정의된다. 수식 해석 예시는 다음과 같다: 단일 트레이스 τ에서 각 호출의 유효성 q_i는 이름·스키마·참조·사양·실행의 다섯 항목으로 구성되며 이들의 가중합이 R_action의 항목별 평균을 결정한다. 효율성 패널티 P_eff는 실패·반복·길이·비용·누락 항목을 합산해 과도한 호출을 감점한다. 이 구조는 입력(트레이스)→검사(포맷·실행·판정)→보상(가중합)을 명확히 분리해 정책이 실행 가능성과 결과 품질을 동시에 최적화하도록 유도한다. 구현 및 학습 세부사항으로는 8대의 NVIDIA A800 GPU에서 7일간 학습을 수행했으며 도구 실행은 별도 GPU에서 호스팅해 실제 도구 환경에서 롤아웃이 가능하도록 구성했다. 기반 모델은 Qwen3-VL-8B-Instruct이며 LLM-as-judge는 Qwen3.5-Plus를 사용했다. 도구 백엔드는 각 도구별로 FLUX.2-Klein-4B, Grounding-DINO, SAM, Paddle-OCR, Real-ESRGAN 등 실제 모델·스크립트를 연결해 실행 가능성을 확보했다.
관련 Figure

그림은 트레이스의 자산 집합(A_i) 업데이트 규칙과 도구별 출력이 다음 단계 입력으로 어떻게 연결되는지를 실체 수준에서 보여준다. 특히 OCR→재구성→합성의 폐쇄형 루프와 중간 자기검증(active self-check) 호출의 사용이 시각적으로 드러나 기술적 세부를 보강한다.
구체적 트레이젝토리 예시를 캡처한 그림으로 각 단계의 SAM 마스크, OCR 결과, 편집 전후 이미지를 포함해 자산 흐름을 시각화한다.
한계점
논문에서 명시한 한계로는 고정된 11개 도구 집합에 의존한다는 점이 있다. 또한 보상 설계에서 외부 MLLM 판정자(Qwen3.5-Plus)에 의존해 판정자의 편향이 학습에 영향을 줄 가능성이 존재한다. 마지막으로 RL 롤아웃에 실제 도구 실행이 필요해 계산 비용과 배포 복잡도가 증가하며 확장성과 실시간 적용성에서 제약이 따른다.
실무 활용
CanvasAgent는 복합 편집·합성 작업을 자동화하는 실무 도구 파이프라인의 초기 핵심 구성요소로 활용될 수 있다. 중간 자산 관리와 실행성 검증을 포함하므로 광고 제작, 디지털 합성, 다중 소스 이미지 편집 워크플로에 적용 가능성이 높다. 다만 현재 구현은 고정된 11개 도구 세트와 외부 판정자를 필요로 하므로 생산 환경 적용 전 도구 확장과 평가 자동화가 요구된다.
- 광고·콘텐츠 제작 파이프라인에서 원본 이미지의 텍스트 추출·번역·재삽입을 자동화하는 워크플로
- 다수 입력 이미지에서 객체를 추출·보정해 최종 장면에 자연스럽게 합성하는 배치 편집 작업
- 다단계 편집이 필요한 포토리터칭 작업을 일괄 처리해 시간 단축과 일관성 확보
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Tool Orchestration
- — 다양한 시각 처리 도구를 순차적으로 호출·결합해 하나의 최종 이미지 산출물로 이어지게 하는 과정이다. 각 단계는 이전 단계의 산출물을 자원으로 참조하고 파라미터를 동적으로 결정해야 하며, 잘못된 호출은 전체 실행 실패로 이어진다. 본 논문에서는 이 과정을 모델이 직접 계획하고 검증하도록 학습시키는 것이 핵심 목표이다.
- Hybrid Reward
- — 최종 결과의 정렬성 및 미학 점수와 실행 과정의 형식·실행 유효성·효율성 패널티를 결합한 다중 구성 보상함수이다. LLM 기반 정성적 판정(R_align, R_aes)과 규칙 기반의 정량적 검사(R_rule, R_traj, P_eff)를 가중합해 보상 신호를 산출한다. 이 보상은 롤아웃 동안의 도구 선택과 파라미터 결정을 함께 최적화하도록 설계되었다.
- Executable Trajectory
- — 사용자 명령을 여러 단계의 도구 호출(도구 이름, 구조화된 인자, 산출물 참조)으로 분해한 시퀀스이며 각 호출은 실제로 도구 환경에서 실행 가능한 형식이어야 한다. 경로에는 중간 이미지, 마스크, 추출물과 같은 시각 자산의 상태가 명시적으로 포함되어 이후 단계의 입력으로 사용된다. CanvasCraft-SFT는 이러한 실행 가능한 경로를 대규모로 수집해 지도학습 초기화에 사용한다.
- SFT
- — 전문가가 생성한 실행 가능한 도구 호출 트레이스에 대해 다음 토큰 예측 손실로 모델을 학습시키는 단계이다. 본 논문에서는 CanvasCraft-SFT의 완전 주석 트레이스를 사용해 초기의 합법적 도구 호출 포맷과 자산 참조 규칙을 획득시켰다. SFT는 이후의 강화학습이 불안정하게 탐색하는 문제를 완화하는 역할을 수행했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.