본문으로 건너뛰기

ToolArtist: 완전 에이전트형 이미지 생성

UMM을 정책으로 삼아 검색·추론·네이티브 이미지 생성을 통합하고 RAD‑GRPO로 의도와 품질 보상을 결합해 개방세계 이미지 생성 정확도를 개선한 연구입니다.

왜 중요한가

현존하는 T2I 시스템은 텍스트-픽셀 정렬에는 강하지만 외부 지식, 역사·문화적 세부사항, 또는 다중단계 추론이 필요한 요청에서는 사실적 제약을 지키기 어렵습니다. ToolArtist는 UMM을 정책으로 사용해 누락된 정보를 탐지하고 TextSearch·ImageSearch를 호출한 뒤 그 증거를 동일한 멀티모달 컨텍스트에서 통합하여 네이티브로 이미지를 생성하도록 설계되어 있습니다. 이렇게 하면 검색·추론·생성이 분리된 파이프라인 대신 하나의 정책이 결과 수준 보상으로 전체 행동을 공동 최적화할 수 있어 지식 기반 이미지 생성 정확도가 향상됩니다.

핵심 기여

완전 에이전트형 이미지 생성 패러다임

이 논문은 툴 호출과 이미지 생성을 동일한 UMM 정책 하에 두는 '완전 에이전트형' 정의를 제시했습니다. 모델은 누락된 정보 식별→툴 선택 및 호출→응답 통합→네이티브 이미지 생성이라는 결정 흐름을 스스로 선택하며, 생성은 더 이상 외부 도구에 위임되지 않습니다. 이 통일된 정책 구조는 추론·툴 사용·그리기 행동 전체를 모델이 직접 학습하도록 만듭니다.

UMM용 포스트트레이닝 전략

교사 에이전트를 사용한 SFT 데이터 합성 및 변환 파이프라인을 설계하여 UMM이 도구 사용 행동과 자체 생성을 학습하게 했습니다. 변환 단계에서 외부 이미지 생성 호출은 숨기고 생성된 이미지는 시각 캡션 및 시각 토큰으로 보존하여 UMM이 네이티브로 이미지를 생성하도록 직렬화합니다. 이후 RAD‑GRPO로 온라인 상호작용 보상 신호를 적용해 의도와 품질 보상을 동시에 최적화했습니다.

고품질 공개 데이터와 전체 훈련 인프라

저자들은 변환·필터링 과정을 거쳐 최종적으로 7,132개의 고품질 SFT 궤적을 구축했습니다. SFT 코퍼스는 평균 20.5k 토큰, 평균 툴 호출 수 4.0으로 다중턴 검색·생성 시나리오를 중심으로 구성되어 있습니다. 수집된 데이터와 SFT·RL 파이프라인 전체를 공개해 후속 연구의 재현성과 확장성을 확보했습니다.

핵심 아이디어 이해하기

Emu3.5처럼 텍스트와 시각 정보가 동일한 토큰 어휘로 직렬화되는 UMM은 추론·툴 호출·이미지 생성을 하나의 autoregressive 컨텍스트에서 순차적으로 수행할 수 있습니다. ToolArtist는 이 특성을 정책으로 삼아 모델이 언제 검색해야 하고 언제 바로 그려야 하는지 결정하도록 학습시킵니다. SFT에서는 교사 에이전트가 TextSearch·ImageSearch·외부 생성기를 번갈아 사용한 실제 궤적을 수집해 외부 생성 호출을 네이티브 시각 토큰으로 바꿔 UMM이 자체 생성 행동을 모방하게 했고, 이후 RAD‑GRPO로 의도(intent)와 이미지 품질(quality) 보상을 결합해 전체 궤적을 온라인으로 최적화했습니다.

관련 Figure

이 도식은 세 가지 에이전트형 이미지 생성 패러다임을 비교한 개념도입니다. 상단은 UMM 기반의 사전정의 워크플로우, 중간은 프롬프트 최적화 에이전트, 하단은 ToolArtist의 완전 에이전트형 접근을 나란히 배치해 도구 호출과 이미지 생성이 정책에 포함되는지 여부를 시각적으로 구분합니다. 구성 요소와 흐름 화살표로 정책이 결정을 내리는 지점과 툴 호출·생성 행동의 위치를 명확히 전달합니다.
Diagram

도식은 본 논문의 핵심 개념적 차이를 입력→추론→툴 사용→생성의 순서와 정책 소유권 관점에서 정렬해 보여줍니다. 연구 방법론을 이해할 때 어떤 단계가 학습 대상인지(SFT에서 마스킹되는 토큰과 조건부 맥락의 구분)를 빠르게 파악할 수 있습니다. 모델 설계 의도를 전달하는 데 핵심적인 그림입니다.

이 도식은 세 가지 에이전트형 이미지 생성 패러다임을 비교한 개념도입니다. 상단은 UMM 기반의 사전정의 워크플로우, 중간은 프롬프트 최적화 에이전트, 하단은 ToolArtist의 완전 에이전트형 접근을 나란히 배치해 도구 호출과 이미지 생성이 정책에 포함되는지 여부를 시각적으로 구분합니다. 구성 요소와 흐름 화살표로 정책이 결정을 내리는 지점과 툴 호출·생성 행동의 위치를 명확히 전달합니다.

방법론

문제 설정은 개방세계(open‑world) 이미지 생성으로, 필요한 증거 𝒵가 외부 웹에서 능동적으로 검색되어야 한다는 점에 초점을 맞춥니다. SFT 단계에서는 교사 에이전트가 다중턴으로 TextSearch·ImageSearch·외부 생성기를 호출하여 원시 궤적을 만들고, 변환기는 외부 생성 호출을 시각 캡션과 시각 토큰으로 재작성해 UMM 입력으로 직렬화합니다. RL 단계에서는 RAD‑GRPO를 적용해 최종 캡션의 의도 보상과 이미지의 품질 보상을 결합한 그룹 상대 이득을 정책 토큰들에 동일하게 배분함으로써 추론·툴 사용·네이티브 생성을 동시에 최적화합니다. 보상 설계에는 형식 보상, draw 신호, 길이 패널티, no‑draw 패널티 같은 보조 신호가 포함되어 안정성과 목적 지향성을 보장합니다.

관련 Figure

이 그림은 SFT의 롤아웃·변환 파이프라인과 RL 단계의 RAD‑GRPO 흐름을 포함한 훈련 전반을 상세히 도식화했습니다. 교사 에이전트가 생성한 원시 궤적을 변환해 멀티모달 정책 샘플로 만드는 과정과 그 이후 그룹 상대 이득을 이용해 온라인으로 정책을 업데이트하는 절차가 포함됩니다. 각 블록은 입력, 처리, 출력의 역할을 구분해 구현 단계별 요구사항을 명확히 합니다.
Diagram

훈련 파이프라인에서 변환기 역할(외부 이미지 생성 호출을 시각 토큰으로 치환)과 SFT 마스크 적용 위치를 찾아볼 수 있어 재현에 필요한 전처리 규칙을 추적할 수 있습니다. RAD‑GRPO의 보상 합성 및 토큰 수준의 중요비율 계산이 어디에서 적용되는지도 이 도식으로 확인됩니다. 구현 관점에서 데이터 흐름과 학습 목표가 어떻게 맞물리는지 이해하는 데 유용합니다.

이 그림은 SFT의 롤아웃·변환 파이프라인과 RL 단계의 RAD‑GRPO 흐름을 포함한 훈련 전반을 상세히 도식화했습니다. 교사 에이전트가 생성한 원시 궤적을 변환해 멀티모달 정책 샘플로 만드는 과정과 그 이후 그룹 상대 이득을 이용해 온라인으로 정책을 업데이트하는 절차가 포함됩니다. 각 블록은 입력, 처리, 출력의 역할을 구분해 구현 단계별 요구사항을 명확히 합니다.

주요 결과

WISE 벤치마크에서 ToolArtist는 Overall 0.79를 기록했고 WorldGenBench-Humanities 평균 KCS는 22.10으로 본 논문에서 비교한 비독점(non‑proprietary) 공개 계열 중 최고 성능을 보였습니다. 비교 대상으로 제시된 Unify‑Agent와 GenSearcher‑Qwen‑Image보다 전반적인 지식 결합 능력과 지역·문화적 구체성에서 유의한 우위를 가졌습니다. 주요 기여 요소로는 소스 인지형 이미지 검색 요약의 도입과 RAD‑GRPO를 통한 궤적 수준 보상 최적화가 성능 향상에 기여했다는 실험 근거가 제시되어 있습니다.

관련 Figure

해당 그림은 다양한 개방세계 요청에 대해 ToolArtist가 생성한 출력 예시들을 격자 형태로 배치한 도판입니다. 문화적 요소·역사적 장면·지역적 풍경 등 여러 케이스가 포함되어 있으며 각 셀은 모델이 외부 증거를 통합해 생성한 시각적 결과를 보여줍니다. 이 도판은 모델의 활용 범위와 스타일 다양성, 그리고 복합적 지식 요구를 처리하는 능력을 직관적으로 확인할 수 있게 합니다.
Infographic

원본 이미지는 개별 생성 결과의 시각적 단서(의복·도구·지형 등)를 비교할 수 있어 WorldGenBench의 체크리스트 항목 충족 여부를 수동으로 검토하는 근거로 활용됩니다. 도판은 정성적 비교용으로, 특정 생성이 어느 증거(검색 이미지·텍스트 요약)에 의해 형성되었는지는 별도 로그로 추적해야 합니다. 시각적 품질과 지식적 적합성을 동시에 살펴보는 데 유용합니다.

해당 그림은 다양한 개방세계 요청에 대해 ToolArtist가 생성한 출력 예시들을 격자 형태로 배치한 도판입니다. 문화적 요소·역사적 장면·지역적 풍경 등 여러 케이스가 포함되어 있으며 각 셀은 모델이 외부 증거를 통합해 생성한 시각적 결과를 보여줍니다. 이 도판은 모델의 활용 범위와 스타일 다양성, 그리고 복합적 지식 요구를 처리하는 능력을 직관적으로 확인할 수 있게 합니다.

기술 상세

SFT에서는 교사 에이전트가 생성한 멀티턴 원시 궤적을 변환기로 직렬화해 정책 생성 토큰(𝐓)과 환경 반환 관찰(𝐎)을 구분합니다. 손실함수는 정책이 생성한 토큰에만 적용되며 마스크 M_{i,j}가 이를 선택해 평균화된 로그확률을 최소화합니다. RAD‑GRPO는 의도 보상 R^I와 품질 보상 R^Q를 결합해 최종 보상 R=αR^I+(1−α)R^Q(기본 α=0.5)를 구성하고, GRPO 식에서 모든 정책 생성 토큰에 동일한 그룹 상대 이득 Â_i를 적용합니다. 품질 보상은 faithfulness, visual correctness, text accuracy, aesthetics에 각각 0.1, 0.4, 0.4, 0.1 가중치를 부여하며, 보상에는 형식 보상·draw 신호·길이 패널티·no‑draw 패널티도 포함됩니다. 최종 SFT 코퍼스는 7,132개 궤적, 평균 입력 토큰 약 20.5k, 평균 툴 호출 수 4.0으로 구성되어 있습니다.

한계점

실험 결과는 비독점 공개 모델들 대비 우수하지만 일부 WISE 카테고리와 영역에서는 최첨단(소수의 상용 모델)이 여전히 앞서 있습니다. SFT 코퍼스의 범위는 7k 수준으로 다양성이 크나 여전히 커버리지 한계가 존재하며 이로 인해 드물거나 매우 지역 특화된 요소는 누락될 수 있습니다. RL 보상은 캡션 의도와 이미지 품질에 의존하므로 보상 신호 설계·가중치에 민감하며 잘못 설정하면 검색 과다나 비생성 모드로 편향될 위험이 있습니다.

실무 활용

ToolArtist의 설계는 역사적 장면, 특정 IP나 지역적 문화 요소, 세부 도구나 의복 같은 장기 지식이 필요한 이미지 생성 작업에 특히 적합합니다. 사용자 요청을 보완하기 위해 웹 검색과 이미지 검색을 조합해 참조를 모으고 이를 바탕으로 모델이 직접 이미지를 생성·수정합니다. 공개된 데이터와 코드 인프라는 연구자와 개발자가 에이전트형 이미지 생성 파이프라인을 재현하고 확장하는 데 실용적입니다.

  • 역사적 장면 재현이나 지역별 문화적 특성을 정확하게 반영해야 하는 교육용 이미지 생성
  • 브랜드·IP 가이드라인을 고려하여 장면을 구성해야 하는 상업적 일러스트레이션 제작
  • 지리·생태·도구 등 도메인 지식이 필요한 과학적 시각화·출판 이미지 제작
  • 멀티스텝 리서치가 필요한 콘텐츠 제작 파이프라인에서 자동화된 참조 수집과 초안 이미지 생성

코드 공개 여부: 공개

코드 저장소 보기

키워드

에이전트형 이미지 생성Unified Multimodal Model (UMM)RAD-GRPOSupervised Fine-Tuning (SFT)TextSearch·ImageSearch 툴 호출

추가 이미지 분석

해당 패널은 Socotra 사례의 정성적 비교도판으로, ToolArtist와 두 경쟁 기법의 생성 이미지를 나란히 보여줍니다. 비교 이미지를 통해 체크리스트 항목(도구·의복·가축·해안선 등) 중 어떤 부분을 만족하는지 시각적으로 확인할 수 있습니다. 케이스 기반 정성 평가 결과를 시각 자료로 보완하여 논문 내 정량 점수(KCS)를 보강합니다.
Photo

이 비교 도판은 논문이 주장하는 '지식 기반 정합성 개선'을 시각적으로 입증하는 역할을 합니다. 각 모델 출력의 구체적 차이(예: 전통 도구의 등장 여부, 지형 표현의 실존성)를 직접 대조할 수 있어 체크리스트 항목 충족 이유를 직관적으로 파악할 수 있습니다. 사례 설명과 함께 보면 평가표의 해당 체크포인트들이 어떤 시각 단서로 판단되었는지 연결할 수 있습니다.

해당 패널은 Socotra 사례의 정성적 비교도판으로, ToolArtist와 두 경쟁 기법의 생성 이미지를 나란히 보여줍니다. 비교 이미지를 통해 체크리스트 항목(도구·의복·가축·해안선 등) 중 어떤 부분을 만족하는지 시각적으로 확인할 수 있습니다. 케이스 기반 정성 평가 결과를 시각 자료로 보완하여 논문 내 정량 점수(KCS)를 보강합니다.

용어 해설

통합 다중모달 모델(Unified Multimodal Model (UMM))
UMM은 텍스트와 이미지를 동일한 토큰 시퀀스로 직렬화하여 하나의 autoregressive 모델로 처리하는 접근 방식이다. 입력으로는 언어 토큰과 시각 토큰이 섞인 시퀀스가 들어가고 모델은 다음 토큰 예측으로 문장·추론·이미지 생성까지 모두 수행한다. ToolArtist는 Emu3.5 같은 UMM을 정책(policy)으로 삼아 툴 호출과 네이티브 이미지 생성을 통합한다.
에이전트형 이미지 생성(Agentic Image Generation)
에이전트형 이미지 생성은 모델이 누락된 지식을 식별하고 외부 툴을 호출하며 검색 결과를 통합한 뒤 스스로 이미지를 생성·수정할 수 있도록 단일 정책으로 모든 행동을 결정하는 설정이다. 이 방식에서는 이미지 생성 자체가 에이전트의 액션(action)으로 포함되어 도구 호출과 동일한 정책 아래 학습된다. ToolArtist는 이 패러다임을 UMM의 포스트트레이닝으로 획득한다.
지도 미세조정(SFT)(Supervised Fine-Tuning (SFT))
SFT 단계에서는 교사 에이전트가 TextSearch·ImageSearch·외부 생성기를 사용해 생성한 다중턴 궤적을 수집한다. 변환기(converter)는 외부 이미지 생성 호출을 숨기고 생성된 이미지를 시각 토큰·시각 캡션으로 보존해 UMM이 자체 생성 행동을 학습하도록 직렬화한다. 최종적으로 7,132개의 고품질 궤적이 SFT 데이터로 유지되었다.
Reason–Act–Draw GRPO (RAD‑GRPO)(Reason–Act–Draw GRPO (RAD-GRPO))
RAD‑GRPO는 SFT로 초기화된 UMM 정책을 온라인 상호작용으로 추가 최적화하는 RL 알고리즘이다. 최종 생성 캡션의 의도(intent) 적합성과 디코딩된 이미지의 품질(quality)을 각각 보상으로 사용하고, 이 둘을 결합한 그룹 상대 이득(group-relative advantage)으로 이유·툴 사용·네이티브 생성 전체를 공동 최적화한다. 기본 결합 계수는 α=0.5이며 품질 보상은 faithfulness·visual correctness·text accuracy·aesthetics에 가중치 0.1/0.4/0.4/0.1을 부여한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 05.수집 2026. 08. 07.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.