용어 해설
- 도구 오케스트레이션(Tool Orchestration)
- — 다양한 시각 처리 도구를 순차적으로 호출·결합해 하나의 최종 이미지 산출물로 이어지게 하는 과정이다. 각 단계는 이전 단계의 산출물을 자원으로 참조하고 파라미터를 동적으로 결정해야 하며, 잘못된 호출은 전체 실행 실패로 이어진다. 본 논문에서는 이 과정을 모델이 직접 계획하고 검증하도록 학습시키는 것이 핵심 목표이다.
- 하이브리드 보상(Hybrid Reward)
- — 최종 결과의 정렬성 및 미학 점수와 실행 과정의 형식·실행 유효성·효율성 패널티를 결합한 다중 구성 보상함수이다. LLM 기반 정성적 판정(R_align, R_aes)과 규칙 기반의 정량적 검사(R_rule, R_traj, P_eff)를 가중합해 보상 신호를 산출한다. 이 보상은 롤아웃 동안의 도구 선택과 파라미터 결정을 함께 최적화하도록 설계되었다.
- 실행 가능한 경로(Executable Trajectory)
- — 사용자 명령을 여러 단계의 도구 호출(도구 이름, 구조화된 인자, 산출물 참조)으로 분해한 시퀀스이며 각 호출은 실제로 도구 환경에서 실행 가능한 형식이어야 한다. 경로에는 중간 이미지, 마스크, 추출물과 같은 시각 자산의 상태가 명시적으로 포함되어 이후 단계의 입력으로 사용된다. CanvasCraft-SFT는 이러한 실행 가능한 경로를 대규모로 수집해 지도학습 초기화에 사용한다.
- Supervised Fine-Tuning(SFT)
- — 전문가가 생성한 실행 가능한 도구 호출 트레이스에 대해 다음 토큰 예측 손실로 모델을 학습시키는 단계이다. 본 논문에서는 CanvasCraft-SFT의 완전 주석 트레이스를 사용해 초기의 합법적 도구 호출 포맷과 자산 참조 규칙을 획득시켰다. SFT는 이후의 강화학습이 불안정하게 탐색하는 문제를 완화하는 역할을 수행했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.




