본문으로 건너뛰기

나의 첫 번째 실전 워크플로우! Multi-LLM 프롬프팅과 Union ControlNet을 활용한 Z-Image-Turbo 의사 에디터

ComfyUI 기반으로 로컬 비전 LLM과 프롬프트 재작성 LLM, Union ControlNet을 통합하여 사진을 편집하는 Z-Image-Turbo 워크플로우이다.

실용적 조언

  • ComfyUI에서 복잡한 워크플로우를 만들 때 대시보드 노드를 활용하면 조작 편의성을 크게 높일 수 있다.
  • 비전 LLM을 전처리 단계에 배치하면 수동 프롬프트 입력 없이도 원본 이미지의 맥락을 유지한 편집이 가능하다.

섹션별 상세

01
워크플로우의 핵심은 로컬 비전 LLM을 활용한 이미지 분석 단계이다. 입력된 원본 사진을 비전 모델이 분석하여 텍스트 묘사를 생성하고, 이를 다시 두 번째 LLM이 프롬프트 형식으로 재작성하여 이미지 생성 모델에 전달하는 구조를 갖췄다.
ComfyUI로 구성된 복잡한 이미지 편집 워크플로우의 전체 노드 구조와 대시보드 화면이다.
Diagram상단에는 컨트롤 그룹과 기능 제어 노드들이 배치되어 있으며, 중앙의 홈 베이스에서 실제 이미지 처리가 이루어진다. 하단 출력 그룹에서는 Canny, Depth, Pose 등 ControlNet의 중간 결과물과 최종 생성된 이미지를 확인할 수 있어 전체적인 데이터 흐름을 보여준다.
02
Union ControlNet을 지원하여 사용자가 이미지의 구조를 유지하면서 스타일이나 내용을 변경할 수 있도록 설계됐다. Canny, Depth, Pose 등 다양한 제어 방식을 선택적으로 적용할 수 있는 유연성을 확보했다.
03
사용자 편의를 위해 커스텀 UI 대시보드를 구축했다. 복잡한 노드 연결을 직접 다루지 않고도 토글 컨트롤, 매뉴얼 사이즈 조절, 시드 제어 등을 한곳에서 관리할 수 있는 컴팩트한 인터페이스를 제공한다.
04
이미지의 가로세로 비율(Aspect Ratio)을 자동으로 감지하는 기능이 포함되어 있다. 원본 이미지의 규격에 맞춰 생성 모델의 설정을 자동으로 조정함으로써 수동 설정의 번거로움을 줄이고 작업 효율을 높였다.

용어 해설

컴피UI(ComfyUI)
노드 기반의 그래프 인터페이스를 사용하여 스테이블 디퓨전 워크플로우를 설계하고 실행할 수 있는 도구이다. 복잡한 파이프라인을 시각적으로 구성할 수 있어 고급 사용자들 사이에서 널리 사용된다.
컨트롤넷(ControlNet)
이미지 생성 시 구도, 자세, 외곽선 등 특정 조건을 추가로 입력하여 생성 결과물을 정밀하게 제어하는 기술이다. 텍스트 프롬프트만으로는 부족한 세부적인 구조 유지를 가능하게 한다.
비전 거대언어모델(Vision LLM)
이미지를 입력받아 그 내용을 텍스트로 설명하거나 분석할 수 있는 멀티모달 인공지능 모델이다. 이 워크플로우에서는 원본 사진의 특징을 파악하여 프롬프트를 생성하는 용도로 사용된다.
Z-이미지-터보(Z-Image-Turbo)
매우 적은 단계(Step)로 고품질 이미지를 생성할 수 있도록 최적화된 실시간 이미지 생성 모델이다. 빠른 피드백이 필요한 편집 작업에 적합하다.

언급된 도구

ComfyUI추천

노드 기반 이미지 생성 워크플로우 설계

Z-Image-Turbo추천

고속 이미지 생성 및 편집 모델

ControlNet추천

이미지 구조 및 구도 제어

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 08.수집 2026. 03. 08.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.