jdopensource/JoyAI-Image-Edit
강화된 공간 이해(scene parsing·relational grounding·instruction decomposition)를 이용해 객체 이동·회전·카메라 뷰 변경 같은 지침 기반 이미지 편집을 수행하는 멀티모달 foundation 모델이다.
TL;DR
JoyAI-Image-Edit은 지침(Instruction)-기반 이미지 편집을 목표로 하는 멀티모달 foundation 모델로, 장면 파싱(scene parsing), 관계 기반 정렬(relational grounding), 지시문 분해(instruction decomposition) 같은 공간 이해 역량을 중심으로 설계되었다. 이러한 구성은 사용자가 명시한 영역이나 객체에 대해 정확한 색상·위치·회전 변경을 적용하고 카메라 뷰를 조정하는 등 제어 가능한 편집을 가능하게 한다. 추론 파이프라인은 transformers의 텍스트 인코더와 diffusers 유틸리티를 활용하며, 성능을 위해 flash-attn >= 2.8.0 설치를 권장한다. CLI는 steps, guidance-scale(기본 4.0), basesize(256/512/768/1024) 같은 파라미터를 통해 품질과 속도를 조정할 수 있고, --rewrite-prompt 플래그로 LLM 기반 프롬프트 전처리를 선택할 수 있다. 기능적으로는 Object Move, Object Rotation, Camera Control 같은 명확한 프롬프트 템플릿을 통해 영역 지향 편집을 수행하며 multi-GPU 환경에서는 hsdp-shard-dim을 통한 FSDP 샤딩을 지원한다. 다만 README에는 기반 모델 세부(예: 백본 아키텍처, 파라미터 수)와 정량적 벤치마크가 기재되어 있지 않아 성능 비교·자원 요구량 추정에는 제약이 있다.
핵심 포인트
- 공간적 편집 템플릿(Object Move/Rotation/Camera Control)을 명확한 규칙과 함께 제공해 특정 영역 조작을 구조적으로 처리한다
- 지시문 분해 및 관계 기반( relational grounding ) 공간 이해를 모델 목표로 삼아 복합 편집을 영역 단위로 정확히 적용하도록 설계되었다
- LLM 기반 프롬프트 재작성 옵션과 FSDP 샤딩 파라미터를 통해 지침 전처리 및 분산 추론을 함께 지원하는 통합형 추론 워크플로를 제공한다
- 사용자 지시문에 따라 이미지 내 특정 영역을 정밀하게 편집(색상 변경·객체 이동·객체 회전 등)
80
LIKES
0
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.