Krea 2 기반 인물 보존 이미지 편집용 LoRA 워크플로 팩
Krea 2 Raw를 기반으로 한 LoRA로 지시문 기반 이미지 편집을 수행하면서 참조 인물의 텍스처와 의인성을 보존하는 도구이다.
TL;DR
Krea 2 Identity Edit는 Krea 2 Raw(12.9B)를 기반으로 한 커뮤니티 LoRA로, 자연어 지시문과 입력 이미지를 결합해 인물의 텍스처·조명·의상을 보존하면서 장면을 재배치하거나 국소 편집을 수행한다. 듀얼 컨디셔닝(in-context VAE tokens + Qwen3-VL 인코딩)을 통해 참조 충실도를 높이며 grounding_px, 해상도 및 종횡비 같은 하이퍼파라미터로 편집의 국소성 대 정체성 보존을 조절한다. 배포는 ComfyUI-Krea2Edit 노드 팩 의존성과 krea-2-community-license 하에 이루어지며, 두 인물 입력에서 얼굴 드리프트·대규모 삭제 실패 등 구체적 한계와 대응 레시피가 README에 명시되어 있어 실무 적용 시 재시도와 체인 편집 전략이 필요하다.
핵심 역량
- 인물 재배치와 재조명 기능은 동일 인물의 텍스처·점·흉터와 같은 미세 식별자를 보존하면서 새로운 장면과 카메라 각도에 맞춰 얼굴과 의상을 재배치할 수 있다. 이 기능은 'same face, same outfit' 유형의 지시문에 초점을 맞추어 인물의 외형적 특징을 유지한 채 배경·조명을 바꾸는 작업에 적합하다. 다만 README의 한계에 따르면 얼굴의 기하학적 특성이 극단적으로 독특한 경우에는 비율이 평균 쪽으로 보정될 수 있다.
- 국소 편집 기능은 이미지의 일부를 재색상하거나 객체를 추가·제거·교체하는 작업에서 원본 프레임의 다른 부분을 비교적 잘 보존한다. 편집 시 지역성(locality)을 유지하도록 학습되었으나 때때로 전반적인 색조 변화나 주변 픽셀 변화가 발생할 수 있어 결과 비교와 재시도가 권장된다. 대규모 삭제 작업은 'Raw/CFG 3' 레시피와 더 많은 스텝을 쓰는 것이 안정적이다.
- 참조 교체(replace-with-reference)는 대상 교체를 학습한 동작으로 작동해 예컨대 사람을 다른 참조(예: 유인원)로 교체할 때 프레임 구성과 조명을 보존하려는 성향을 유지한다. 두 입력(장면+인물) 방식은 의상·배치 측면에서 작동성이 실험적으로 보고되며 얼굴에 대해서는 드리프트가 발생할 수 있다. 이를 완화하려면 단일 참조 삽입을 체인으로 적용하는 워크플로우가 안내되어 있다.
- 외부 LoRA와의 조합이 가능해 캐릭터·신체·스타일 LoRA를 추가로 스택하여 출력의 prior를 조절할 수 있다. 이 방식은 닫힌 편집 도구에서 구조적으로 허용되지 않는 추가적 제어를 제공하며 다양한 스타일·캐릭터 제어를 실험할 수 있게 한다. 조합시 각 LoRA의 강도와 grounding_px 값을 조절해 균형을 맞추는 것이 요구된다.
강점
- 인물의 텍스처와 미세식별자(점·흉터 등)를 높은 충실도로 유지하는 편집 능력은 이 LoRA의 핵심 강점이다. 듀얼 컨디셔닝 구조가 텍스처 정보를 보존하는 역할을 하며 결과적으로 리라이팅된 조명과 카메라 각도에서도 원본 식별성이 비교적 잘 유지된다. 복합 편집 작업에서 원본과의 비교 재시도가 가능한 워크플로우가 마련되어 있어 실무 적용성이 높다.
- 외부 LoRA와의 조합성은 사용자 정의 prior 조절을 가능하게 해 여러 스타일·캐릭터 조합을 실험할 수 있게 한다. 이 구조적 유연성은 닫힌 상용 편집 도구에서 제공하기 어려운 확장성을 제공한다. 단, LoRA 간 상호작용 관리를 위해 각 LoRA 강도와 grounding_px 튜닝이 필요하다.
- README에 실무 권장값과 실패 모드가 명시되어 있어 적용 실패 시 원인 규명과 대처가 비교적 용이하다. 예컨대 종횡비 불일치·고해상도 생성·높은 CFG 설정에서 발생하는 보존 저하 사례와 대응 레시피가 제공되어 있다. 이로 인해 반복적 실험을 통해 안정적인 파이프라인을 구축하기 수월해진다.
훈련 방식
Krea 2 Raw 기반의 커뮤니티 LoRA 파인튜닝으로, 듀얼 컨디셔닝 전략을 사용해 인컨텍스트 VAE 토큰과 Qwen3-VL 이미지 인코딩을 동시 입력으로 처리했다. 이 방식은 참조 이미지의 텍스처·조명 정보를 조건으로 명시적으로 주입해 편집 시 식별성 보존을 강화하도록 설계되었다. 파인튜닝은 Krea 2의 768/1024급 해상도 트레이닝 쌍을 기준으로 이루어져 해상도·종횡비 조건이 결과에 큰 영향을 미친다.
알아두면 좋은 것
- 이 프로젝트는 비공식 커뮤니티 파인튜닝으로 Krea 2 Raw(12.9B single-stream MMDiT)를 기반으로 제작되었으며 Krea.ai의 공식 제품이 아니다. 배포는 krea-2-community-license 하에 이루어지며 ComfyUI-Krea2Edit 노드 팩을 필요로 한다. 해당 노드 팩이 없으면 듀얼 컨디셔닝 입력 처리가 불가하므로 워크플로우가 정상 동작하지 않는다.
- 훈련은 듀얼 컨디셔닝으로 이루어져 인컨텍스트 VAE 토큰과 이미지 기반 Qwen3-VL 인코딩을 동시에 사용한다. 이 구조는 참조 이미지의 텍스처·조명 정보를 모델 컨디션으로 명시적으로 주입해 정체성 보존을 강화한다. 따라서 편집 시 텍스처 충실도는 높은 편이지만 얼굴 기하학의 극단적 특이성은 보정될 수 있다.
- 사용자에게 권장되는 설정이 README에 구체적으로 제시되어 있어 실제 파이프라인 적용 시 안정적 결과를 얻기 위한 실무 지침으로 활용 가능하다. 권장 해상도는 2MP 이하이며 종횡비 일치와 grounding_px, LoRA 강도(1.0) 등이 핵심 하이퍼파라미터로 안내되어 있다. 특정 작업군(예: 큰 삭제)은 별도의 레시피(Turbo vs Raw, 스텝 수, CFG)로 처리하라고 권장한다.
- 한계 항목에서 정직하게 품질 저하 원인과 회피책을 나열하고 있어 품질 관리에 필요한 재시도·체인 편집 전략·LoRA 스택 활용을 실무적으로 적용할 수 있다. 특히 두 인물 입력의 얼굴 드리프트와 아웃핏 교체의 불안정성 등 구체적 현상이 명시되어 있다. 이로 인해 사용자 측 테스트·비교·재시도가 편집 워크플로우의 일부로 자리잡아야 한다.
기술적 특징
- 듀얼 컨디셔닝 아키텍처는 인컨텍스트 VAE 토큰과 Qwen3-VL 기반 이미지 인코딩을 동시에 입력으로 사용해 편집 조건을 강화한다. 이 구조는 텍스처·조명·작은 표식의 보존성을 높이는 데 기여하며 단일 입력 기반 편집보다 참조 충실도가 우수하다. ComfyUI-Krea2Edit 노드 팩이 이 듀얼 입력 경로를 제공하므로 해당 노드가 없으면 동일한 처리가 불가능하다.
- grounding_px 파라미터를 훈련 범위(512–1536)로 지정해 편집의 국소성 대 전체 정체성 보존 사이의 균형을 조절할 수 있게 설계되었다. 낮은 grounding_px 값은 편집 대상에 강하게 매칭되도록 유도하고 높은 값은 인물의 전반적 정체성 보존을 강화한다. 사용자 실험을 통해 768을 기본값으로 권장하며 사람 편집에는 1024 이상의 값도 시험해보라고 안내한다.
- 모델이 LoRA 형태로 배포되므로 원본 Krea 2 파라미터를 변경하지 않고 가중치 덧셈 방식으로 편집 능력을 추가한다. 이로 인해 저장·배포 효율이 높고 기존 Krea 2 워크플로우에 비파괴적으로 통합할 수 있다. 또한 LoRA 강도에 따라 편집 영향도를 실시간으로 조절할 수 있어 사용자 제어성이 높다.
- 훈련 데이터와 설정은 768/1024 클래스의 동일 크기 트레이닝 페어에 기반해 제작되어 출력 품질이 원본 해상도·종횡비에 민감하게 반응한다. README는 해상도 2MP 이하 및 종횡비 일치를 권장하며 이를 어길 경우 보존 저하나 피사체 복제 같은 artifacts 발생 가능성을 경고한다. 따라서 실무 적용 시 입력 전처리와 출력 크기 선정이 중요한 제약으로 작동한다.
차별점
- Krea 2 Raw 기반의 LoRA로 제공되어 원본 모델을 보존하면서 편집 기능을 추가하는 비파괴적 통합이 가능하다. 이 접근은 전체 모델을 교체하거나 대형 체크포인트를 다시 배포하지 않아도 새로운 편집 능력을 적용할 수 있게 한다. 결과적으로 배포·실험 비용이 낮고 기존 파이프라인에 손쉽게 스택할 수 있다.
- 듀얼 컨디셔닝(인컨텍스트 VAE 토큰 + Qwen3-VL 인코딩)을 활용해 텍스처·조명 정보를 보다 직접적으로 편집 조건으로 주입한다. 이 차별점은 단일 이미지 조건 입력만 사용하는 편집기법보다 참조 충실도를 개선하는 효과로 연결된다. 단, 이를 위해 ComfyUI 전용 노드 팩이 필요하다는 운영적 전제가 존재한다.
- 사용자가 외부 LoRA를 스택해 prior를 조정할 수 있도록 설계되어 캐릭터·스타일·바디 제어를 유연하게 조합할 수 있다. 이 구조는 닫힌 상용 편집 도구와 달리 모듈식 실험을 허용한다. 다만 LoRA 간 상호작용 관리를 위해 하이퍼파라미터 튜닝이 필요하다.
이미지 분석




581
Likes
0
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.