본문으로 건너뛰기

FreeStyle: 커뮤니티 LoRA 마이닝을 통한 스타일–콘텐츠 이중 참조 생성의 자유로운 제어

스타일 참조와 콘텐츠 참조를 동시에 활용한 생성은 콘텐츠 구조 보존과 스타일 매칭의 균형을 필요로 한다. 대규모 트리플 데이터의 부재와 콘텐츠 누출 문제를 해결하기 위해 커뮤니티 LoRA를 조합 가능한 앵커로 활용하고, 두 단계 학습과 새로운 평가 지표를 도입한다.

왜 중요한가

스타일 참조와 콘텐츠 참조를 동시에 활용한 생성은 콘텐츠 구조 보존과 스타일 매칭의 균형을 필요로 한다. 대규모 트리플 데이터의 부재와 콘텐츠 누출 문제를 해결하기 위해 커뮤니티 LoRA를 조합 가능한 앵커로 활용하고, 두 단계 학습과 새로운 평가 지표를 도입한다.

핵심 기여

LoRA 기반 대규모 Style–Content Dual-Reference 데이터 구성

커뮤니티 LoRA weights를 스타일-콘텐츠 앵커로 삼아 Style Reference(SRef)와 Content Reference(CRef) 트리플을 다수의 base model에서 구축하고, 273k 트리플 데이터(FLUX), 33k(Qwen), 172k(Illustrious) 트리플 데이터 등을 생성한다.

오픈 벤치마크 및 VLM 기반 검증 점수 도입

Style-reference와 dual-reference 생성의 균형을 평가하는 벤치마크를 제시하고, VLM-based Verification Score를 도입해 스타일 전송의 신뢰성과 콘텐츠 보존 여부를 독립적으로 평가한다.

Stage-별 disentanglement를 위한 두 단계 학습 전략

Stage 1은 style-reference 생성을 위한 attention-level enrichment constraint를 적용하고, Stage 2는 dual-reference 설정에서 high-frequency RoPE 구성요소를 억제하는 frequency-aware RoPE modulation을 적용한다.

Style-Content disentanglement 데이터 파이프라인 및 LoRA 필터링

Stable LoRA 선별, Cartesian product 기반 듀얼-LoRA 조합의 Bilateral 검사, 대량 target triplet batch 생성으로 데이터 품질과 다양성을 확보한다.

핵심 아이디어 이해하기

출발점과 한계: diffusion 기반 이미지 생성에서 Style Reference(SRef)와 Content Reference(CRef)의 콘텐츠-스타일 누출 문제는 콘텐츠 구조 보존과 스타일 매칭의 균형을 어렵게 한다. Style reference의 누출은 주로 late denoising 단계의 attention 편향에서 기인하고, dual-reference 설정에서는 RoPE의 고주파 성분이 패치 단위의 스타일 복사를 가능하게 한다.

방법론

Stage 1은 style-reference 생성에 집중하고 attention enrichment으로 누출을 억제한다. Stage 2에선 dual-reference를 도입하고 RoPE의 주파수 구성요소를 조절해 고주파 포지션-매칭으로 인한 누출을 약화시키면서 전역 구조를 보존한다.

주요 결과

SRef 벤치마크에서 VLM-Style 7.142, Ver-S 0.482로 open-source 중 최상위 균형을 보였다. CRef+SRef 벤치마크에서도 VLM-Style 5.467, Ver-S 0.409를 기록했다. Ablation에서 Enrichment loss 제거 시 leakage 점수가 2.674에서 0.522로 감소; RoPE modulation 도입 시 1.047에서 0.453로 감소.

기술 상세

Architecture: 스타일 참조(SRef)와 콘텐츠 참조(CRef)를 다중 이미지 입력으로 처리하고, text branch는 vision-language model로 인코딩하며 flow-matching objective로 최적화한다. Stage 1에서 attention-level enrichment constraint를 First Transformer Block에 적용하고, Stage 2에서 frequency-aware RoPE modulation으로 dual-reference에서 고주파 포지션 누출을 억제한다. Training: Stage 1은 120k steps, Stage 2는 24k steps, 배치 크기 32, RoPE β=2, shf=0.9, slf=1.2, 8× H100 GPUs 사용. 데이터 파이프라인은 4.1에서 style-transfer 데이터 구성, 4.2에서 커뮤니티 LoRA 마이닝 및 트리플 데이터 생성으로 구성된다.

실무 활용

LoRA 기반의 대규모 스타일-콘텐츠 제어를 가능하게 하는 프레임워크로, 다양한 base model에서 SRef/CRef 트리플을 구성하고 이를 바탕으로 스타일-콘텐츠 조건 제어를 실현한다.

  • 다양한 스타일의 콘텐츠 재현: 콘텐츠 구조를 유지하면서 스타일을 다채롭게 바꾼 이미지 생성
  • 콘텐츠-스타일 누출 억제된 듀얼-참조 편집 워크플로 구축
  • 다기능 프롬프트를 통해 스타일-콘텐츠 조건을 조정하는 이미지 생성 서비스
  • 벤치마크 및 데이터셋 확장에 활용 가능

코드 공개 여부: 공개

코드 저장소 보기

키워드

LoRA Mining(LoRA 마이닝)Dual-Reference Generation(듀얼-참조 생성)Style Transfer(스타일 전이)Content Leakage(콘텐츠 누출)Disentanglement(해체)Attention-Level Enrichment(Att. 레벨 강화)RoPE Modulation(RoPE 변조)Content Alignment Score(CAS)

용어 해설

LoRA
LoRA는 사전 훈련된 모델의 가중치를 부분적으로 고정하고 특정 모듈만 미세조정하는 방법으로, 스타일이나 콘텐츠 범주를 제어하는 커스텀 프롬프트를 만드는 데 사용된다.
RoPE(로프)(RoPE)
Rotary Position Encoding으로 고차원 공간에서 위치 정보를 주파수 대역으로 변조해 Transformer의 주의 메커니즘에 위치 정보를 주입하는 방법이다.
DINOv2
DINOv2는 self-supervised 비지도 학습 기반의 비전 임베딩으로, 이미지 간의 구조를 포착하는 특징 벡터를 생성한다.
ONEIG
ONEIG은 스타일-유사성을 측정하는 벤치마크용 인코더 기반 지표로, 스타일과 콘텐츠를 구분하는 데 도움을 준다.
Content Alignment Score
CAS는 스타일 차이를 제거한 상태에서 콘텐츠 구조의 정합성을 측정하는 벤치마크 지표이다.
Qwen
Qwen은 이미지-텍스트 모델 계열로, VLM 기반 평가에 사용되는 백본 모델 중 하나이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 18.수집 2026. 06. 20.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.