본문으로 건너뛰기

WithEveryone으로 5명에서 10명까지 단체 이미지 생성

WithEveryone은 ID token, Layout CoT, LG-ID Loss를 결합해 5명에서 10명의 신원을 구분된 위치에 배치하며 Sim(Tgt) 0.499와 Dup 0.028을 기록했습니다.

용어 해설

신원 보존 이미지 생성(Identity-Preserving Generation)
참조 이미지에 담긴 사람의 얼굴 특징을 새 이미지에서도 유지하는 생성 방식입니다. 입력된 인물의 정체성 정보를 이미지 조건으로 전달하고, 생성된 얼굴이 참조 인물과 일치하도록 학습 손실을 적용합니다. 여러 사람을 동시에 다룰 때는 인물별 구분과 위치 연결까지 필요합니다.
ArcFace
얼굴 이미지를 512차원 embedding으로 변환해 사람의 신원 특징을 비교하는 얼굴 인식 모델입니다. WithEveryone은 참조 인물과 목표 인물의 embedding을 만들고, 예측된 얼굴의 신원 유사도를 계산하는 데 사용합니다. ID Representation Forcing와 LG-ID Loss의 신원 표현 공간으로도 활용됩니다.
Flow Matching
노이즈가 섞인 이미지 latent에서 깨끗한 이미지로 이동하는 속도장을 학습하는 생성 방법입니다. WithEveryone은 텍스트와 구조적 계획을 먼저 예측한 뒤 flow matching으로 목표 이미지 latent를 복원합니다. 현재 latent와 예측 velocity를 이용해 한 단계의 깨끗한 이미지 추정값을 만들고 LG-ID Loss를 적용합니다.
Layout Chain of Thought
여러 인물의 신원과 위치, 얼굴 영역, 신체 범위, 자세를 인과적 순서로 기록하는 구조적 계획 표현입니다. 모델은 2,002개의 좌표 토큰으로 각 축의 1,001개 위치를 표현하고, 앞서 결정한 인물과 영역을 조건으로 다음 배치를 예측합니다. 이후 결정론적 renderer가 이 계획을 캔버스와 시각 조건으로 변환합니다.
신원 분리 벤치마크(Identity-Disjoint Benchmark)
학습 데이터에 등장한 사람과 평가 데이터의 사람이 겹치지 않도록 구성한 평가 세트입니다. 이 논문에서는 5명에서 10명의 참조 인물을 포함한 실제 그룹 사진 210개를 사용하고, 평가 인물과 관련된 학습 샘플을 제거했습니다. 따라서 이미지 암기보다 보지 못한 인물에 대한 일반화 성능을 측정합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 20.수집 2026. 08. 22.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.