본문으로 건너뛰기
HF Daily Papers조회 2

FlowInOne: 멀티모달 생성을 이미지 입력-이미지 출력 플로우 매칭으로 통합

기존 멀티모달 모델이 텍스트에 의존하여 시각적 추론에 한계가 있었던 것과 달리, 모든 입력을 시각적 프롬프트로 변환하여 단일 모델로 통합했다. 이를 통해 텍스트-이미지 생성부터 정밀한 이미지 편집, 물리 법칙 이해까지 하나의 시각적 공간에서 수행할 수 있는 새로운 패러다임을 제시한다.

용어 해설

플로우 매칭(Flow Matching)
확산 모델(Diffusion)의 대안으로 제시된 생성 모델링 기법으로, 소스 분포에서 타겟 분포로의 연속적인 이동 경로인 벡터 필드를 직접 학습한다. 노이즈 스케줄링이 필요 없고 결정론적인 추론이 가능하여 샘플링 효율성과 최적화 안정성이 높다.
시각적 프롬프트(Visual Prompt)
텍스트 지시사항이나 레이아웃 정보를 이미지 캔버스 위에 직접 렌더링하여 모델의 입력으로 사용하는 방식이다. 텍스트 인코더 없이도 기하학적 정렬과 의미론적 제어를 단일 시각 공간 내에서 처리할 수 있게 한다.
동형 잠재 공간(Isomorphic Latent Space)
서로 다른 데이터(예: 시각적 지시문과 타겟 이미지)가 동일한 구조와 차원을 공유하는 잠재 공간을 의미한다. 이를 통해 모달리티 간의 불일치를 해소하고 직접적인 데이터 전송(Transport)을 가능하게 한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 08.수집 2026. 04. 10.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.