본문으로 건너뛰기

Show-O 2: 단일 트랜스포머로 텍스트와 비디오를 통합하는 네이티브 멀티모달 모델 분석

단일 트랜스포머 아키텍처 내에서 텍스트 이해와 이미지/비디오 생성을 동시에 수행하는 네이티브 멀티모달 모델 Show-O 2의 아키텍처와 효율적인 학습 전략을 다룹니다.

챕터별 상세

03:50

네이티브 멀티모달 모델(UMM)의 지형

기존 LLaVA와 같은 모델은 고정된 Vision Encoder를 LLM에 연결하는 분리된(Decoupled) 방식을 사용하지만, Show-O 2는 단일 트랜스포머 내에서 모든 모달리티를 처리하는 네이티브 통합 방식을 지향한다. 이러한 방식은 모달리티 간의 간섭을 줄이고 텍스트-비디오 간의 교차 생성을 더 자연스럽게 만든다. 연구진은 이를 위해 이해(Understanding)와 생성(Generation)의 트레이드오프를 해결하는 데 집중했다.

네이티브 모델은 별도의 어댑터 없이 단일 가중치 세트 내에서 여러 데이터 유형을 직접 처리하는 모델을 의미한다.

05:30

이중 경로(Dual-Path) 아키텍처와 3D Causal VAE

시각 데이터를 처리하기 위해 3D Causal VAE를 도입하여 비디오의 시간적 연속성을 보존하면서 압축한다. 아키텍처의 핵심은 이중 경로 전략으로, SigLIP을 활용한 의미론적 레이어(Semantic Layer)는 고수준의 맥락을 파악하고, 프로젝터(Projector) 경로는 저수준의 픽셀 디테일을 유지한다. 이 두 경로의 정보를 결합하여 모델은 이미지의 의미와 시각적 품질을 동시에 학습한다.

VAE는 데이터를 잠재 공간으로 압축했다가 다시 복원하는 신경망 구조로, 생성 모델의 핵심 구성 요소이다.

10:10

Flow Matching을 활용한 시각 생성 혁신

Show-O 2는 이미지 및 비디오 생성을 위해 기존의 Diffusion 대신 Flow Matching 기법을 채택했다. Flow Matching은 데이터와 노이즈 사이의 직선적인 경로를 학습하므로 Diffusion보다 샘플링 효율이 높고 학습이 안정적이다. 텍스트는 기존처럼 자기회귀(Auto-regressive) 방식으로 처리하고, 시각 데이터는 Flow Matching 헤드를 통해 생성함으로써 두 방식의 장점을 단일 모델에 결합했다.

Flow Matching은 최근 Stable Diffusion 3 등 최신 모델에서 Diffusion의 복잡성을 해결하기 위해 도입되고 있는 차세대 생성 기법이다.

36:00

Omni-Attention 메커니즘의 작동 원리

서로 다른 모달리티가 혼합된 시퀀스를 처리하기 위해 Omni-Attention을 적용했다. 텍스트 토큰에 대해서는 이전 토큰만 참조하는 인과적(Causal) 어텐션을 유지하고, 시각 토큰에 대해서는 전체 문맥을 참조하는 양방향(Full-context) 어텐션을 허용한다. 이를 통해 모델은 텍스트의 논리적 흐름을 깨지 않으면서도 시각 정보의 전체적인 구도를 파악하여 일관성 있는 비디오를 생성한다.

어텐션 마스킹 전략에 따라 모델이 데이터를 참조하는 범위가 결정되며, 이는 모델의 추론 능력에 직접적인 영향을 미친다.

30:40

효율적인 2단계 학습 레시피와 비용 최적화

연구진은 제한된 자원으로 고성능 모델을 만들기 위해 2단계 학습 전략을 사용했다. 1단계에서는 LLM의 가중치를 고정한 채 이중 경로 구조와 시각 생성 헤드만을 학습시켜 시각적 이해도를 높인다. 2단계에서는 전체 모델을 미세 조정하여 텍스트와 시각 정보의 통합 능력을 완성한다. 이 방식은 7B 모델 기준 128개의 H100 GPU로 단 2.5일 만에 학습이 가능할 정도로 효율적이다.

학습 레시피는 모델의 성능을 결정짓는 데이터 구성, 학습 순서, 하이퍼파라미터 설정 등을 포괄하는 개념이다.

용어 해설

플로우 매칭(Flow Matching)
확산 모델(Diffusion Model)의 대안으로 제시된 생성 기법으로, 데이터와 노이즈 사이의 직선적인 확률 경로를 학습합니다. 복잡한 노이즈 스케줄링 없이도 효율적인 샘플링이 가능하여 고해상도 이미지 및 비디오 생성에 유리합니다.
옴니 어텐션(Omni-Attention)
텍스트의 인과적(Causal) 관계와 시각적 데이터의 전체 맥락(Full-context)을 동시에 처리할 수 있도록 설계된 어텐션 메커니즘입니다. 단일 트랜스포머 내에서 서로 다른 모달리티의 특성에 맞는 학습을 가능하게 합니다.
3D 인과적 변분 오토인코더(3D Causal VAE)
비디오 데이터를 압축하고 복원하는 오토인코더의 일종으로, 시간축의 인과성을 유지하면서 데이터를 처리합니다. 과거 프레임 정보만을 사용하여 현재를 인코딩하므로 스트리밍이나 실시간 비디오 생성에 적합합니다.
이중 경로 아키텍처(Dual-Path Architecture)
시각 정보를 고수준의 의미론적(Semantic) 정보와 저수준의 세부 픽셀(Projector) 정보로 나누어 처리하는 구조입니다. 모델이 이미지의 전체적인 맥락과 미세한 디테일을 동시에 학습할 수 있게 돕습니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 01. 15.수집 2026. 02. 21.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.