본문으로 건너뛰기

LLaDA-o: 효과적이고 길이 적응형인 옴니 확산 모델

기존의 멀티모달 통합 모델들은 텍스트(이산형)와 이미지(연속형)의 서로 다른 특성으로 인해 학습이 불안정하거나 성능이 제한적이었다. LLaDA-o는 Mixture of Diffusion(MoD) 구조를 통해 각 매체에 최적화된 확산 방식을 사용하면서도 단일 신경망으로 통합하여, 고품질 이미지 생성과 정교한 시각적 이해를 동시에 가능하게 한다.

용어 해설

마스크 확산(Masked Diffusion)
텍스트 토큰 중 일부를 특수 마스크 토큰([M])으로 가린 뒤, 모델이 주변 문맥을 참조하여 원래의 토큰을 예측하도록 하는 이산적 확산 방식이다. 양방향 문맥 파악에 유리하며 병렬적인 토큰 생성을 가능하게 한다.
정류 흐름(Rectified Flow)
노이즈 분포와 데이터 분포 사이를 직선적인 경로로 연결하여 확산 과정을 모델링하는 기법이다. 생성 경로가 단순화되어 기존 확산 모델보다 적은 단계(Step)로도 고품질의 샘플을 생성할 수 있다.
KV 캐시(KV Cache)
Transformer 모델의 추론 과정에서 이전에 계산된 Key와 Value 행렬 값을 메모리에 저장해두고 다음 토큰 생성 시 재사용하는 기술이다. 시퀀스가 길어질 때 발생하는 중복 연산을 제거하여 추론 속도를 비약적으로 향상시킨다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 01.수집 2026. 03. 04.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.