본문으로 건너뛰기

Orthrus: Dual-View Diffusion으로 메모리 효율적인 병렬 토큰 생성을 위한 프레임워크

AR 기반 대형 언어 모델은 토큰 생성이 순차적으로 이뤄져 인퍼런스가 병목 현상을 겪는 한계가 있다. diffusion 기반의 병렬 생성은 속도를 올릴 수 있지만 품질 저하와 학습 비용 문제가 있다. Orthrus는 frozen AR 백본과 경량 diffusion head를 결합해 두 뷰가 동일한 고정 KV Cache를 공유하고, intra-model consensus로 lossless inference를 보장하며 병렬 생성을 가능하게 한다.

추가 이미지 분석

Ablation과 Throughput-Latency 관계를 보여주는 도표—K 값에 따른 Throughput 증가와 Latency의 변화를 동시에 제시
Diagram

병렬 블록 크기(K)가 Throughput에 미치는 영향을 정량화하여, K=32에서 최적임을 뒷받침한다.

Ablation과 Throughput-Latency 관계를 보여주는 도표—K 값에 따른 Throughput 증가와 Latency의 변화를 동시에 제시

용어 해설

KV 캐시(KV cache)
Transformer의 키-값 캐시를 재활용해 컨텍스트를 빠르게 재구성하는 메모리 구조. AR와 diffusion 뷰가 동일 KV 캐시를 공유함으로써 중복 저장을 피하고 대용량 컨텍스트를 효과적으로 처리할 수 있다.
Diffusion 헤드(Diffusion Head)
AR 백본의 고정된 표현 공간 위에 학습 가능한 diffusion 모듈을 추가해 병렬 토큰 생성을 수행하는 구성요소. 학습 시에는 AR의 예측분포를 확률적 분포로 소프트 디스틸레이션한다.
intra-모델 합의(Intra-Model Consensus)
Diffusion 뷰의 예측이 AR 뷰의 정확한 목표분포와 일치하도록 내부적으로 검증하고 채택/거절을 통해 최종 출력을 동기화하는 메커니즘.
앵커 블록 마스킹(Anchor-Block Masking)
훈련 시 각 블록에서 첫 토큰을 anchor로 두고 남은 토큰을 <mask>로 대체해 diffusion 뷰가 병렬 예측하도록 하는 마스킹 전략.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 12.수집 2026. 05. 15.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.