추가 이미지 분석

병렬 블록 크기(K)가 Throughput에 미치는 영향을 정량화하여, K=32에서 최적임을 뒷받침한다.
Ablation과 Throughput-Latency 관계를 보여주는 도표—K 값에 따른 Throughput 증가와 Latency의 변화를 동시에 제시
용어 해설
- KV 캐시(KV cache)
- — Transformer의 키-값 캐시를 재활용해 컨텍스트를 빠르게 재구성하는 메모리 구조. AR와 diffusion 뷰가 동일 KV 캐시를 공유함으로써 중복 저장을 피하고 대용량 컨텍스트를 효과적으로 처리할 수 있다.
- Diffusion 헤드(Diffusion Head)
- — AR 백본의 고정된 표현 공간 위에 학습 가능한 diffusion 모듈을 추가해 병렬 토큰 생성을 수행하는 구성요소. 학습 시에는 AR의 예측분포를 확률적 분포로 소프트 디스틸레이션한다.
- intra-모델 합의(Intra-Model Consensus)
- — Diffusion 뷰의 예측이 AR 뷰의 정확한 목표분포와 일치하도록 내부적으로 검증하고 채택/거절을 통해 최종 출력을 동기화하는 메커니즘.
- 앵커 블록 마스킹(Anchor-Block Masking)
- — 훈련 시 각 블록에서 첫 토큰을 anchor로 두고 남은 토큰을 <mask>로 대체해 diffusion 뷰가 병렬 예측하도록 하는 마스킹 전략.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



