본문으로 건너뛰기

향상된 대형 언어 확산 모델

대부분의 최신 LLM은 autoregressive 학습과 causal attention에 의존하는 반면, 본 논문은 완전 양방향 masked diffusion으로 처음부터 대규모 학습한 8B 모델(iLLaDA)이 경쟁력 있는 성능을 달성함을 보여준다. 특히 수학과 추론·코드 벤치마크에서 autoregressive 강력 모델과 근접하거나 우수한 결과를 얻었다.

용어 해설

마스크드 디퓨전(Masked Diffusion)
문장 내 일부 토큰을 무작위로 M(마스크) 토큰으로 대체한 후 모델이 마스크된 위치의 원래 토큰을 복원하도록 학습하는 확률적 생성 목표이다. 본 논문에서는 마스킹 비율 t를 U[0,1]에서 샘플링하고 손실을 마스크된 토큰 수로 정규화(1/t)하여 모델이 다양한 마스킹 강도에서 정확한 복원을 학습하도록 만든다.
양방향 어텐션(Bidirectional Attention)
토큰이 좌우 문맥을 모두 볼 수 있게 하는 Transformer 어텐션 방식이다. 본 논문에서는 완전 양방향 attention을 사용해 비자동회귀(masked diffusion) 학습을 수행하며, 이를 통해 역추론(reversal)과 양방향 추론 능력 확보가 가능하다.
그룹드-쿼리 어텐션(Grouped-Query Attention (GQA))
쿼리 헤드를 그룹화하고 key/value 헤드를 줄여 KV 캐시 형태의 메모리 사용량을 절감하는 어텐션 변형이다. 캐시 기반 구현에서 key/value 상태의 메모리 풋프린트를 줄여 긴 컨텍스트에서 효율적이다.
가변 길이 생성(Variable-Length Generation)
생성 시 고정 길이 대신 블록 단위로 마스크를 붙이고 디퓨전 샘플러를 돌려 자신감 높은 토큰을 고정한 뒤 필요한 경우 다음 블록을 이어 붙여 생성하는 방식이다. 불필요한 패딩을 줄여 추론 효율을 높인다.
신뢰도 기반 점수화(Confidence-based Scoring)
다중 선택 평가에서 후보 정답의 각 토큰을 반복적으로 가장 모델이 자신 있어 하는 위치부터 순차적으로 공개하고 해당 토큰들의 로그확률 합을 스코어로 사용하는 규칙이다. 우도 기반 점수보다 다중선택에서 성능이 높은 것으로 보고됐다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 24.수집 2026. 06. 26.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.