본문으로 건너뛰기

dLLM: 단순화된 디퓨전 언어 모델링 프레임워크

디퓨전 언어 모델(DLM) 연구는 파편화된 코드베이스로 인해 재현과 확장이 어려웠다. dLLM은 학습부터 평가까지 표준화된 파이프라인을 제공하며, 특히 기존 BERT나 GPT 모델을 적은 비용으로 DLM으로 변환할 수 있는 경로를 제시하여 연구 진입 장벽을 대폭 낮춘다.

용어 해설

디퓨전 언어 모델(Diffusion Language Model)
텍스트 데이터에 노이즈를 추가했다가 이를 다시 제거하는 과정을 통해 문장을 생성하는 모델이다. 모든 토큰을 한 번에 병렬로 생성하거나 문장 중간을 자유롭게 수정할 수 있는 유연성을 제공하며, 기존의 순차적 생성 방식인 자기회귀 모델의 대안으로 연구된다.
마스크 디퓨전(Masked Diffusion)
텍스트의 일부 토큰을 특수 마스크 토큰으로 가린 뒤, 모델이 주변 문맥을 이용해 가려진 원래 토큰을 예측하도록 하는 기법이다. 이미지 디퓨전의 가우시안 노이즈 대신 이산적인 마스킹을 사용하여 텍스트 데이터의 특성을 반영한다.
블록 디퓨전(Block Diffusion)
전체 문장을 여러 블록으로 나누어, 블록 간에는 순차적으로 연결하되 블록 내부의 토큰들은 디퓨전 방식으로 동시에 생성하는 하이브리드 접근법이다. 긴 문맥을 효율적으로 처리하면서도 생성 속도를 높일 수 있는 구조적 특징을 가진다.
지도 미세 조정(SFT)
특정 작업에 대한 정답 데이터셋을 사용하여 사전 학습된 모델을 추가로 학습시키는 과정이다. 이 논문에서는 대규모 추가 학습 없이 SFT만으로 기존 모델을 디퓨전 모델로 변환하는 효율적인 경로를 제시한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 26.수집 2026. 03. 03.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.