본문으로 건너뛰기

이산 확산 모델: 토크나이제이션에서 생성까지의 통합 프레임워크

토크나이제이션을 핵심 설계축으로 삼아 이산 확산 모델의 상태공간 구성, 오염·역과정, 학습목적, 추론알고리즘 및 평가를 통합적으로 정리했다.

용어 해설

토크나이제이션(Tokenization)
원시 입력(텍스트, 이미지 패치, 단백질 서열 등)을 유한한 범주의 기호 집합으로 치환하는 과정이다. 이 과정은 어휘의 크기와 단위(서브워드·바이트·코드북 인덱스 등)를 결정하며, 이 결정이 전이 커널의 의미론적 거리, 복원 난이도, 샘플링 제약과 직접 결합한다. 따라서 토크나이제이션은 이산 확산 모델 설계에서 전처리가 아니라 모델링의 핵심 설계 축이다.
전이 행렬(Transition Matrix)
이산 확산의 순방향 오염 단계에서 범주 간 전이 확률을 기술하는 행렬이다. 각 행은 특정 토큰이 다음 시점에 어떤 토큰으로 바뀔지에 대한 분포를 정의하며 누적 전이행렬은 시점 t에서의 주변 분포를 직접 계산하게 한다. 전이 행렬의 구조(균등치환, 흡수/마스킹, 거리정렬 등)가 역과정의 난이도와 학습 목표를 규정한다.
벡터 양자화(Vector Quantization)
연속 신호(이미지·오디오 등)를 고정 크기 코드북의 인덱스로 압축하여 이산 토큰 시퀀스로 변환하는 기술이다. 인코더는 잠재 벡터를 학습된 코드북 항목 중 가장 가까운 항목으로 스냅하고 디코더는 해당 임베딩으로 복원한다. 코드북의 기하학적 성질이 의미적 유사성을 반영하면 구조화된 전이 커널을 통해 중간 노이즈 단계에서 정보 보존이 가능해진다.
흡수 상태(마스킹)(Absorbing State (Masking))
전방 프로세스에서 원래 토큰을 특별한 마스크 토큰으로 점진적으로 대체하는 오염 전략이다. 마스크 방식은 토큰 간 내재적 거리 개념을 필요로 하지 않으면서 빈칸 채우기 형식의 역과제(denoising)를 만든다. 텍스트·코드·생물학적 알파벳처럼 범주 간 유사성 정보가 없거나 불안정할 때 널리 사용된다.
코드북 위상(Codebook Topology)
코드북 항목들 사이의 기하학적 배치와 이로부터 유도되는 인접성 구조를 말한다. 코드북 위상이 입력의 지각적 또는 의미적 유사성을 잘 반영하면 전이 확률을 인접 코드 중심으로 설계하여 중간 단계에서 더 풍부한 신호를 유지할 수 있다. 반대로 위상이 무질서하면 구조화된 치환이 실패하고 반전 성능 및 학습 신호가 약해진다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 15.수집 2026. 07. 17.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.