용어 해설
- 토크나이제이션(Tokenization)
- — 원시 입력(텍스트, 이미지 패치, 단백질 서열 등)을 유한한 범주의 기호 집합으로 치환하는 과정이다. 이 과정은 어휘의 크기와 단위(서브워드·바이트·코드북 인덱스 등)를 결정하며, 이 결정이 전이 커널의 의미론적 거리, 복원 난이도, 샘플링 제약과 직접 결합한다. 따라서 토크나이제이션은 이산 확산 모델 설계에서 전처리가 아니라 모델링의 핵심 설계 축이다.
- 전이 행렬(Transition Matrix)
- — 이산 확산의 순방향 오염 단계에서 범주 간 전이 확률을 기술하는 행렬이다. 각 행은 특정 토큰이 다음 시점에 어떤 토큰으로 바뀔지에 대한 분포를 정의하며 누적 전이행렬은 시점 t에서의 주변 분포를 직접 계산하게 한다. 전이 행렬의 구조(균등치환, 흡수/마스킹, 거리정렬 등)가 역과정의 난이도와 학습 목표를 규정한다.
- 벡터 양자화(Vector Quantization)
- — 연속 신호(이미지·오디오 등)를 고정 크기 코드북의 인덱스로 압축하여 이산 토큰 시퀀스로 변환하는 기술이다. 인코더는 잠재 벡터를 학습된 코드북 항목 중 가장 가까운 항목으로 스냅하고 디코더는 해당 임베딩으로 복원한다. 코드북의 기하학적 성질이 의미적 유사성을 반영하면 구조화된 전이 커널을 통해 중간 노이즈 단계에서 정보 보존이 가능해진다.
- 흡수 상태(마스킹)(Absorbing State (Masking))
- — 전방 프로세스에서 원래 토큰을 특별한 마스크 토큰으로 점진적으로 대체하는 오염 전략이다. 마스크 방식은 토큰 간 내재적 거리 개념을 필요로 하지 않으면서 빈칸 채우기 형식의 역과제(denoising)를 만든다. 텍스트·코드·생물학적 알파벳처럼 범주 간 유사성 정보가 없거나 불안정할 때 널리 사용된다.
- 코드북 위상(Codebook Topology)
- — 코드북 항목들 사이의 기하학적 배치와 이로부터 유도되는 인접성 구조를 말한다. 코드북 위상이 입력의 지각적 또는 의미적 유사성을 잘 반영하면 전이 확률을 인접 코드 중심으로 설계하여 중간 단계에서 더 풍부한 신호를 유지할 수 있다. 반대로 위상이 무질서하면 구조화된 치환이 실패하고 반전 성능 및 학습 신호가 약해진다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


