텍스트-투-이미지
텍스트 프롬프트를 입력으로 받아 신경망(주로 diffusion 또는 transformer 기반 생성기)이 학습된 시각 패턴을 사용해 이미지를 출력하는 기법으로, 프롬프트 토큰 → 모델의 조건화 → 픽셀·토큰 생성 순으로 동작해 다양한 스타일과 내용을 생성할 수 있다.