용어 해설
- 레지스터 토큰(Register Token)
- — 추가로 학습되는 특수 토큰으로 패치 토큰과 함께 트랜스포머 입력에 결합된다. 이 토큰은 손실에 직접 참여하지 않아 높은 노름 값을 흡수하거나 전역 정보를 집약하는 용도로 사용된다. 본문에서는 DiT에서 특이값 처리를 위한 슬롯으로 동작하며 패치 표현의 노이즈를 줄이는 역할을 수행한다.
- 토탈 변이(Total Variation)
- — 중간 표현의 공간적 부드러움을 정량화하는 지표로 인접 픽셀 간 값 차이를 합산해 계산된다. 값이 작을수록 특징 맵이 더 매끄럽고 큰 값은 고주파 노이즈가 많음을 의미한다. 논문에서는 register가 적용된 모델에서 TV가 낮아지는지를 비교해 고잡음 단계에서 표현이 정리되는지를 평가했다.
- 플로우 매칭(Flow Matching)
- — 확률적 생성과정의 연속성을 직접 모델링하는 학습 방식으로 확률 흐름을 맞추는 손실을 사용한다. 이미지 생성에서 노이즈 레벨별 목표 벡터장을 예측하도록 학습하여 샘플링을 수행한다. 본 연구의 pDiT 모델들은 ImageNet 256×256에서 flow matching으로 학습되었다.
- 픽셀 공간(Pixel Space)
- — 이미지의 원시 픽셀 값으로 직접 학습하는 공간을 의미하며 오토인코더 기반 잠재 공간과 대비된다. 고차원이고 구조화가 덜 되어 있어 중간 표현에 높은 노이즈와 큰 노름이 발생하기 쉽다. 본문에서는 픽셀 공간에서 register의 이득이 특히 뚜렷하게 나타남이 보고되었다.
- 리니어 프로빙(Linear Probing)
- — 학습된 표현의 정보량을 평가하기 위해 고정된 특징 위에 간단한 선형 분류기를 학습하는 방식이다. 특징이 얼마나 전역적 의미나 클래스 정보를 담고 있는지 측정하는 데 사용된다. 본문에서는 register 토큰 특징을 선형 프로빙해 일부 토큰이 높은 분류 정확도와 낮은 노름을 갖는 반면 다른 토큰은 노름만 큰 규격을 보였음을 확인했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
