본문으로 건너뛰기

Tokenizer Overlap

토크나이저 중복률

두 모델의 tokenizer.json에서 어휘 집합이 얼마나 겹치는지 비교하는 지표입니다. 더 작은 어휘 집합의 크기를 분모로 사용하면 한 모델의 어휘가 다른 모델의 엄격한 부분집합일 때 중복률이 1.0에 가까워져 기반 토크나이저 재사용을 포착할 수 있습니다.