vocab-partitioning
어휘 분할 (k-means)
전체 어휘를 k-means 클러스터링으로 분할해 N개의 서로 배타적인 하위집합으로 나누는 기법으로, 각 특수 토큰이 특정 하위집합에 대해 가중치를 예측하도록 설계했다. 이렇게 하면 단일 토큰이 전체 어휘 차원을 예측하는 병목을 우회한다. 논문에서는 N=16을 기본값으로 사용했다.
어휘 분할 (k-means)
전체 어휘를 k-means 클러스터링으로 분할해 N개의 서로 배타적인 하위집합으로 나누는 기법으로, 각 특수 토큰이 특정 하위집합에 대해 가중치를 예측하도록 설계했다. 이렇게 하면 단일 토큰이 전체 어휘 차원을 예측하는 병목을 우회한다. 논문에서는 N=16을 기본값으로 사용했다.