본문으로 건너뛰기
HF Daily Papers조회 1

터키어 형태소 중심의 신경 토큰화 및 단어 임베딩 Morpheus

Turkish는 agglutinative 언어로, 의미는 형태소 단위에 담겨 있으며, 기존의 subword 토크나이저는 형태소 정보를 보존하지 못하고 역추적 손실이 발생한다. Morpheus는 morphology-aware 토크나이저와 임베더를 하나의 모델로 결합해, training과 inference에서 동일한 형태소 분할을 학습하고, decode(encode(w))=w를 보장한다. 이로써 어휘 수준의 검색/매칭과 토큰-기반 생성을 모두 효과적으로 지원하는 단일 파이프라인을 제시한다.

왜 중요한가

Turkish는 agglutinative 언어로, 의미는 형태소 단위에 담겨 있으며, 기존의 subword 토크나이저는 형태소 정보를 보존하지 못하고 역추적 손실이 발생한다. Morpheus는 morphology-aware 토크나이저와 임베더를 하나의 모델로 결합해, training과 inference에서 동일한 형태소 분할을 학습하고, decode(encode(w))=w를 보장한다. 이로써 어휘 수준의 검색/매칭과 토큰-기반 생성을 모두 효과적으로 지원하는 단일 파이프라인을 제시한다.

핵심 기여

lossless morphology-aware Turkish tokenizer

Morpheus는 Morfessor의 경계 정보를 교사로 삼고 differentiable Poisson–binomial segmentation으로 soft morpheme memberships를 학습 중에 만들고, 추론 시에는 hard 경계로 정확히 복원한다. 이 경계 분할은 문자열 재정규화 없이도 가능하며, decode(encode(w))=w를 보장한다.

embedding을 한 forward pass에서 산출

토크나이저의 동일한 순전파를 통해 320-dim의 word embedding을 얻을 수 있으며, 이 임베딩은 루트 중심의 구조로 Morpheus 토크나이저와 함께 작동한다.

완전한 reversible 토크나이저로의 실현

평가 데이터에서 Morpheus는 100%의 roundtrip reversibility를 달성하며, WordPiece(58.2%), TurkishTokenizer(95.4%) 등의 대안은 역추적이 불가능한 경우가 존재한다.

루트-계열 검색에서 강력한 임베딩

루트-가족 검색 MAP은 Morpheus가 0.85로 최상이며, same-root 검증 ROC-AUC는 1.00으로 가장 우수하다. 이는 루트(identity) 중심의 컨트라스트 학습이 루트의 구성집합을 잘 정렬하기 때문

효율성 및 평가 체계의 종합적 개선

BPC 1.425로 가장 낮은 값을 달성하고, 64K 서브워드 토크나이저 대비 약 19%의 GPU 메모리 절감, 1.6×의 엔드-투-엔드 생성 속도 저하를 동반한다. MorphScore, TR-MMLU 토큰 품질 지표 등에서 서브워드 계열 대비 Morphology 측정에서 우수한 모습을 보인다.

핵심 아이디어 이해하기

단계 1: Turkish는 의미를 형성하는 주된 신호가 morpheme 경계이다. 기존 토크나이저는 세부 형태소를 무시하거나 역추적이 불가능한 경우가 많아, 생성 모델에서 원문 문자열의 faithful한 재생성을 저해한다. 단계 2: Morpheus는 boundary detector를 RoPE-에 기반한 self-attention으로 구성하고, 각 inter-character 위치의 경계 확률 pi를 pi = sigmoid(score(hi, hi+1))로 계산한다. 단계 3: 이 확률들을 이용해 differentiable Poisson–binomial DP를 수행하고, 각 문자 j가 어느 morpheme에 속하는지의 소프트 분포를 M[j,k]로 얻는다. 이 분포를 바탕으로 segment를 pooling해 각 morpheme의 벡터 sk를 만들고, 모든 segement 벡터의 평균으로 ew를 얻는다. ew는 2-layer FFN + Residual LayerNorm으로 정규화된다. 단계 4: 학습은 L = wauxLaux + wsgnsLsgns + wctrLctr + wmlm의 가중합 손실로 최적화되며, boundary 예측은 Gradients가 직접 목적 함수로 전달되도록 설계됐다. 이 구조 덕에 Morpheus는 토크나이저와 임베더를 하나의 forward pass에서 함께 최적화하고, decode(encode(w))의 보장을 유지한다.

방법론

데이터 및 전처리: Morpheus는 약 10GB의 단일 Turkish 코퍼스를 사용하고, 95/5로 train/test를 분할한다. Morfessor(교육자)로 경계를 얻고, 루트 어휘의 정합에 따라 내부 경계 중 루트-일치가 있을 경우 경계 중복을 제거한다. 입력 단어는 길이 32로 패딩되어 저장되며, 내부_boundary 라벨과 함께 per-word 토큰과 root id를 포함한다. 모델의 차원은 d=320이며, RoPE를 적용한 4층 self-attention으로 문자 표현을 얻는다. 경계 판별기는 인접 페어를 평가하여 각 i에서의 경계 확률 pi를 예측한다. 수식적 핵심은 다음과 같다: 입력 hi, hi+1에 대해 pi = sigmoid(score(hi, hi+1))이며, 이 pi로부터 독립적 이항 경계 비트를 bi를 sampling하고(Pr[bi=1]=pi), fj[k] 재귀로 Pi<j bi=k의 확률을 계산해 M[j,k]를 구성한다. 이 soft 분류는 학습 시에 미세하게 gradients를 전달하고, 추론 시에는 hard 분할로 전환된다. 분절된 각 k에 대해 sk를 αjk = M[j,k] exp(a(hj))으로 가중치를 두고, sk = sum_j αjk hj로 구한다. 단어 벡엔드 임베딩 ew는 S′개의 유효 segment의 벡터의 평균을 두-layer FFN과 LayerNorm으로 변환하여 얻어진다. 학습은 AdamW, cosine schedule, gradient clipping으로 10에폭 수행되며, 배치 512로 구성한다. 손실 구성요소는 Laux(경계 BCE + root-corrected Morfessor 라벨 카운트 규제), Lsgns(skip-gram negative sampling: 16 negatives, window=±6, context vocab 120K), Lctr(InForNoCe root identity contrastive), Lmlm(문장 내 20% 마스킹된 문자 재구성)로 구성된다.

관련 Figure

훈련/검증 손실(train/val loss) 그래프
Chart

총 손실과 boundary 예측 손실의 수렴 흐름을 보여주며, boundary 감독 신호가 초기 학습에서 빠르게 수렴하고, 네 가지 손실이 함께 수렴하는 학습 다이나믹스를 시사한다.

훈련/검증 손실(train/val loss) 그래프

auxiliary loss(aux_loss) 대 훈련 흐름
Chart

aux_loss의 수렴 곡선이 다른 손실보다 빠르게 줄어들며, teacher-anchored 초기 학습이 이후 distributional 학습으로 넘어가는 과정을 시각화한다.

auxiliary loss(aux_loss) 대 훈련 흐름

cosine learning-rate 스케줄 그래프
Chart

학습률이 코사인 스케줄로 감소하는 것을 확인할 수 있으며, auxiliary weight의 점진적 감소와 함께 학습 안정성을 뒷받침한다.

cosine learning-rate 스케줄 그래프

주요 결과

주요 결과는 다음과 같다. 재생성 여부: Morpheus는 30,204 inflected words에 대해 decode(encode(w))=w를 100% 달성하고, TurkishTokenizer는 95.4%로 비재생성적이며 WordPiece는 58.2%로 가장 낮다. BPC는 Morpheus가 1.425로 최저이며, BPE(1.436), Unigram(1.437), Morfessor(1.446)보다 작다. MorphScore macro-F1은 Morpheus가 0.61로 서브워드군의 ∼0.32보다 높고 TurkishTokenizer의 0.65에 근접하나 재생성 보장 측면에서 불리하다. SIGMORPHON 인플렉션에서 Morpheus는 lemma-prefix 0.76으로 Morfessor 이후 2위이며, Kalbur 루트-정정으로 루트-구간이 0.48로 향상된다. 언어 모델링 벤치마크에서는 동일 compute 대비 Morpheus의 BPC가 가장 낮고, TR-MMLU에서 Morpheus의 %Pure는 83.5%, %TR은 91.8%로 모든 토크나이저 중 최고이다. 임베딩은 BGE-M3(BERTurk 등) 대비 루트-가족 검색(AP MAP 0.85 vs 0.80/0.49)과 같은-루트 검증 ROC-AUC(1.00 vs 0.70/0.989)에서 우수하지만, NER이나 숫자/격변(probing) 같은 맥락 의존 태스크에서는 BERTurk/BGE-M3가 더 우수하다. 파라미터 수가 더 작고 static한 320-dim 임베딩을 사용하므로, 문맥 의존 태스크에는 제한적이다. 효율성 측면으로는 64K 서브워드 기반 토크나이저 대비 약 19%의 메모리 절감과 함께 토크나이저의 길이 증가로 인해 fertilities가 1.73 tokens/word로 증가한다. 토큰화 속도는 Morpheus의 encoder가 4.0M chars/s, decoder가 0.69M words/s로 측정되며, TurkishTokenizer가 가장 빠르나 Rust 백엔드의 차이로 해석된다. 종합적으로 Morpheus는 토큰화와 임베딩을 하나의 모델에서 제공하는 유일한 선택지가 될 수 있으며, 루트 중심의 어휘 인덱싱과 경량 컨텍스추얼 인코더를 결합하는 다중 벡터 RAG 시스템에 적합하다.

관련 Figure

decode(encode(w))의 대표 예시(라벨링된 분해 결과)
Diagram

사례별로 Morpheus의 분해가 surface를 보존하며, 다른 토크나이저가 surface를 재작성하거나 비재생성을 보이는 것을 대조한다.

decode(encode(w))의 대표 예시(라벨링된 분해 결과)

MorphScore/ SIGMORPHON 인플렉션 관련 도표
Chart

MorphScore macro-F1 및 lemma-prefix/root-in-segments 수치를 통해 Morpheus의 형태소 정렬과 루트 중심의 경향성을 시각화한다. TurkishTokenizer 대비 장단점을 비교하는 근거를 제공한다.

MorphScore/ SIGMORPHON 인플렉션 관련 도표

LM 학습/훈련 곡선(언어 모델링)**
Chart

같은 규모의 GPT 계열 모델에서 Morpheus로 학습했을 때 BPC 및 파라미터 효율이 비교되며, 토크나이저 선택이 언어 모델링 성능에 미치는 영향을 정량적으로 보여준다.

LM 학습/훈련 곡선(언어 모델링)**

pareto- frontier: BPC 대 generation throughput
Chart

토크나이저별 BPC와 엔드-투-엔드 생성 처리량 간의 trade-off를 시각화하여 Morpheus의 위치를 확인한다.

pareto- frontier: BPC 대 generation throughput

Bits-per-character(BPC) 비교 차트
Chart

토크나이저 간 BPC 비교에서 Morpheus가 가장 낮은 값(가장 효율적)을 기록하는 것을 보여주며, 비재생성 토크나이저를 제외한 상황에서의 성능 우수성을 지지한다.

Bits-per-character(BPC) 비교 차트

기술 상세

아키텍처 개요: 문자 인코더는 문자 임베딩에 대하여 로테리 포지션 인코딩 RoPE를 적용한 4층.self-attention으로 context-aware 문자 벡터 H=(h1,...,hL)을 얻는다. 경계 탐지기는 inter-character 위치 i에서 pi = sigmoid(score(hi, hi+1))를 출력하는 4층 RoPE 기반 셀프 어텐션을 거친 뒤 인접 페어 스코어링 헤드를 통해 얻는다. Differentiable Poisson–binomial segmentation: 이항 경계 벡터 bi ~ Bernoulli(pi)로 간주하고, Pi<j bi = k의 확률을 fj[k] 재귀로 계산하여 소프트 분포 M[j,k]를 얻는다. M은 각 문자 j가 어느 morpheme k에 속하는지에 대한 soft segment membership이다. 수식은 fj[k] = fj-1k + fj-1[k-1] p_{j-1} 이고, base는 f1[0] = 1이다. 분절 모듈은 soft-분류를 통해 gradient를 역전파하고, pi가 0 또는 1에 수렴할 때 M은 한 번의 hard 분절로 바뀐다. Segment pooling은 sk = sum_j α_jk h_j로 정의되며 α_jk ∝ M[j,k] exp(a(h_j))로 구성된다. 이때 a(·)는 학습 가능한 점수 함수이며, ew = LayerNorm(FFN( (1/S′) sum_k s_k ))로 정의되는 320-dim 임베딩으로 생성된다. 학습 손실은 L = waux Laux + wsgns Lsgns + wctr Lctr + wmlm Lmlm로 구성되며, Laux은 Morfessor 라벨에 대한 BCE 및 카운트 규제를 포함한다. Lsgns은 16 negatives, window=±6, context vocab=120K의 skip-gram 음수 샘플링이다. Lctr은 root identity에 대한 InfoNCE 대조 손실, Lmlm은 20% 단어를 마스킹하고 작은 인코더-디코더로 문자 단위 재구성이다. 학습은 AdamW, 코사인 학습률 스케줄, gradient clipping으로 수행되며, 배치 512, 10 에폭으로 훈련한다. 코어 매개변수는 d=320, max word length=32, 50K 하드 분절 어휘를 사용한다. Morpheus는 역방향성(encoder-Decoder)과 분절 구조를 통해 decode(encode(w)) = w를 보장하며, 320-dim 임베딩이 토크나이저의 동시에 산출된다.

한계점

고려된 한계로는 fertilty 증가로 인한 시퀀스 길이 증가와 엔진의 엔드-투-엔드 생성 지연이 있다. 또한 루트-중심 임베딩은 컨텍스트 의존 태스크(NER, 숫자/격변 분석)에서 정밀도가 떨어질 수 있으며, Turkish-specific 설계이므로 다른 언어에 일반화하기 어렵다. derivational morphology의 긴 형태소 체인에서 경계가 잘 구분되지 않는 경우도 있다.

실무 활용

Turkish NLU 및 sequence-labeling, 어휘 인덱스(루트 매칭, dedup, stemming) 등에 적합하며, 소형-중형 Turkish LM의 사전학습 및 메모리 제약 환경에서도 활용 가능하다. 컨텍스트 기반 인코더와의 조합으로 전체 파이프라인의 효율성과 faithful decoding을 함께 달성할 수 있다.

  • root-based lexical retrieval 및 dedup, stemming에 Morpheus 임베딩 활용
  • RAG 시스템의 lexical index로 Morpheus 토큰화를 사용해 속도와 메모리 효율성 향상
  • 작은 Turkish LM 사전학습 시 morphology-aware 토큰화와 임베딩으로 데이터 활용성 증가
  • 동형/nonce 형태의 새로운 Turkish 어휘에 대한 일반화 가능성 강화
  • 맥락 의존 태스크를 보완하는 보조 인코더로 컨텍스트-독립적 임베딩 제공

코드 공개 여부: 공개

코드 저장소 보기

키워드

morpheme-boundary model (형태소 경계 모델)lossless tokenizer (손실 없는 토크나이저)Poisson–binomial dynamic program (포아송-이항 동적 프로그래밍)reversibility (재생성 가능성)MorphScore (MorphScore)root-family retrieval (루트 패밀리 검색)contextual encoders (맥락 인코더)bits-per-character (BPC)
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 17.수집 2026. 06. 19.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.