TL;DR
하이브드 선형 어텐션(GDN)은 long-context 추론에서 KV-cache 비용을 줄이지만, 새로 도입된 recurrent dynamics의 초기화가 성능에 큰 영향을 미친다. 교사 모델의 투영만 복사하는 기존 전이는 교환된 동적 파라미터의 decay, write 게이트, output 게이트를 제대로 설정하지 못하면 초기 제로샷 품질이 저하되고 추가 distillation 토큰이 필요하다. Taylor-Calibrate은 교사 attention 통계를 활용해 decay, write 게이트, value scale, output 게이트를 초기화하고, 레이어 단위 정렬으로 빠른 보정을 수행함으로써 초기 성능을 향상시키고 downstream recovery를 가속한다.
왜 중요한가
하이브드 선형 어텐션(GDN)은 long-context 추론에서 KV-cache 비용을 줄이지만, 새로 도입된 recurrent dynamics의 초기화가 성능에 큰 영향을 미친다. 교사 모델의 투영만 복사하는 기존 전이는 교환된 동적 파라미터의 decay, write 게이트, output 게이트를 제대로 설정하지 못하면 초기 제로샷 품질이 저하되고 추가 distillation 토큰이 필요하다. Taylor-Calibrate은 교사 attention 통계를 활용해 decay, write 게이트, value scale, output 게이트를 초기화하고, 레이어 단위 정렬으로 빠른 보정을 수행함으로써 초기 성능을 향상시키고 downstream recovery를 가속한다.
핵심 기여
Dynamical-transfer로의 초기화 재정의
전이 과정에서 단순히 projection을 복사하는 데 그치지 않고, recurrent dynamics의 decay, write, output-gate를 교사 attention 통계로 초기화하는 프레임을 제시한다.
Taylor-Calibrate: 2단계 초기화 절차
Phase 1은 Taylor-guided calibration으로 decay, value-scale, write 게이트, output 게이트의 초깃값을 설정하고, Phase 2는 calibration 데이터로 각 변환된 GDN 레이어의 출력이 교사 출력과 일치하도록 layer-local alignment를 수행한다.
다중 교사 설정과 레이어 정책 평가
네 가지 교사 설정과 세 가지 retain-layer 정책에 대해 zero-shot 성능 및 토큰 복구 속도를 평가하고, naive 초기화 대비 향상된 시작점과 빠른 회복을 확인한다.
토큰 효율성 개선 및 재현성
Taylor-Calibrate은 초기 토큰 비용을 줄이고 recovery 속도를 높이며, 4.9×~9.2×의 토큰 절감으로 품질에 도달하는 시간을 단축한다. 공유 코드가 GitHub에 공개되어 재현을 용이하게 한다.
방법론
- 전체 설정: 교사 Transformer를 부분적으로 Softmax-attention으로 유지하고 나머지는 GDN으로 대체하는 하이브리드 구성에서, 교사 투영(Q/K/V/O)을 재사용하는 표준 전이(backbone)를 기반으로 한다. - Phase 1: Taylor-derived Calibration - dh( head별 평균 look-back distance)와 eh( entropy) 등을 교사 어텐션에서 계산해 decay(dt_bias)와 write gate(β⋆)를 설정하고, value-path의 스케일(WV)과 output-gate의 초기 값을 결정한다. 또한 g_proj를 작은 게이트로 초기화하고, W_V를 sigma⋆로 스케일한다. - Phase 2: Per-layer Alignment - 각 변환된 GDN 레이어에서 z_S^(ℓ)(x; θℓ)와 z_T^(ℓ)(x)을 calibration 입력으로 비교해 L_init(ℓ)를 최소화하도록 θℓ를 업데이트한다. - 최적화 대상은 W_Q/W_K/W_V/W_O, A_log, dt_bias, a_proj, b_proj, g_proj 등이며 calibration 데이터는 소규모 코퍼스다.
주요 결과
- 메인 벤치마크에서 Taylor-Calibrate은 zero-shot Avg를 일관되게 향상시키고, 토큰 예산이 같은 경우보다 빠른 회복을 보인다. 예를 들어 100M 토큰 시나리오에서 Qwen2.5-1.5B의 Uniform 정책에서 Baseline 대비 Avg가 크게 개선되고, Qwen3-8B에서도 비슷한 추세를 보인다. - Recovery: Stage 1에서 초기 시작점이 더 낮은 손실 상태를 제공하며, Stage 2의 토큰 수를 크게 줄여 교사 수준의 품질에 빠르게 도달한다. 100M 토큰에서의 개선 폭은 모델에 따라 2–3배 이상, 일부 설정에서 4–9×의 토큰 절감으로 나타난다. - Ablation: Phase 1_ANALYTICAL calibration만으로는 충분치 않으며, Phase 2의 layer-local alignment가 필요하다. Alignment만으로도 상당한 개선이 가능하지만, 두 단계의 결합이 최적의 Avg를 제공한다. - Long-context: RULER 지표는 여전히 교사에 도달하기까지 시간이 더 필요하며, Stage 2 이후에도 추가 recovery 학습이 필요하다.
관련 Figure

Phase 1 초기화가 zero-shot Avg를 크게 향상시킬 수 있음을 보여준다. core_intuition/ results에 연계
Zero-shot 퍼플렉시티/성능 vs retained-layer 예시 그래프

Phase 1+Phase 2가 전체 loss를 더 빠르게 낮춤을 보여준다. results의 회복 속도와 연결
Training loss 곡선(일부 설정)

Stage 1/Stage 2의 토큰 소모 대비 Avg 회복 속도 차이를 보여준다. results
Recovery dashboards (training tokens 대비 Avg)

Long-context 회복은 Tone-2 학습 후에도 여전히 남아있지만, 초기화의 이점은 보수적이다. results/limitations
RULER 지표의 장기 추적(1000s 토큰 이후)
실무 활용
Taylor-Calibrate은 GDN 기반 하이브리드 모델로의 전이를 시작점에서 더 안정적으로 만들어주는 경량 초기화 기법이다. 소규모 calibration 데이터로도 초기화 품질을 크게 향상시키고, downstream distillation에서 필요한 토큰 수를 줄여 실무 적용성을 높인다.
- BERT 등 대형 레이어-교환형 하이브리드 모델의 빠른 파인튜닝 및 전이
- 레이어 선택 정책과 Retained-softmax 비율 실험의 신속한 프로토타이핑
- 장시간 컨텍스트를 다루는 시스템에서 추론시 KV-cache 비용 절감과 속도 향상
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Gated DeltaNet (GDN)
- — 하이브리드 선형 어텐션에서 recurrent 메모리 업데이트를 수행하는 모듈로, decay, write 게이트, output 게이트를 제어한다. 초기화가 잘못되면 상태가 과도하게 소멸되거나 노이즈를 유입할 수 있다.
- Attention Mechanism
- — Transformer의 토큰 간 관계를 계산하는 기본 구성요소로, softmax 기반의 가중합으로 이루어진다. 고정된 메모리 비용이 큰 문제를 야기한다.
- Memory Timescale
- — GDN에서 상태가 정보를 보존하는 기간을 나타내는 매개변수로, decay 게이트의 속도와 관련 있다.
- Distillation Tokens
- — 교사-학생 간 지식전달 중 추가로 주입되는 토큰으로, 학습 시작 시 학생의 출력을 교사와 맞추는 데 사용된다.
- Taylor-guided Statistics
- — 교사 attention 분포의 2차 근사치를 이용해 값 스케일, decay, write 게이트, output 게이트 등을 초기화하는 데 사용되는 핵심 수치들이다.
- Q/K/V/O Projections
- — 교사의 Q, K, V, O 투영 가중치를 학생으로 복사하는 일반적인 전이 기법에서 잃는 recurrent dynamics를 보정하기 위한 근거가 된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.