Transformer에서 하이브리드로의 변환
사전학습된 Transformer 모델의 일부 레이어만 full attention으로 유지하고 나머지는 선형 어텐션으로 대체해 효율성을 얻는 절차이다. 원본 가중치를 재사용하고 layerwise replacement, distillation, finetuning을 통해 품질을 회복하는 접근을 포함한다. 하이브리드 구성에서 어떤 레이어를 유지할지 선택하는 문제가 핵심이며 비용-효율성 균형이 중요하다.