128k-context
장문 대화·상태 유지용 대용량 컨텍스트
Muse Glimmer는 128K 이상의 토큰 컨텍스트를 지원하도록 설계되었으며, KV-cache 관리는 52개 레이어 중 13개만 글로벌로 유지하고 나머지는 슬라이딩 윈도우로 처리해 메모리 성장을 제어한다. ExecuTorch는 이러한 구조를 효율적으로 낮은 오버헤드로 실행되게 하여 에지 디바이스에서도 긴 대화 히스토리를 다룰 수 있게 한다. 긴 컨텍스트는 에이전트의 장기 추론과 문맥 보존이 필요한 작업에서 실용성을 제공한다.