엣지-클라우드 라우팅
경량 Tiny LLM을 엣지에서 매턴 실행하고 복잡한 추론이 필요할 때만 대형 클라우드 LLM으로 에스컬레이션하는 계층적 추론 정책이다. 라우팅 정책은 학습으로 얻어진 결정규칙을 사용해 지연과 비용을 제어하며, 로컬으로 해결 가능한 작업은 엣지에서 처리해 실시간성을 유지한다. 이 구조는 비용-지연-능력 사이의 트레이드오프를 시스템 수준에서 관리하게 한다.