Offloading runtime
오프로딩 런타임
호스트 메모리와 GPU/Metal/CUDA 같은 가속기 사이에서 가중치와 중간 상태를 선택적으로 유지·스트리밍하는 런타임으로, 작업 단위별로 어떤 텐서를 어느 장치에 두어야 할지를 결정한다. 입력은 모델 가중치와 실행 예측 요청, 처리 과정은 페이지 교체·캐시 할당·장치 업로드·다운로드이며 출력은 메모리 제약을 지키면서도 모델의 정확성을 유지한 추론 결과이다. runNburn은 이런 런타임 설계를 통해 큰 GGUF 파일을 변환 없이 그대로 실행하는 것을 목표로 한다.