memory-aware-inference
메모리 예산 기반 추론
모델 가중치와 실행 상태를 단순히 메모리에 올리는 대신 파일 백업, 캐시 크기, 스테이징 버퍼를 하드웨어 가용 메모리 한도에 맞춰 관리해 실행 가능성을 확보하는 방식이다. 입력은 GGUF 같은 모델 파일, 처리 과정은 호스트·가속기 캐시 정책과 페이지 스트리밍이며 출력은 동일한 모델 출력을 유지한 채로 제한된 메모리에서의 예측 결과다. 이 방식은 모델이 물리적 메모리를 초과할 때도 모델 아티팩트를 재변환하거나 무작위로 재양자화하지 않고 예측 가능한 성능을 제공하는 것을 목표로 한다.