CUDA 컨텍스트 시간 분할
CUDA 컨텍스트 시간 분할
GPU 공유 모드에서는 서로 다른 컨테이너의 CUDA 컨텍스트가 커널 경계에서 시간 분할로 스케줄되어 GPU 사용 시간을 나눈다. 이 방식은 메모리 물리 격리를 제공하지 않으므로 각 애플리케이션은 스스로 메모리 사용 한도를 지켜야 한다. vLLM 같은 소프트웨어 쪽 설정으로 메모리 소비를 제한하는 것이 권장된다.
CUDA 컨텍스트 시간 분할
GPU 공유 모드에서는 서로 다른 컨테이너의 CUDA 컨텍스트가 커널 경계에서 시간 분할로 스케줄되어 GPU 사용 시간을 나눈다. 이 방식은 메모리 물리 격리를 제공하지 않으므로 각 애플리케이션은 스스로 메모리 사용 한도를 지켜야 한다. vLLM 같은 소프트웨어 쪽 설정으로 메모리 소비를 제한하는 것이 권장된다.