TL;DR
수천 개의 비전 모델을 공유 GPU 플릿에서 운영할 때 입력 데이터가 수메가바이트급으로 크고 추론 레이턴시가 따뜻한 경로(약 5ms)와 콜드 스타트 경로(통상 30초 이상)로 극단적으로 나뉘며 VRAM 자원은 소수의 모델만 상주시켜 어느 모델이 VRAM에 있느냐가 응답 속도를 좌우한다고 보고하였다. 동기적 요청-응답 API는 클라이언트·로드밸런서·서버의 서로 다른 타임아웃 충돌, 느린 요청이 빠른 요청을 기아 상태로 만드는 현상, 동일 모델 로드에 따른 대기열 형성과 같은 문제를 반복적으로 일으켜 시스템 불안정을 초래한다고 지적하였다. 따라서 설계자는 입력-출력 역전, 레이턴시 이원화, VRAM 다중 입주라는 세 가지 특성을 전제로 시스템 아키텍처를 재검토해야 하며 동기화된 단일 경로에 의존할 경우 재시도·자원 낭비·서비스 마비 같은 운영 리스크가 지속될 것이라고 결론지었다.
섹션별 상세
용어 해설
- Ingress Inversion
- — 비전 추론 파이프라인에서 입력이 다수의 메가바이트급 고해상도 프레임이고 출력이 소수 킬로바이트의 검출 결과인 현상으로, 입력 처리 비용이 전체 비용 구조를 지배하여 네트워크·버퍼링·초기 처리 설계가 시스템 성능을 결정한다.
- Cold Start
- — GPU 메모리에 모델이 로드되지 않은 상태에서 추론 요청이 들어올 때 모델을 레지스트리에서 읽어 디시리얼라이즈한 뒤 VRAM으로 스트리밍해야 하는 과정으로, 이 과정이 수십 초 수준의 지연을 유발하여 레이턴시 분포를 이원화한다.
- VRAM Multi-Tenancy
- — 단일 GPU 메모리에 수천 개 모델 전체가 들어갈 수 없기 때문에 특정 시점에 '따뜻한' 모델들만 VRAM에 상주하게 되는 운영 패턴으로, 어떤 모델이 어디에 상주하느냐에 따라 요청의 처리 속도가 극단적으로 달라진다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.