TL;DR
이 백서는 Furiosa RNGD 4대와 NVIDIA RTX PRO 6000 4대를 Backend.AI 플랫폼에서 동일 테스트로 비교해 RNGD가 동시성 전 구간에서 와트당 처리량을 1.3배에서 1.5배 향상시켰음을 보여준다. RNGD는 동시성 256에서 약 95%의 절대 처리량을 유지하면서 소비전력을 30%~44% 낮췄고, 동시성 32까지는 TTFT를 1초 미만으로 유지해 대화형 응답성도 확보했다. 백서는 또한 Backend.AI의 세션 실행 모델과 Sokovan 오케스트레이터를 통해 이기종 가속기 환경에서 전력·지연 균형을 맞추는 실무적 배포 방안을 제안한다.
빠른 이해
새로운 점
동일 워크로드에서 1.3x–1.5x 와트당 처리량 개선이라는 운영 관점의 에너지 효율 신호
핵심 메커니즘
RNGD 하드웨어의 전력·처리 특성과 Backend.AI의 세션 실행 모델 및 Sokovan 오케스트레이터가 결합되어 프리필과 디코드 단계에 맞춘 자원 배분으로 전력 대비 처리량을 최적화한다.
핵심 수치
- 와트당 처리량(Throughput/W): 1.3x–1.5x- Qwen3-32B(FP8) 실험에서 동시성 전 구간 비교
- 소비전력 절감: 30%–44%- 동일 동시성 조건에서 RNGD가 기록한 전력 감소 범위
- 최대 동시성에서 절대 처리량 비율: 약 95%- 동시성 256에서 RNGD가 비교군 처리량 대비 달성한 비율
- TTFT (응답성): 1초 미만 (동시성 ≤32)- 동시성 32까지 RNGD가 유지한 첫 토큰 응답 시간
섹션별 상세
벤치마크 개요
전력 효율성과 와트당 처리량 결과

- RNGD는 동시성 전 구간에서 RTX PRO 6000 대비 1.3x~1.5x 높은 와트당 처리량을 달성했다. — 백서의 'Power Draw by Concurrency' 차트와 Qwen3-32B 벤치 결과 표; 동시성별 전력(W)과 처리량을 통해 와트당 처리량을 계산한 결과.
- RNGD는 동시성 256에서 비교군 대비 약 95% 수준의 절대 처리량을 유지하면서 소비전력을 30%~44% 절감했다. — 본문 기술 문장과 차트의 막대그래프에서 동시성 256 구간의 전력 및 처리량 수치 비교가 근거.
응답성과 지연 특성
- RNGD는 동시성 32까지 TTFT를 1초 미만으로 유지했고, 비교군은 동일 조건에서 2.9초 이상을 기록했다. — 본문의 지연(응답성) 측정 결과 요약; TTFT 중앙값 비교 수치.
플랫폼 통합과 운영 모델


운영상 고려사항과 배포 전략
용어 해설
- 와트당 처리량(Throughput per Watt)
- — 서버가 소비하는 전력 1와트당 처리할 수 있는 추론 요청량을 나타내는 지표이다. 입력으로 동시성(concurrency)과 모델 설정(예: FP8)을 받고, 측정은 초당 처리한 토큰 또는 요청 수를 전력 소비(W)로 나눠 계산한다. 이 값이 높을수록 동일 전력에서 더 많은 처리량을 얻어 데이터센터 총운영비용과 냉각 부담을 낮출 수 있다.
- 첫 토큰 응답 시간(Time to First Token (TTFT))
- — 클라이언트가 요청을 보낸 시점부터 모델이 첫 번째 토큰을 반환할 때까지 걸리는 시간이다. 측정은 네트워크 전송, 스케줄링, 프리필(prefill)과 디코드 초기화 단계를 포함하며, 짧을수록 대화형 서비스의 체감 응답성이 개선된다. 백엔드 자원 분배와 동시성 정책이 TTFT에 직접적인 영향을 준다.
- 세션 실행 모델(Session execution model)
- — 사용자별 대화 또는 배치 작업을 세션 단위로 관리해 프리필과 디코드 같은 서로 다른 단계의 리소스 요구를 분리하는 운영 방식이다. 입력은 세션 요청과 작업 유형(인터랙티브/배치)이고, 처리기는 세션 스케줄러와 오케스트레이터이며 출력은 각 세션의 자원 사용 및 지연 특성이다. 세션 모델은 혼합 워크로드에서 전력·지연 균형을 맞추기 쉽도록 설계된다.
- 이기종 가속기(Heterogeneous accelerators)
- — 서로 다른 아키텍처와 명령 집합을 가진 NPU, GPU, 특수 ASIC 등을 동일 플랫폼에서 함께 사용하는 구성이다. 입력은 모델·라이브러리·드라이버 호환성 요구이고, 플랫폼은 플러그인 또는 드라이버 어댑터를 통해 각 가속기로 작업을 라우팅하며 출력은 통합된 추론 서비스이다. 이기종 지원은 벤더 의존도를 낮추고 특정 워크로드에 맞는 전력·성능 최적화를 가능하게 한다.
기술
- RNGD
- Backend.AI
- Qwen3-32B
- RTX PRO 6000 Blackwell Server Edition
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.