본문으로 건너뛰기
FuriosaAI조회 1

RNGD와 Backend.AI 벤치마크

RNGD와 Backend.AI 통합으로 동일 워크로드에서 와트당 처리량이 1.3x–1.5x 개선되었다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이 백서는 Furiosa RNGD 4대와 NVIDIA RTX PRO 6000 4대를 Backend.AI 플랫폼에서 동일 테스트로 비교해 RNGD가 동시성 전 구간에서 와트당 처리량을 1.3배에서 1.5배 향상시켰음을 보여준다. RNGD는 동시성 256에서 약 95%의 절대 처리량을 유지하면서 소비전력을 30%~44% 낮췄고, 동시성 32까지는 TTFT를 1초 미만으로 유지해 대화형 응답성도 확보했다. 백서는 또한 Backend.AI의 세션 실행 모델과 Sokovan 오케스트레이터를 통해 이기종 가속기 환경에서 전력·지연 균형을 맞추는 실무적 배포 방안을 제안한다.

빠른 이해

새로운 점

동일 워크로드에서 1.3x–1.5x 와트당 처리량 개선이라는 운영 관점의 에너지 효율 신호

핵심 메커니즘

RNGD 하드웨어의 전력·처리 특성과 Backend.AI의 세션 실행 모델 및 Sokovan 오케스트레이터가 결합되어 프리필과 디코드 단계에 맞춘 자원 배분으로 전력 대비 처리량을 최적화한다.

핵심 수치

  • 와트당 처리량(Throughput/W): 1.3x–1.5x- Qwen3-32B(FP8) 실험에서 동시성 전 구간 비교
  • 소비전력 절감: 30%–44%- 동일 동시성 조건에서 RNGD가 기록한 전력 감소 범위
  • 최대 동시성에서 절대 처리량 비율: 약 95%- 동시성 256에서 RNGD가 비교군 처리량 대비 달성한 비율
  • TTFT (응답성): 1초 미만 (동시성 ≤32)- 동시성 32까지 RNGD가 유지한 첫 토큰 응답 시간

섹션별 상세

벤치마크 개요

이 백서의 핵심은 Furiosa의 RNGD 가속기 4대와 베어메탈의 NVIDIA RTX PRO 6000 Blackwell Server Edition GPU 4대를 Backend.AI 환경에서 동일한 워크로드로 비교한 점검이다. 비교 대상 모델로는 Qwen3-32B(FP8) 실서비스 유형의 추론 워크로드를 사용했으며, 측정 항목으로는 처리량, 지연, 전력효율성, 동시성 확장성을 포함했다. 실험은 동시성 변화에 따른 소비전력과 토큰 처리 속도를 동시에 기록해 와트당 처리량을 계산하는 방식으로 이루어졌고, 결과는 운영 환경 설계에 직접 적용 가능한 수치로 제시되었다.

전력 효율성과 와트당 처리량 결과

동일한 실험에서 RNGD는 동시성 전 범위에서 RTX PRO 6000 대비 와트당 처리량이 1.3배에서 1.5배 높게 측정되었다는 결과가 보고되었다. 측정 방식은 각 동시성 단계에서 시스템 전체 전력 소비(W)를 측정하고 그때의 처리량을 전력으로 나눈 값으로, 차트에는 동시성 1에서 256까지 구간별 전력 소모와 백분율 차이가 표기되어 있다. 구체적으로 RNGD는 최대 동시성(256)에서 비교군 대비 약 95% 수준의 절대 처리량을 유지하면서 소비전력은 30%~44% 적게 소모해 전력 대비 효율이 유의하게 높았다.
동시성 구간별 전력 소비와 RNGD와 RTX PRO 6000의 차이를 보여주는 막대그래프
Chart이 차트는 동시성 1부터 256까지 각 실험군의 전력 소모(W)를 세로 막대로 제시하고 상단에 백분율 차이를 표기해 와트당 처리량 우위의 근거를 제공한다. 측정은 각 동시성 단계에서 시스템 전체 전력을 캡처하고 해당 단계의 처리량으로 나눈 값을 비교하는 절차로 수행됐다. 차트 상 숫자와 백분율 표기를 통해 RNGD의 소비전력 감소(약 30%~44%)와 와트당 처리 성능 이득(1.3x~1.5x)을 시각적으로 확인할 수 있다.
근거
  • RNGD는 동시성 전 구간에서 RTX PRO 6000 대비 1.3x~1.5x 높은 와트당 처리량을 달성했다. 백서의 'Power Draw by Concurrency' 차트와 Qwen3-32B 벤치 결과 표; 동시성별 전력(W)과 처리량을 통해 와트당 처리량을 계산한 결과.
  • RNGD는 동시성 256에서 비교군 대비 약 95% 수준의 절대 처리량을 유지하면서 소비전력을 30%~44% 절감했다. 본문 기술 문장과 차트의 막대그래프에서 동시성 256 구간의 전력 및 처리량 수치 비교가 근거.

응답성과 지연 특성

대화형 응답성의 핵심 지표인 Time to First Token(TTFT)에서 RNGD는 동시성 32까지 첫 토큰을 1초 미만으로 유지해 사용자가 체감하는 응답성을 확보했다. 측정 절차는 동일한 요청 패턴에서 TTFT를 비교군과 동등한 조건으로 반복 측정한 뒤 중앙값을 비교하는 방식이었으며, 비교군은 동시성 32에서 2.9초 이상의 TTFT를 기록했다. 이 결과는 프리필과 디코드 단계에서의 자원 스케줄링과 하드웨어 초기화 비용이 시스템 전체 체감 성능에 미치는 영향이 크다는 운영 설계상의 결론으로 이어진다.
근거
  • RNGD는 동시성 32까지 TTFT를 1초 미만으로 유지했고, 비교군은 동일 조건에서 2.9초 이상을 기록했다. 본문의 지연(응답성) 측정 결과 요약; TTFT 중앙값 비교 수치.

플랫폼 통합과 운영 모델

백서에서는 RNGD 하드웨어와 Backend.AI의 세션 실행 모델, Sokovan 오케스트레이터를 결합해 혼합 LLM 워크로드를 운영하는 구체적 절차를 제시했다. 입력으로 들어온 인터랙티브 요청과 배치 작업을 세션 단위로 분리해 각 단계(prefill, decode)에 맞춘 자원 할당을 수행하며, 이 과정에서 Backend.AI는 이기종 가속기를 플러그인 아키텍처로 추상화해 라우팅과 스케줄링을 관장한다. 결과적으로 이러한 통합은 냉각 제약과 전력 밀도 상승 같은 현실적 운영 제약 아래에서 리소스 효율과 서비스 응답성 사이의 균형을 맞추는 실용적 방법을 제공한다.
Backend.AI 포털의 대시보드 스크린샷으로 세션과 자원 사용 현황을 표시한다
Screenshot포털 화면은 활성 세션 수, 폴더 상태, 프로젝트별 자원(CPU 코어·RAM)과 기기 타입을 한눈에 보여주며 운영자가 세션 기반 리소스 배분을 확인하는 흐름을 드러낸다. 세션 실행 모델과 Sokovan 오케스트레이터가 어떻게 대시보드 수준에서 자원 가시성을 제공하는지 운영 관점의 입력·출력 구조를 보여주는 증거로 기능한다. 이 스크린샷은 플랫폼 통합이 실무자에게 필요한 모니터링·분배 정보를 제공한다는 점을 시사한다.
플러그인 아키텍처로 여러 가속기 벤더를 통합하는 다이어그램
Diagram다이어그램은 Backend.AI 상단에 플러그인 아키텍처를 두고 하단에 Furiosa, NVIDIA, Intel, AMD 등 다양한 가속기 벤더 로고를 배치해 이기종 가속기 지원 구조를 시각화한다. 이는 플랫폼이 벤더 종속성을 낮추고 다양한 하드웨어에 작업을 라우팅할 수 있음을 뜻하며, 혼합 워크로드에서의 유연한 스케줄링 근거로 작동한다. 실제 배포에서 하드웨어 교체나 추가를 수월하게 하려는 설계 원칙을 보여준다.

운영상 고려사항과 배포 전략

운영팀 관점에서 백서는 공랭(air-cooling) 한계, 데이터센터 전력 밀도 증가, Sovereign AI 요건을 중요한 제약으로 설정하고 이에 맞춘 배포 전략을 제안했다. 권장 절차는 혼합 워크로드를 분리해 수평 확장과 전력 기반 노드 스케줄링을 적용하는 것으로, 이는 실험에서 확인된 와트당 처리량 우위를 실제 운영에서 비용과 냉각 부담 감소로 연결하려는 설계다. 또한 온프레미스·에어갭 환경에서도 Backend.AI 플랫폼을 통해 벤더 비종속적 통합을 유지할 것을 권고하고 있다.

용어 해설

와트당 처리량(Throughput per Watt)
서버가 소비하는 전력 1와트당 처리할 수 있는 추론 요청량을 나타내는 지표이다. 입력으로 동시성(concurrency)과 모델 설정(예: FP8)을 받고, 측정은 초당 처리한 토큰 또는 요청 수를 전력 소비(W)로 나눠 계산한다. 이 값이 높을수록 동일 전력에서 더 많은 처리량을 얻어 데이터센터 총운영비용과 냉각 부담을 낮출 수 있다.
첫 토큰 응답 시간(Time to First Token (TTFT))
클라이언트가 요청을 보낸 시점부터 모델이 첫 번째 토큰을 반환할 때까지 걸리는 시간이다. 측정은 네트워크 전송, 스케줄링, 프리필(prefill)과 디코드 초기화 단계를 포함하며, 짧을수록 대화형 서비스의 체감 응답성이 개선된다. 백엔드 자원 분배와 동시성 정책이 TTFT에 직접적인 영향을 준다.
세션 실행 모델(Session execution model)
사용자별 대화 또는 배치 작업을 세션 단위로 관리해 프리필과 디코드 같은 서로 다른 단계의 리소스 요구를 분리하는 운영 방식이다. 입력은 세션 요청과 작업 유형(인터랙티브/배치)이고, 처리기는 세션 스케줄러와 오케스트레이터이며 출력은 각 세션의 자원 사용 및 지연 특성이다. 세션 모델은 혼합 워크로드에서 전력·지연 균형을 맞추기 쉽도록 설계된다.
이기종 가속기(Heterogeneous accelerators)
서로 다른 아키텍처와 명령 집합을 가진 NPU, GPU, 특수 ASIC 등을 동일 플랫폼에서 함께 사용하는 구성이다. 입력은 모델·라이브러리·드라이버 호환성 요구이고, 플랫폼은 플러그인 또는 드라이버 어댑터를 통해 각 가속기로 작업을 라우팅하며 출력은 통합된 추론 서비스이다. 이기종 지원은 벤더 의존도를 낮추고 특정 워크로드에 맞는 전력·성능 최적화를 가능하게 한다.

기술

  • RNGD
  • Backend.AI
  • Qwen3-32B
  • RTX PRO 6000 Blackwell Server Edition

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 08. 06.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.