본문으로 건너뛰기
Hacker News - LLM조회 22

Atlas: Rust와 CUDA로 구현한 초고속 LLM 추론 엔진

Rust와 순수 CUDA 커널을 사용하여 vLLM 대비 3배 이상의 성능과 2.5GB의 경량 이미지를 제공하는 새로운 LLM 추론 엔진 Atlas가 공개되었습니다.

섹션별 상세

기존 추론 엔진의 무거운 의존성 구조를 해결하기 위해 Python과 PyTorch를 배제한 순수 Rust 및 CUDA 아키텍처를 채택했습니다. vLLM이 200개 이상의 패키지와 20GB 이상의 용량을 차지하는 반면, Atlas는 단일 바이너리 형태의 2.5GB 이미지로 배포되어 시스템 복잡도를 획기적으로 낮췄습니다. 이를 통해 인터프리터나 GIL, JIT 워밍업 없이 HTTP 요청부터 커널 디스패치까지 직접 연결되는 효율적인 실행 구조를 갖췄습니다.
근거
  • Atlas의 이미지 크기는 약 2.5GB로 vLLM의 20GB+ 대비 매우 경량화되었습니다. Faster by Design 비교 섹션
Blackwell SM120/121 아키텍처에 최적화된 전용 CUDA 커널을 수동으로 튜닝하여 하드웨어 성능을 한계까지 끌어올렸습니다. Attention, MoE, Mamba-2 커널은 NVFP4 및 FP8 데이터 타입을 지원하며 네이티브 텐서 코어를 직접 활용하도록 설계되었습니다. 범용적인 폴백(fallback) 방식 대신 각 모델 아키텍처에 맞춤화된 레지스터 수준의 최적화를 적용한 것이 특징입니다.
MTP(Multi-Token Prediction) 기반의 투기적 디코딩 기술을 도입하여 한 번의 순전파(forward pass)에서 여러 토큰을 동시에 생성합니다. Qwen3.5-35B 모델 테스트 결과, 단일 토큰 디코딩 대비 최대 3배의 처리량 향상을 달성하며 평균 111.4 tok/s의 속도를 기록했습니다. 이는 동일 하드웨어 조건에서 vLLM의 37.5 tok/s보다 약 3.1배 빠른 수치입니다.
근거
  • Atlas는 vLLM보다 약 3.1배 빠른 평균 111.4 tok/s의 처리량을 보여줍니다. Qwen3.5-35B (NVFP4) on DGX Spark 벤치마크 표
  • Qwen3.5-122B 모델을 단일 노드에서 약 54 tok/s의 속도로 추론할 수 있습니다. Qwen3.5-122B (NVFP4) on a single DGX Spark 섹션
OpenAI 호환 API를 기본 제공하여 Claude Code, Cline, Open WebUI 등 기존 에이전트 생태계와 즉각적인 호환성을 확보했습니다. 도구 호출(Tool Calling), 구조화된 출력, 멀티턴 대화 기능을 지원하며 Qwen3-VL과 같은 멀티모달 모델에 대한 비전 지원도 포함되어 있습니다. 사용자는 간단한 Docker 명령만으로 DGX Spark 환경에서 즉시 서비스를 구동할 수 있습니다.

기술

  • Rust
  • CUDA
  • NVFP4
  • FP8
  • MTP
  • Qwen 3.5
  • vLLM
  • Docker

활용 사례

  • 실시간 에이전트 워크플로우
  • 경량 컨테이너 기반 LLM 서빙
  • 고성능 RAG 시스템 백엔드
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 13.수집 2026. 05. 13.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.