TL;DR
작성자는 2대의 NVIDIA DGX Spark를 사용해 오픈소스 LLM 인퍼런스와 프로덕션 운영을 수행한 경험을 공유하며 자체 호스팅을 선택한 이유로 프라이버시, 학습 경험, 장기 비용 절감을 들었다. 입력 쿼리는 로컬에서 GPU로 전달되어 모델 파라미터와 활성화를 VRAM에서 로드한 뒤 연산을 거쳐 토큰을 생성하는 흐름으로, Qwen 3.5 122B는 단일 Spark에서 약 40–50 tokens/s, Qwen 3.6 27B는 약 15 tokens/s, Nemotron 3 Super는 약 20–25 tokens/s 정도의 처리량을 보고했다.
하드웨어 비교에서 작성자는 DGX Spark가 M3 Ultra보다 프롬프트 처리에서 빠르지만 RTX Pro 6000보다 느리며, 토큰 생성 속도는 상대적으로 더 느리다고 제시해 성능·비용의 트레이드오프를 명확히 밝혔다. 노드 확장은 메모리 측면에서 거의 1:1 증가하지만 연산 성능은 노드당 약 50–80% 효율로 증가해 2노드 이상부터는 네트워크와 샤딩 오버헤드로 인한 성능 저하와 운영 복잡도가 커진다.
실무적으로는 민감 데이터·지속적 워크로드가 있다면 자체 하드웨어가 경제적일 수 있으나, 전력·냉각 확보와 드라이버·라이브러리 호환성 점검, 확장 시 네트워크 비용 계산이 필수이며 이러한 제약을 고려해야 총소유비용과 안정성을 맞출 수 있다.
실용적 조언
- 프로덕션 이전에 모델별 tokens/sec을 실제 워크로드로 측정해 응답성 요구와 비용을 비교할 것 — 게시자는 Qwen 3.5 122B에서 40–50 tokens/s라는 실측값을 기준으로 판단했다.
- 2노드 이상으로 확장 계획이 있다면 네트워크 장비·샤딩 오버헤드·전력·냉각 예산을 우선 확보하고 소프트웨어 호환성 테스트를 수행할 것, 그렇지 않으면 성능 손실과 안정성 문제가 발생한다.
- 전력·냉각 이슈로 시스템이 불안정하다면 GPU/CPU 언더클럭을 고려해 안정성을 우선 확보한 뒤 최적화 작업을 진행할 것.
섹션별 상세
용어 해설
- 모델 병렬화(Model Parallelism)
- — 큰 모델을 여러 GPU에 나눠서 실행하는 방식으로, 입력 토큰을 분할하거나 파라미터를 샤딩하여 각 노드가 일부 연산을 수행하고 최종 토큰을 합쳐 출력한다. 노드 수와 네트워크 대역폭에 따라 성능과 메모리 한계가 결정되어 대규모 인퍼런스와 분산 학습에서 핵심적이다.
- 비디오 메모리(VRAM)(VRAM)
- — GPU가 모델 파라미터·활성화값을 저장하는 전용 메모리로, 모델 크기와 컨텍스트 윈도우를 직접 제약한다. VRAM이 부족하면 모델을 샤딩하거나 오프로드해야 하며, 인퍼런스 처리량과 지연에 큰 영향을 준다.
- Blackwell 아키텍처(Blackwell architecture)
- — NVIDIA의 GPU 아키텍처 계열명으로, 하드웨어 연산 유닛·메모리 서브시스템·드라이버 최적화가 포함된다. 특정 소프트웨어 스택과의 호환성 문제를 일으킬 수 있어, 변형된 구현이 도입되면 개발 커뮤니티가 추가 버그 픽스와 최적화를 요구한다.
- 메모리 확장(스케일링)(Memory scaling)
- — 여러 노드를 결합했을 때 사용 가능한 총 모델 메모리가 증가하는 비율로, 1:1에 가까우면 노드 추가만으로 더 큰 모델을 올릴 수 있다. 네트워크와 샤딩 오버헤드에 따라 실제 연산 성능은 메모리 증가율보다 낮게 유지될 수 있다.
언급된 도구
대규모 로컬 인퍼런스용 NVIDIA 기반 하드웨어 클러스터
단일 머신 소형/중형 인퍼런스 비교용 (작성자는 비교 대상으로 사용)
GPU 기반 로컬 인퍼런스·테스트용 하드웨어 옵션
CPU 플랫폼(서버) 비교용
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.