본문으로 건너뛰기
r/LocalLLaMA조회 5

36개 DGX Spark로 4.6TB 홈랩 클러스터 확장

36개 DGX Spark를 여러 AI 기능을 동시에 수행하는 4.6TB 홈랩 클러스터로 확장했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 기존 16x DGX Spark Cluster에 20대를 더해 36개의 DGX Spark와 4.6TB unified memory를 갖춘 홈랩 클러스터를 구축했습니다. 클러스터는 Hermes와 custom memory sidecar system으로 여러 inference module을 하나의 persistent agent에 연결하며, Kimi K3 같은 SOTA 모델과 rerank·embedding·영상·이미지·오디오 작업을 동시에 처리하도록 나뉩니다. 200Gbps 스위치와 QSFP56 케이블로 노드를 연결하고, 16개 노드는 SOTA 모델 전용으로 남길 계획입니다. B200·B300의 냉각·전력 부담과 데이터센터 비의존성 때문에 DGX Spark를 선택했으며, 향후 6000 Pro 시스템과 M5 Ultras 기반 장비를 조합할 계획입니다.

섹션별 상세

01
작성자는 기존 16x DGX Spark Cluster에 20대를 추가해 총 36개의 DGX Spark와 4.6TB의 unified memory를 구성했습니다. 네트워크에는 200Gbps FS 스위치 1대, 24개의 QSFP56 DAC 케이블, 400Gbps에서 2개의 200Gbps로 나누는 breakout 케이블 6개가 사용됩니다. 사진에는 DGX Spark 포장 상자와 홈랩 서버 랙이 함께 담겨 있어 장비 확장과 랙 배치가 실제 설치 단계로 이어졌음을 확인할 수 있습니다.
NVIDIA DGX Spark라고 표시된 소형 장비 상자 여러 개가 대형 운송 상자 위에 쌓여 있습니다.
Photo사진에는 NVIDIA DGX Spark 라벨이 붙은 포장 상자 8개가 보이며, 작성자가 클러스터 확장을 위해 장비를 추가로 반입한 상황과 연결됩니다. 상자 수만으로 전체 36대의 수량이나 내부 사양을 확인할 수는 없지만, 글의 홈랩 확장 맥락을 뒷받침하는 시각 자료입니다.
여러 서버와 네트워크 장비, 전원 장치가 설치된 홈랩 랙의 전면 모습입니다.
Photo사진에는 서버 섀시와 네트워크 스위치로 보이는 장비, 전면 상태 표시부와 다수의 연결 케이블이 랙에 배치되어 있습니다. 구체적인 GPU 수나 네트워크 토폴로지는 식별되지 않지만, 작성자가 언급한 홈랩 서버 랙과 클러스터형 운영 환경의 물리적 구성을 보여줍니다.
02
작성자는 클러스터를 하나의 대형 모델만 서비스하는 장비로 쓰지 않고, 여러 inference module을 persistent agent에 결합하는 구조로 운용합니다. Hermes와 custom memory sidecar system이 각 모듈을 관리하며, 일부 노드는 SOTA 모델에 배정하고 다른 노드는 rerank·embedding·video generation·image generation·audio processing을 동시에 수행하도록 나눕니다. 이 방식의 목적은 단일 추론 지점의 규모보다 여러 AI 기능을 계속 유지하는 agent capability cluster에 가깝게 만드는 데 있습니다.
03
클러스터를 36노드로 확장한 직접적인 이유는 16개 노드를 Kimi K3 같은 SOTA 모델 전용으로 남겨두면서도 다른 기능을 처리할 노드를 확보하려는 데 있습니다. 작성자는 지난 4개월 이상 주요 모델을 거의 모두 실행해 왔다고 밝혔지만, 모델별 처리량·지연시간·전력 사용량 같은 정량 벤치마크는 제시하지 않았습니다. 따라서 이번 글에서 확인되는 성과는 모델 성능 수치보다 자원 분할 방식과 동시 실행 범위에 있습니다.
04
작성자는 B200이나 B300이 홈랩에서 냉각과 전력 문제를 크게 키우며, 데이터센터와 제3자 스토리지에 의존하지 않는 완전한 sovereign 구성이 목표라고 설명합니다. 이미 H100과 GH200을 대체할 2개의 6000 Pro 시스템도 계획하고 있어 DGX Spark만으로 모든 작업을 처리하려는 선택은 아닙니다. DGX Spark와 6000 Pro를 함께 사용하면 구성·전력 최적화·향후 장비 교체 시 처분 유연성을 확보할 수 있다는 판단입니다.

용어 해설

통합 메모리(Unified Memory)
여러 연산 노드가 보유한 메모리를 하나의 큰 메모리 공간처럼 활용하는 구성입니다. 이 글에서는 36개의 DGX Spark가 총 4.6TB를 공유해 대형 모델 추론과 임베딩·재순위화·생성 작업을 병렬로 수행하는 기반으로 쓰입니다.
추론 모듈(Inference Module)
하나의 거대한 추론 서버 대신 특정 모델이나 작업을 맡도록 클러스터 자원을 나눈 단위입니다. 작성자는 노드 일부를 SOTA 모델에 배정하고 나머지는 rerank, embedding, video generation, image generation, audio processing에 동시에 할당합니다.
지속형 에이전트(Persistent Agent)
여러 추론 모듈과 외부 메모리 시스템을 하나의 계속 실행되는 에이전트처럼 연결한 구조입니다. 이 구성은 요청마다 단일 모델을 호출하는 방식에서 벗어나 Hermes와 custom memory sidecar system이 모듈 간 상태와 기능을 관리하도록 만듭니다.
분리형 추론(Disaggregated Inference)
모델 추론에 필요한 계산·메모리·저장 기능을 서로 다른 장치나 노드로 분리해 자원을 조합하는 방식입니다. 작성자는 향후 M5 Ultras와 Mac Studios를 추가하고 이 구조를 연구하면 클러스터 활용도가 커질 것으로 봅니다.

언급된 도구

Hermes중립

여러 inference module을 하나의 persistent agent 구조에 연결하는 구성 요소로 사용됩니다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 23.수집 2026. 08. 23.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.