본문으로 건너뛰기

LLM 추론과 학습을 위한 고성능 스토리지 시스템 OpenLake 공개.

OpenLake는 thread-per-core와 RDMA, Deferred Materialization을 통해 LLM 워크로드의 스토리지 병목을 해결하고 기존 대비 8배 높은 처리량을 제공한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

LLM 추론과 학습 과정에서 GPU 연산 속도를 따라가지 못하는 스토리지 I/O 병목이 주요 문제로 지적된다. OpenLake는 thread-per-core 아키텍처와 io_uring을 활용해 CPU 오버헤드를 최소화하고, 클라이언트 측 압축 및 GPU 해제를 수행하는 'Deferred Materialization' 기술로 물리적 대역폭 한계를 돌파했다. 또한 RDMA 기반의 PacedRDMA 전략과 분산 메타데이터 구조를 통해 기존 S3 호환 스토리지 대비 8배 높은 처리량과 600µs 수준의 낮은 지연 시간을 구현했다.

섹션별 상세

01
LLM 추론 및 학습 워크로드는 GPU 연산 속도에 비해 스토리지 I/O 병목 현상이 심각하다. OpenLake는 각 스레드를 물리적 CPU 코어에 매핑하는 thread-per-core 아키텍처와 io_uring을 도입하여 시스템 콜 차단과 코어 간 경합을 제거했다. 이 구조는 L1/L2 캐시를 효율적으로 유지하며 96개 노드 클러스터에서 100만 건 이상의 동시 IOPS와 0.6ms의 낮은 지연 시간을 달성했다.
bash
sudo apt-get install -y build-essential pkg-config clang cmake libhwloc-dev libudev-dev curl git awscli
curl --proto '=https' --tlsv1.2 -sSf https://sh.rustup.rs | sh -s -- -y && . "$HOME/.cargo/env"
git clone https://github.com/openlake-project/openlake.git && cd openlake
cargo build --release --bin openlaked

OpenLake 빌드 및 설치 과정

bash
export AWS_ACCESS_KEY_ID=openlakeadmin
export AWS_SECRET_ACCESS_KEY=openlakeadmin
export AWS_DEFAULT_REGION=us-east-1
aws --endpoint-url http://127.0.0.1:9000 s3 mb s3://demo
aws --endpoint-url http://127.0.0.1:9000 s3 cp ./file s3://demo/

S3 API를 통한 OpenLake 데이터 업로드 예시

02
네트워크 대역폭은 GPU 데이터 전송 속도를 제한하는 물리적 한계로 작용한다. OpenLake는 Deferred Materialization 기술을 통해 클라이언트 측에서 데이터를 압축하여 전송하고 GPU에서 직접 해제한다. 이 방식은 물리적 NIC 대역폭을 초과하는 600GB/s 이상의 논리적 처리량을 제공하며, 데이터 전송량을 줄여 GPU 메모리 로딩 속도를 가속화한다.
03
기존 TCP 기반 스토리지 시스템은 LLM의 KV 캐시 검색과 같은 불규칙한 버스트 워크로드 처리에 어려움을 겪는다. OpenLake는 RDMA를 활용해 CPU를 우회하고, PacedRDMA라는 동적 크레딧 할당 전략을 통해 요청 폭주 시에도 자원을 효율적으로 관리한다. 또한 분산 메타데이터 해싱 구조를 채택하여 단일 장애 지점을 제거하고 메타데이터 조회에 따른 추가 왕복 지연 시간을 없앴다.

용어 해설

io_uring
Linux 커널의 고성능 비동기 I/O 인터페이스. 시스템 콜 오버헤드를 줄이고 커널과 사용자 공간 간의 메모리 복사를 최소화하여, 대규모 I/O 요청을 효율적으로 처리하는 데 필수적이다.
원격 직접 메모리 접근(RDMA)
CPU 개입 없이 네트워크를 통해 한 컴퓨터의 메모리에서 다른 컴퓨터의 메모리로 데이터를 직접 전송하는 기술. 지연 시간을 획기적으로 줄이고 처리량을 극대화한다.
지연 구체화(Deferred Materialization)
데이터 전송 시 클라이언트 측에서 압축을 수행하고, GPU에 도달한 후 해제하는 기법. 네트워크 대역폭 한계를 넘어선 논리적 처리량을 확보하여 데이터 전송 속도를 높인다.

기술

  • OpenLake
  • MinIO
  • RustFS
  • RDMA
  • io_uring
  • S3 API

활용 사례

  • LLM 추론 및 학습 데이터 저장소
  • 고성능 KV 캐시 검색
  • 대규모 GPU 클러스터 데이터 처리

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 30.수집 2026. 08. 30.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.