본문으로 건너뛰기

Ray Summit 2025 엑스포 현장: Ray 라이브러리 생태계 총정리

Ray Summit 2025 현장에서 엔지니어들이 직접 설명하는 Ray Data, Train, Serve, KubeRay 등 핵심 라이브러리의 기능과 실무 활용 사례를 다룹니다.

챕터별 상세

00:00

도입 및 Ray 개요

Ray는 AI 및 Python 애플리케이션 확장을 위한 오픈소스 분산 컴퓨팅 엔진이다. 개발자는 분산 시스템에 대한 깊은 전문 지식 없이도 대규모 분산 애플리케이션을 구축하고 실행할 수 있다. 이번 영상에서는 Ray Core 위에 구축된 주요 라이브러리들을 엔지니어들의 설명을 통해 살펴본다.
00:17

Ray Data: 확장 가능한 데이터 처리

Ray Data는 ML 및 AI 워크로드를 위한 확장 가능한 데이터 처리 라이브러리이다. 클라우드 규모의 Join 및 Group-by 연산을 지원하며, 퍼블릭 버킷에서 데이터를 로드하여 모델에 스트리밍하는 Training Ingest 최적화를 수행한다. 배치 추론 시 모델 크기에 따라 클러스터를 자동으로 확장하며, 기존 Spark 사용자들에게 더 높은 처리량과 비용 효율성을 제공한다.

Spark와 유사한 데이터 처리 기능을 제공하지만, ML 워크로드와의 통합 및 GPU 활용에 더 최적화되어 있다.

01:48

Ray Train: 분산 학습 및 파인튜닝

Ray Train은 분산 환경에서 모델 학습과 파인튜닝을 간소화하는 라이브러리이다. PyTorch를 직접 사용할 때 발생하는 복잡한 분산 설정 코드를 단 몇 줄의 추가만으로 대체할 수 있게 해준다. 단순한 래퍼를 넘어 체크포인트 관리, 중단된 학습의 자동 재개, 결함 허용(Fault Tolerance) 기능을 제공하여 대규모 클러스터에서의 학습 안정성을 높였다.

멀티 노드, 멀티 GPU 환경에서 PyTorch Distributed Data Parallel(DDP) 설정을 자동화해준다.

02:57

Ray Serve: 모델 서빙 및 추론 API

Ray Serve는 온라인 추론 API 구축을 위한 확장 가능한 모델 서빙 라이브러리이다. 여러 모델을 하나의 배포 단위로 묶어 관리하는 컴포저블 배포를 지원하며, 워크로드에 따라 각 모델 섹션을 독립적으로 확장할 수 있다. vLLM 엔진을 내장하여 LLM 서빙에 최적화되어 있으며, Prefix Caching 및 모델 병렬화(Pipeline/Tensor Parallelism)를 통해 하드웨어 활용도를 극대화한다.

단순한 API 엔드포인트 생성을 넘어 복잡한 모델 파이프라인의 오토스케일링을 관리한다.

05:18

KubeRay: Kubernetes에서의 Ray 운영

KubeRay는 Kubernetes 환경에서 Ray 애플리케이션을 배포하고 관리하기 위한 오퍼레이터이다. Ray 워크로드를 Kubernetes 상에서 실행할 때 발생하는 복잡성을 줄여주며, 배치 학습 작업과 서빙 작업을 모두 지원한다. 특히 Ray 고유의 오토스케일러와 Kubernetes 인프라 간의 긴밀한 통합을 제공하여 리소스 관리를 최적화한다.

Kubernetes의 Custom Resource Definition(CRD)을 사용하여 Ray 클러스터를 관리한다.

06:00

RLlib: 확장 가능한 강화 학습

RLlib은 강화 학습(Reinforcement Learning)을 위한 라이브러리로, 프로덕션 수준의 지원과 높은 확장성을 제공한다. 결함 허용 기능이 내장되어 대규모 워크로드에서도 안정적으로 작동하며, 단순하고 통합된 API를 통해 복잡한 강화 학습 알고리즘을 쉽게 구현할 수 있다.

용어 해설

분산 컴퓨팅(Distributed Computing)
여러 대의 컴퓨터가 네트워크로 연결되어 하나의 작업을 나누어 처리하는 방식이다. AI 모델의 크기가 커짐에 따라 단일 장비의 한계를 극복하고 대규모 데이터를 빠르게 처리하기 위해 필수적으로 사용된다.
결함 허용(Fault Tolerance)
시스템의 일부 구성 요소에 장애가 발생하더라도 전체 시스템이 중단되지 않고 작업을 계속 수행할 수 있는 능력이다. 분산 학습 중 특정 노드가 고장 나도 체크포인트를 통해 학습을 재개하는 기능 등이 포함된다.
배치 추론(Batch Inference)
대량의 데이터를 한꺼번에 모델에 입력하여 결과를 얻는 처리 방식이다. 실시간 응답이 필요 없는 대규모 데이터 분석이나 예측 작업에서 처리량(Throughput)을 극대화하기 위해 사용된다.
오토스케일링(Autoscaling)
워크로드의 수요에 따라 컴퓨팅 리소스를 자동으로 늘리거나 줄이는 기술이다. 사용량이 적을 때는 비용을 절감하고, 부하가 몰릴 때는 성능을 유지할 수 있게 해준다.
강화 학습(Reinforcement Learning)
에이전트가 환경과 상호작용하며 보상을 최대화하는 방향으로 행동을 학습하는 머신러닝 기법이다. 로보틱스, 게임, 추천 시스템 등 복잡한 의사결정이 필요한 분야에 활용된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2025. 12. 23.수집 2026. 02. 21.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.