챕터별 상세
Ray의 정의와 탄생 배경
Ray는 Berkeley RiseLab에서 강화학습 연구 중 인프라 관리의 어려움을 해결하기 위해 개발된 오픈소스 분산 컴퓨팅 프레임워크이다. Spark를 만든 연구실에서 탄생했으며, 개발자가 분산 시스템 전문가가 아니어도 Python 코드를 여러 장비로 확장할 수 있게 설계되었다. 기존의 복잡한 인프라 설정 대신 Python 데코레이터 하나로 분산 처리를 구현할 수 있는 것이 핵심이다.
Berkeley RiseLab은 Spark, Mesos 등 현대적인 데이터 처리 도구들이 탄생한 곳이다.
AI 파이프라인에서의 Ray의 역할
Ray는 데이터 전처리(Ray Data), 학습(Ray Train), 추론(Ray Serve) 등 ML 파이프라인 전체를 지원한다. 특히 비정형 데이터와 멀티모달 데이터를 처리할 때 기존 Spark보다 유연하며, Python 네이티브한 방식으로 GPU와 CPU 자원을 혼합하여 최적화할 수 있다. 데이터 엔지니어부터 ML 엔지니어까지 동일한 프레임워크를 사용하여 협업 효율을 높였다.
Spark는 주로 정형 데이터 처리에 강점이 있는 반면, Ray는 비정형 데이터와 모델 연산에 최적화되어 있다.
vLLM과 Ray의 시너지
인기 있는 추론 엔진인 vLLM은 Ray를 기반으로 구축되어 단일 장비를 넘어선 분산 추론을 구현한다. Ray Serve를 통해 API 병렬 처리를 관리하고, 여러 GPU 노드에 걸쳐 모델을 효율적으로 배치하여 지연 시간을 줄이고 처리량을 극대화한다. vLLM이 단일 노드 내 최적화를 담당한다면, Ray는 노드 간의 오케스트레이션을 담당하여 대규모 서빙을 가능하게 한다.
vLLM은 PagedAttention 기술을 통해 LLM 추론 효율을 극대화하는 라이브러리이다.
SaaS vs 오픈소스 Ray 선택 기준
단순 API 호출(SaaS)과 직접 인프라 구축 사이의 선택 기준을 제시한다. 고유한 데이터셋을 사용하거나, 특정 하드웨어 최적화가 필요하거나, 비용 효율성을 극대화해야 하는 경우 Ray를 통한 직접 제어가 유리하다. 특히 보안이 중요한 금융이나 의료 분야에서는 자체 인프라 위에서 Ray를 운영하는 것이 필수적이다.
SaaS는 편리하지만 커스터마이징과 데이터 보안 측면에서 제약이 있을 수 있다.
AI 에이전트와 복잡한 워크플로우 관리
에이전트 시스템에서 발생하는 다양한 도구 호출과 상태 관리를 Ray가 어떻게 단순화하는지 설명한다. 여러 에이전트가 동시에 작동할 때 자원 할당과 스케일링을 자동화하여 개발자가 로직에만 집중할 수 있게 한다. 에이전트 간의 통신 지연을 최소화하고, 실패한 작업을 자동으로 재시도하는 등의 안정성 기능을 제공한다.
AI 에이전트는 단순 응답을 넘어 도구를 사용하고 계획을 세우는 복잡한 시스템이다.
Ray 생태계와 미래 전망
Ray가 Linux Foundation에 합류하며 표준화된 AI 인프라로 자리 잡고 있음을 강조한다. 향후 더 작은 모델의 빈번한 학습과 추론이 중요해짐에 따라 Ray의 유연한 자원 관리 능력이 더욱 핵심적인 역할을 할 것으로 전망한다. 오픈소스 커뮤니티의 활발한 참여로 인해 다양한 클라우드 환경과 하드웨어 가속기에 대한 지원이 지속적으로 확장되고 있다.
Linux Foundation 합류는 해당 프로젝트가 특정 기업의 소유를 넘어 공공의 표준이 되었음을 의미한다.
용어 해설
- 분산 컴퓨팅(Distributed Computing)
- — 여러 대의 컴퓨터를 네트워크로 연결하여 하나의 거대한 시스템처럼 작동하게 함으로써 대규모 연산을 처리하는 기술이다. AI 모델의 크기가 커짐에 따라 단일 GPU의 메모리 한계를 극복하기 위해 필수적으로 사용된다.
- 레이 코어(Ray Core)
- — Ray 프레임워크의 가장 하위 계층으로, Python 함수나 클래스를 분산 환경에서 실행할 수 있게 해주는 핵심 엔진이다. 복잡한 네트워크 설정 없이도 코드를 여러 노드로 확장할 수 있는 추상화 계층을 제공한다.
- 페이지드 어텐션(PagedAttention)
- — vLLM에서 사용하는 핵심 기술로, 운영체제의 가상 메모리 관리 방식처럼 KV 캐시를 관리하여 메모리 낭비를 줄인다. 이를 통해 LLM 추론 시 처리량(Throughput)을 획기적으로 높일 수 있다.
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2025. 12. 29.수집 2026. 02. 21.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.