Slurm과 Kubernetes가 같은 GPU를 공유하는 공존 과제
HPC용 스케줄러와 Kubernetes가 동일한 GPU 자원을 두고 다른 운영 가정을 요구하여, 두 환경의 공존을 위한 메타스케줄링 접근이 필요하다.
엔터프라이즈급 MLOps 운영과 GPU 하드웨어 최적화, 그리고 HPC와 Kubernetes를 결합한 실무적인 인프라 관리 전략을 심도 있게
HPC용 스케줄러와 Kubernetes가 동일한 GPU 자원을 두고 다른 운영 가정을 요구하여, 두 환경의 공존을 위한 메타스케줄링 접근이 필요하다.
LeRobot, ClearML, Dell이 협력해 수작업 기반 로봇 데이터 수집부터 학습·배포까지를 자동화한 파이프라인을 구축했다.
기업 AI 인프라 수요가 트레이닝에서 추론으로 이동하면서 용량 산정·하드웨어 조달·플랫폼 설계 방식이 근본적으로 달라지고 있다.
AMD AIMs는 모델과 런타임을 포함한 컨테이너를 제공하고, ClearML은 운영 계층을 관리해 생산형 추론 엔드포인트를 간소화한다.
미국 에너지부 산하 NERSC가 슈퍼컴퓨터 Perlmutter와 차세대 Doudna 시스템의 AI 워크플로 관리를 위해 ClearML을 도입하여 연구 생산성을 높임.
ClearML과 Dell Technologies가 협력하여 Dell 하드웨어 위에서 엔터프라이즈 AI 플랫폼을 신속하게 구축하고 운영할 수 있는 통합 솔루션을 제공한다.
ClearML의 AI 워크플로 오케스트레이션과 Dell의 엔터프라이즈 데이터 플랫폼을 통합하여 AI 인프라의 확장성과 관리 효율성을 높이는 참조 아키텍처를 소개한다.
ClearML의 7단계 보안 모델을 통해 엔터프라이즈 AI 환경의 개발부터 운영까지 전 과정을 체계적으로 보호하는 방법을 제시한다.
ClearML이 Dell AI 생태계 프로그램에 합류하며 Kubernetes 및 OpenShift 환경을 위한 사전 검증된 AI Factory 배포 블루프린트를 출시했다.
ClearML의 오케스트레이션 대시보드와 감사 기능을 통해 AI 워크로드의 리소스 사용량, 실행 환경, 모델 계보를 통합 관리하고 규정 준수를 달성하는 방법을 제시합니다.
Kubernetes 기반 AI 인프라에서 네트워크 세그멘테이션, mTLS, SSO 및 감사 로그를 통해 제로 트러스트 보안 모델을 구현하는 방법과 ClearML의 역할을 설명한다.
Kubernetes 환경에서 RBAC의 한계를 극복하기 위해 SUSE k3k를 활용한 가상 클러스터 아키텍처로 AI 테넌트 간의 진정한 제어 평면 격리를 구현하는 방법을 제시합니다.
ClearML의 서비스 계정과 가장(Impersonation) 기능을 통해 AI 워크로드 자동화 과정에서 보안 거버넌스와 최소 권한 원칙을 실현하는 방법을 제시한다.
ClearML의 AI 애플리케이션 게이트웨이는 토큰 인증, RBAC, 정적 경로를 통해 프로덕션 환경의 AI 모델 엔드포인트를 안전하게 보호하고 관리한다.
ClearML이 NVIDIA Cosmos와 Nemotron 모델을 통합하여 복잡한 비전 AI 및 멀티모달 워크플로를 프로덕션 환경에서 효율적으로 배포하고 관리하는 솔루션을 발표했다.
ClearML의 리소스 풀, 프로필, 정책 시스템을 통해 공유 GPU 인프라의 활용도를 극대화하고 팀 간 자원 충돌을 해결하는 거버넌스 전략을 제시합니다.
NVIDIA Dynamo의 분산 추론 최적화 기술과 ClearML의 엔터프라이즈 운영 레이어를 통합하여 대규모 LLM 서빙의 효율성과 관리 편의성을 극대화한다.
ClearML Vault는 관리자가 설정한 스토리지, 컴퓨팅, 자격 증명 정책을 런타임에 자동으로 적용하여 AI 개발 환경의 보안과 컴플라이언스를 보장한다.
ClearML과 SUSE Rancher Prime의 k3k 통합을 통해 엔터프라이즈 AI 팀에 보안이 강화된 독립적 가상 Kubernetes 클러스터와 관리 자율성을 제공한다.
ClearML이 GTC 2026에서 NVIDIA AI Enterprise 유동 라이선스 관리, Cosmos 기반 비디오 AI 블루프린트, 엔터프라이즈 플랫폼 관리 센터를 발표하며 인프라 역량을 강화했다.
ClearML은 NVIDIA Cosmos Reason 2 모델과 비디오 검색·요약 블루프린트를 기업 규모에서 즉시 배포하고 관리할 수 있는 통합 MLOps 인프라를 제공한다.
ClearML은 태스크 기반 실행 모델과 에이전트 시스템을 통해 AI 워크로드의 자원 할당을 자동화하고 가시성을 확보하여 인프라 효율성을 높인다.
ClearML Enterprise v3.28은 새로운 이벤트 미터링 서비스와 강화된 리소스 정책 관리 기능을 통해 대규모 AI 팀의 운영 효율성과 거버넌스를 극대화하며 비용 가시성을 제공합니다.
ClearML 플랫폼을 통해 데이터 버전 관리부터 모델 배포까지 AI 생애주기 전반의 추적성과 거버넌스를 자동화하여 EU AI 법의 규제 요구사항을 충족하는 방법을 제시한다.