본문으로 건너뛰기
KT Cloud조회 5

Kubernetes v1.35 Timbernetes 분석: AI 스케줄링과 무중단 리소스 확장

Kubernetes v1.35는 실행 중인 Pod의 리소스를 재시작 없이 변경하는 기능의 GA 전환과 AI 워크로드를 위한 Gang Scheduling 도입을 통해 운영 효율성을 극대화했다.

섹션별 상세

기존에는 Pod의 CPU나 메모리 사양을 변경하려면 반드시 Pod를 재시작해야 하는 서비스 중단 문제가 있었다. In-Place Pod Resource Resize 기능은 Update 호출 한 번으로 실행 중인 컨테이너의 cgroup 설정을 즉시 변경하여 가용성을 유지한다. v1.35에서 GA로 전환된 이 기능은 데이터베이스나 AI 학습 워크로드처럼 구동 시간이 긴 애플리케이션 운영에 혁신적인 유연성을 제공한다. 특히 resizePolicy 설정을 통해 리소스별 재시작 여부를 정교하게 제어할 수 있어 운영 효율이 극대화된다.
yaml
apiVersion: v1
kind: Pod
metadata:
  name: dynamic-app
spec:
  containers:
  - name: heavy-worker
    image: my-app:latest
    resources:
      limits:
        cpu: "1"
        memory: "1Gi"
      requests:
        cpu: "0.5"
        memory: "512Mi"
    # 리소스 변경 시 재시작하지 않도록 설정
    resizePolicy:
    - resourceName: cpu
      restartPolicy: NotRequired
    - resourceName: memory
      restartPolicy: NotRequired

Pod 재시작 없이 CPU와 메모리 리소스를 동적으로 변경하기 위한 resizePolicy 설정 예시

bash
kubectl patch pod my-app --type='json' \
  -p='[{ "op": "replace", "path": "/spec/containers/0/resources/requests/cpu", "value": "500m" },
  { "op": "replace", "path": "/spec/containers/0/resources/limits/cpu", "value": "1000m" }]'

실행 중인 Pod의 CPU 할당량을 kubectl patch 명령어로 실시간 수정하는 방법

근거
  • In-Place Pod Resource Resize 기능이 6년여의 개발 끝에 v1.35에서 GA로 전환되었다. 1. 이번 릴리스의 주인공: In-Place Pod Resource Resize (GA) 섹션
AI 모델 학습을 위한 분산 환경에서 일부 Pod만 자원을 점유하고 나머지는 대기하며 발생하는 자원 교착 상태가 빈번했다. v1.35는 네이티브 Gang Scheduling 기능을 Alpha 단계로 도입하여 연관된 Pod 그룹이 모두 준비되었을 때만 실행하는 All-or-Nothing 로직을 지원한다. 이를 통해 고가의 GPU 자원이 낭비되는 것을 방지하고 대규모 클러스터의 스케줄링 효율을 높인다. AI/ML 워크로드 수용을 위한 쿠버네티스 코어 레벨의 중요한 진전이다.
클라우드 환경에서 노드 간 트래픽 발생은 지연 시간 증가와 추가 비용 발생의 주요 원인이었다. Service의 trafficDistribution 필드에 PreferSameNode 설정이 정식 추가되어 동일 노드 내의 Pod로 요청을 우선 전달하도록 강제할 수 있다. 마이크로서비스 간 통신이 잦은 환경에서 네트워크 Latency를 획기적으로 줄이고 Egress 비용을 절감하는 효과를 거둔다. 성능 최적화와 비용 효율성을 동시에 달성할 수 있는 실무적인 기능이다.
대규모 AI 모델 가중치나 데이터를 전달하기 위해 컨테이너 이미지에 포함시키거나 별도의 다운로드 과정을 거치는 복잡함이 존재했다. OCI Image Volume 기능이 GA로 전환되면서 레지스트리의 이미지를 Pod 내부에 읽기 전용 볼륨으로 직접 마운트할 수 있게 되었다. 컨테이너 로직과 데이터를 완전히 분리하여 관리할 수 있으며, Gang Scheduling과 결합 시 수십 개의 GPU Pod가 데이터를 즉시 공유하며 기동되는 시너지를 낸다. 데이터 관리의 편의성과 배포 속도를 동시에 개선한 결과이다.
yaml
spec:
  containers:
  - name: ai-inference-app
    image: my-app:v1.0
    volumeMounts:
    - name: model-weights
      mountPath: /models
  volumes:
  - name: model-weights
    image:
      reference: my-registry/llm-model:v2.0 # OCI 이미지를 볼륨으로 사용

OCI 레지스트리의 모델 가중치 이미지를 Pod 볼륨으로 직접 마운트하는 설정

근거
  • OCI Image Volume 기능을 통해 이미지를 볼륨처럼 마운트하여 컨테이너 로직과 데이터를 분리할 수 있다. 4. 데이터 관리의 혁신: OCI Image Volume (GA) 섹션
기존의 API 서버 인증 설정은 명령줄 인자를 수정하고 서버를 재시작해야 하는 운영상의 번거로움과 위험이 있었다. Structured Authentication Config의 GA 전환으로 설정 파일 수정만으로 API 서버 재시작 없이 실시간 인증 정책 반영이 가능해졌다. CEL(Common Expression Language)을 활용해 사용자 클레임을 검증하거나 그룹을 동적으로 매핑하는 정교한 보안 제어가 지원된다. 이는 제로 트러스트 환경 구축을 위한 유연하고 안전한 권한 관리 체계를 제공한다.

이미지 분석

Kubernetes v1.35 Timbernetes 공식 릴리즈 로고
Infographic

세계수(Yggdrasil)를 형상화한 로고로, 안정기에 접어든 쿠버네티스 생태계의 견고함을 상징합니다. 로고 속 다람쥐 캐릭터들은 각각 Triager, Reviewer, Release Crew를 의미하며 오픈소스 기여자들의 역할을 묘사합니다.

Kubernetes v1.35 Timbernetes 공식 릴리즈 로고

용어 해설

갱 스케줄링(Gang Scheduling)
서로 연관된 여러 개의 Pod를 하나의 그룹으로 묶어 전체가 동시에 실행 가능할 때만 자원을 할당하는 방식이다. 분산 학습이 필수적인 AI/ML 워크로드에서 일부 Pod만 실행되어 GPU 자원을 점유한 채 대기하는 데드락 현상을 방지하여 고가의 하드웨어 효율을 극대화한다.
인플레이스 포드 수직 확장(In-Place Pod Vertical Scaling)
실행 중인 Pod를 재시작하거나 삭제 후 재생성하지 않고도 CPU나 메모리 리소스 할당량을 실시간으로 변경하는 기술이다. 2019년 제안 이후 v1.35에서 정식 버전(GA)이 되었으며, 데이터베이스나 AI 학습처럼 구동 시간이 긴 애플리케이션의 서비스 가용성을 유지하며 자원을 최적화할 수 있게 한다.
OCI 이미지 볼륨(OCI Image Volume)
OCI 레지스트리에 저장된 컨테이너 이미지를 Pod 내부에 읽기 전용 볼륨으로 직접 마운트하는 기능이다. 대규모 AI 모델 가중치나 정적 데이터를 애플리케이션 로직과 분리하여 관리할 수 있으며, 별도의 초기화 컨테이너 없이도 대용량 데이터를 즉각적으로 사용할 수 있게 한다.
컨트롤 그룹 버전 2(cgroup v2)
리눅스 커널에서 프로세스 그룹의 리소스 사용을 제한하고 격리하는 메커니즘의 최신 버전이다. Kubernetes v1.35는 v1 지원 폐기를 예고하며 v2를 공식 권장하는데, 이는 리소스 관리의 일관성을 높이고 최신 커널 기능을 활용하기 위한 필수적인 인프라 변화이다.

근거 모음

근거
  • v1.35 릴리즈에는 281개 기업, 총 1,769명의 컨트리뷰터가 참여했다. Timbernetes: The World Tree Release 도입부 문단

기술

  • Kubernetes v1.35
  • containerd
  • OCI
  • OIDC
  • CEL

활용 사례

  • AI/ML 분산 학습 워크로드 관리
  • 데이터베이스 등 스테이트풀 서비스의 무중단 자원 확장
  • 클라우드 네트워크 비용 최적화
  • 제로 트러스트 보안 인증 체계 구축

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 08.수집 2026. 05. 08.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.