본문으로 건너뛰기

AMD 솔루션 블루프린트 배포 및 커스터마이징 가이드

AMD Enterprise AI Suite 환경에서 Helm 차트를 이용해 고성능 AI 솔루션 블루프린트를 배포하고, GPU 리소스 최적화를 위해 LLM 서비스를 공유하거나 모델을 교체하는 실전 가이드이다.

섹션별 상세

01
AMD 솔루션 블루프린트는 마이크로서비스 아키텍처를 채택하여 표준 채팅 인터페이스부터 복잡한 에이전트 프레임워크까지 다양한 유스케이스를 지원한다. 모든 블루프린트는 Helm 차트로 패키징되어 있어 AMD Enterprise AI Suite 클러스터에 즉시 배포가 가능하며 아키텍처 다이어그램과 문서가 포함되어 있다. 이를 통해 개발자는 처음부터 시스템을 구축할 필요 없이 검증된 참조 모델을 기반으로 개발을 시작할 수 있다.
bash
name="autostudio"
namespace="demo"
chart="aimsb-autogenstudio"

# Helm 템플릿 생성 및 파일 저장
helm template $name oci://registry-1.docker.io/amdenterpriseai/$chart > ags-default-deployment.yaml

# 쿠버네티스 클러스터에 배포
kubectl apply -f ags-default-deployment.yaml -n $namespace

AutoGen Studio 솔루션 블루프린트를 기본 설정으로 배포하는 명령어

AutoGen Studio 에이전트 플랫폼 아키텍처
Diagram사용자의 쿼리가 AutoGen Studio를 거쳐 검증 에이전트와 웹 서퍼 에이전트 팀으로 전달되고, 이들이 AIM LLM과 상호작용하며 도구를 사용하는 흐름을 설명한다.
02
한정된 GPU 리소스를 최적화하기 위해 여러 솔루션 블루프린트가 단일 AIM LLM 배포본을 공유하는 구조를 구현할 수 있다. AutoGen Studio 배포 시 생성된 Llama 3.3 70B 서비스를 에이전트 번역 앱 배포 시 llm.existingService 파라미터로 지정하면 추가 모델 로드 없이 기존 추론 엔진을 그대로 활용한다. 이 방식은 중복된 모델 배포로 인한 메모리 낭비를 방지하고 인프라 효율성을 극대화한다.
bash
name="translator"
namespace="demo"
servicename="llama33-70b-instruct-autostudio"
chart="aimsb-agentic-translation"

# 기존에 실행 중인 AIM 서비스를 사용하도록 설정
helm template $name oci://registry-1.docker.io/amdenterpriseai/$chart \
  --set llm.existingService=$servicename > at-deployment.yaml

기존에 배포된 LLM 서비스를 재사용하여 새로운 에이전트 앱을 연결하는 설정

두 개의 솔루션 블루프린트가 하나의 AIM LLM 서비스를 공유하는 구조도
DiagramAutoGen Studio와 Agentic Translation 앱이 각각 별도의 모델을 띄우지 않고, 중앙의 Llama 3.3 70B Instruct 서비스를 공유하여 GPU 자원을 절약하는 아키텍처를 보여준다.
03
기본 모델인 Llama 3.3 70B 대신 Qwen3-32B와 같은 다른 모델로 교체하는 커스터마이징이 가능하다. Helm의 --set 플래그를 사용하여 이미지 경로, 정밀도(Precision), 리소스 할당량을 런타임에 수정할 수 있다. 예를 들어 모델 정밀도를 fp8에서 fp16으로 변경하거나 특정 모델에 최적화된 AIM 이미지를 지정하여 워크로드 특성에 맞는 환경을 구축한다.
에이전트 기반 번역 아키텍처 다이어그램
Diagram실행 에이전트, 비판 에이전트, 판사 에이전트가 루프를 돌며 번역 품질을 개선하고 최종 결과를 도출하는 멀티 에이전트 워크플로우를 시각화한다.
k9s 도구에서 확인된 Qwen3-32B 배포 상태 스크린샷
Screenshot기본 모델인 Llama 대신 Qwen3-32B 모델이 성공적으로 배포되어 실행 중인 실제 쿠버네티스 클러스터의 상태를 증명한다.
04
복잡한 설정 변경이 필요한 경우 YAML 형식의 오버라이드 파일을 사용하여 배포 구성을 체계적으로 관리한다. CPU 할당량, 임시 스토리지 용량, GPU 개수 등 하드웨어 자원 요청 사항을 파일에 명시하고 helm template 실행 시 -f 옵션으로 전달한다. 이 방식은 버전 관리가 용이하고 가독성이 높아 프로덕션 환경에서 설정을 추적하고 재현하는 데 유리하다.
yaml
llm:
  image: "amdenterpriseai/aim-qwen-qwen3-32b:0.10.0"
  env_vars:
    AIM_PRECISION: "fp16"
  nameOverride: qwen3-32b
  cpu_per_gpu: 8
  storage:
    ephemeral:
      quantity: 350Gi

모델을 Qwen3-32B로 변경하고 하드웨어 리소스를 커스텀 정의하는 오버라이드 파일

용어 해설

AMD 추론 마이크로서비스(AIM)
AMD Inference Microservices의 약자로, AMD Instinct GPU 환경에서 LLM 추론을 최적화하여 실행하기 위한 마이크로서비스 아키텍처 기반의 배포 단위이다. 컨테이너화된 형태로 제공되어 쿠버네티스 환경에서 확장이 용이하며 고성능 추론을 지원한다.
헬름 차트(Helm Chart)
쿠버네티스 애플리케이션을 정의, 설치 및 업그레이드하기 위한 패키징 형식이다. 복잡한 쿠버네티스 리소스들을 템플릿화하여 관리하며, 설정값(values.yaml) 수정을 통해 동일한 애플리케이션을 다양한 환경에 맞게 쉽게 배포할 수 있다.
에이전트 워크플로우(Agentic Workflow)
단일 LLM 호출을 넘어 여러 AI 에이전트가 협력, 비판, 수정 과정을 거쳐 복잡한 작업을 수행하는 구조이다. 번역 에이전트가 초안을 작성하면 검토 에이전트가 품질을 평가하고 수정하는 식의 반복 루프를 통해 결과물의 품질을 높인다.
포트 포워딩(Port Forwarding)
클러스터 외부의 로컬 머신에서 쿠버네티스 내부 서비스에 접근할 수 있도록 네트워크 포트를 연결하는 기술이다. 개발 단계에서 별도의 로드밸런서 설정 없이도 웹 브라우저를 통해 배포된 AI 애플리케이션의 UI를 즉시 확인할 수 있게 한다.

기술

  • Llama 3.3 70B Instruct
  • Qwen3-32B
  • AutoGen Studio
  • AMD Enterprise AI Suite
  • Helm
  • Kubernetes

활용 사례

  • 멀티 에이전트 협업 번역 시스템
  • 웹 기반 AI 에이전트 관리 인터페이스
  • GPU 리소스 공유형 LLM 추론 인프라
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 02.수집 2026. 04. 03.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.