섹션별 상세
AMD 솔루션 블루프린트는 마이크로서비스 아키텍처를 채택하여 표준 채팅 인터페이스부터 복잡한 에이전트 프레임워크까지 다양한 유스케이스를 지원한다. 모든 블루프린트는 Helm 차트로 패키징되어 있어 AMD Enterprise AI Suite 클러스터에 즉시 배포가 가능하며 아키텍처 다이어그램과 문서가 포함되어 있다. 이를 통해 개발자는 처음부터 시스템을 구축할 필요 없이 검증된 참조 모델을 기반으로 개발을 시작할 수 있다.
bash
name="autostudio"
namespace="demo"
chart="aimsb-autogenstudio"
# Helm 템플릿 생성 및 파일 저장
helm template $name oci://registry-1.docker.io/amdenterpriseai/$chart > ags-default-deployment.yaml
# 쿠버네티스 클러스터에 배포
kubectl apply -f ags-default-deployment.yaml -n $namespaceAutoGen Studio 솔루션 블루프린트를 기본 설정으로 배포하는 명령어

한정된 GPU 리소스를 최적화하기 위해 여러 솔루션 블루프린트가 단일 AIM LLM 배포본을 공유하는 구조를 구현할 수 있다. AutoGen Studio 배포 시 생성된 Llama 3.3 70B 서비스를 에이전트 번역 앱 배포 시 llm.existingService 파라미터로 지정하면 추가 모델 로드 없이 기존 추론 엔진을 그대로 활용한다. 이 방식은 중복된 모델 배포로 인한 메모리 낭비를 방지하고 인프라 효율성을 극대화한다.
bash
name="translator"
namespace="demo"
servicename="llama33-70b-instruct-autostudio"
chart="aimsb-agentic-translation"
# 기존에 실행 중인 AIM 서비스를 사용하도록 설정
helm template $name oci://registry-1.docker.io/amdenterpriseai/$chart \
--set llm.existingService=$servicename > at-deployment.yaml기존에 배포된 LLM 서비스를 재사용하여 새로운 에이전트 앱을 연결하는 설정

기본 모델인 Llama 3.3 70B 대신 Qwen3-32B와 같은 다른 모델로 교체하는 커스터마이징이 가능하다. Helm의 --set 플래그를 사용하여 이미지 경로, 정밀도(Precision), 리소스 할당량을 런타임에 수정할 수 있다. 예를 들어 모델 정밀도를 fp8에서 fp16으로 변경하거나 특정 모델에 최적화된 AIM 이미지를 지정하여 워크로드 특성에 맞는 환경을 구축한다.


복잡한 설정 변경이 필요한 경우 YAML 형식의 오버라이드 파일을 사용하여 배포 구성을 체계적으로 관리한다. CPU 할당량, 임시 스토리지 용량, GPU 개수 등 하드웨어 자원 요청 사항을 파일에 명시하고 helm template 실행 시 -f 옵션으로 전달한다. 이 방식은 버전 관리가 용이하고 가독성이 높아 프로덕션 환경에서 설정을 추적하고 재현하는 데 유리하다.
yaml
llm:
image: "amdenterpriseai/aim-qwen-qwen3-32b:0.10.0"
env_vars:
AIM_PRECISION: "fp16"
nameOverride: qwen3-32b
cpu_per_gpu: 8
storage:
ephemeral:
quantity: 350Gi모델을 Qwen3-32B로 변경하고 하드웨어 리소스를 커스텀 정의하는 오버라이드 파일
용어 해설
- AMD 추론 마이크로서비스(AIM)
- — AMD Inference Microservices의 약자로, AMD Instinct GPU 환경에서 LLM 추론을 최적화하여 실행하기 위한 마이크로서비스 아키텍처 기반의 배포 단위이다. 컨테이너화된 형태로 제공되어 쿠버네티스 환경에서 확장이 용이하며 고성능 추론을 지원한다.
- 헬름 차트(Helm Chart)
- — 쿠버네티스 애플리케이션을 정의, 설치 및 업그레이드하기 위한 패키징 형식이다. 복잡한 쿠버네티스 리소스들을 템플릿화하여 관리하며, 설정값(values.yaml) 수정을 통해 동일한 애플리케이션을 다양한 환경에 맞게 쉽게 배포할 수 있다.
- 에이전트 워크플로우(Agentic Workflow)
- — 단일 LLM 호출을 넘어 여러 AI 에이전트가 협력, 비판, 수정 과정을 거쳐 복잡한 작업을 수행하는 구조이다. 번역 에이전트가 초안을 작성하면 검토 에이전트가 품질을 평가하고 수정하는 식의 반복 루프를 통해 결과물의 품질을 높인다.
- 포트 포워딩(Port Forwarding)
- — 클러스터 외부의 로컬 머신에서 쿠버네티스 내부 서비스에 접근할 수 있도록 네트워크 포트를 연결하는 기술이다. 개발 단계에서 별도의 로드밸런서 설정 없이도 웹 브라우저를 통해 배포된 AI 애플리케이션의 UI를 즉시 확인할 수 있게 한다.
기술
- Llama 3.3 70B Instruct
- Qwen3-32B
- AutoGen Studio
- AMD Enterprise AI Suite
- Helm
- Kubernetes
활용 사례
- 멀티 에이전트 협업 번역 시스템
- 웹 기반 AI 에이전트 관리 인터페이스
- GPU 리소스 공유형 LLM 추론 인프라
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 04. 02.수집 2026. 04. 03.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.