AMD MI300X에서 LLM 에이전트 앱을 가장 효율적으로 배포하는 방법
AMD Enterprise AI Suite 환경에서 Helm 차트를 이용해 고성능 AI 솔루션 블루프린트를 배포하고, GPU 리소스 최적화를 위해 LLM 서비스를 공유하거나 모델을 교체하는 실전 가이드이다.
NVIDIA CUDA의 대안인 AMD ROCm 생태계에 대한 심층적인 기술 및 최적화 가이드
AMD Enterprise AI Suite 환경에서 Helm 차트를 이용해 고성능 AI 솔루션 블루프린트를 배포하고, GPU 리소스 최적화를 위해 LLM 서비스를 공유하거나 모델을 교체하는 실전 가이드이다.
AMD의 Composable Kernel 라이브러리에서 다차원 데이터 레이아웃을 효율적으로 관리하는 TensorDescriptor의 원리와 이를 활용한 고성능 행렬 전치 구현법을 다룹니다.
AMD Instinct MI355X GPU가 GROMACS 분자 동역학 시뮬레이션에서 MI300X 대비 최대 50% 향상된 성능을 기록했으며, GPU 파티셔닝을 통해 처리량을 최대 3.2배까지 높일 수 있음이 확인됐다.
ROCm 7.0.0과 Ray 2.51.1을 결합하여 AMD GPU 환경에서 RLHF 학습, vLLM 추론, 모델 서빙 등을 효율적으로 확장하고 최적화하는 실전 가이드를 제공한다.
AMD는 온라인 회전과 SmoothQuant를 결합하여 MXFP4 양자화 시 발생하는 정확도 손실을 최소화하고 8B에서 32B 모델의 성능을 원본 대비 98% 이상 복구하는 기법을 제시했다.