본문으로 건너뛰기

AMD 미니 PC에서 LLM 성능 최적화를 위한 GPU 메모리 할당 가이드

통합 GPU를 사용하는 AMD 미니 PC에서 BIOS의 UMA 설정을 통해 시스템 RAM을 VRAM으로 재할당하여 대규모 언어 모델(LLM) 구동 성능을 극대화하는 방법을 제시한다.

섹션별 상세

01
통합 메모리 아키텍처(UMA)는 CPU와 GPU가 하나의 물리적 LPDDR5X RAM 풀을 공유하는 방식이다. 데스크톱의 외장 그래픽 카드와 달리 전용 메모리가 없으며, 펌웨어 수준에서 시스템용과 그래픽용 메모리 영역을 구분한다. 인텔의 DVMT와 같은 동적 할당 기술과 달리 특정 하드웨어 환경에서는 리눅스 운영체제가 전체 메모리를 인식하지 못하고 펌웨어에서 예약된 영역을 제외한 나머지만 표시하는 현상이 나타난다.
02
시스템의 메모리 할당 상태는 리눅스 커널 명령어를 통해 정밀하게 진단할 수 있다. free -h 명령어는 운영체제가 사용 가능한 시스템 메모리만을 보여주며, /sys/class/drm/card*/device/mem_info_vram_total 파일을 확인하면 GPU에 할당된 실제 VRAM 총량을 바이트 단위로 파악할 수 있다. 저자의 128GB 시스템은 초기 설정에서 시스템 62GB, GPU 64GB로 양분되어 대형 모델 구동에 제약이 있었다.
bash
$ free -h
Mem: 62Gi

운영체제가 인식하는 현재 시스템 메모리 용량을 확인하는 명령어

bash
$ cat /sys/class/drm/card*/device/mem_info_vram_total
68719476736

리눅스 커널 드라이버를 통해 GPU에 할당된 전체 VRAM 크기를 바이트 단위로 확인하는 명령어

bash
$ cat /sys/class/drm/card*/device/mem_info_vram_used
348594176

현재 GPU 메모리(VRAM) 중 실제로 사용 중인 데이터 용량을 확인하는 명령어

리눅스 터미널에서 VRAM 용량과 시스템 메모리를 확인하는 명령어 실행 결과
Screenshotcat 명령어로 확인한 VRAM 총량(약 103GB)과 free -h로 확인한 시스템 메모리(30Gi)를 보여준다. BIOS 설정 변경 후 운영체제와 GPU가 메모리를 어떻게 나누어 인식하는지 실제 수치로 나타낸다.
03
BIOS의 'Advanced > GFX Configuration' 메뉴 내 'UMA Frame buffer Size' 설정을 통해 메모리 파티션을 수동으로 재구성할 수 있다. 128GB RAM 환경에서 GPU 할당량을 96GB로 상향 조정하면 시스템용으로 32GB가 남게 되며, 이는 일반적인 서버 워크로드를 처리하기에 충분한 수준이다. 이러한 조정을 통해 Q8 양자화 기준 약 70GB의 VRAM이 필요한 70B 파라미터 모델을 여유롭게 적재할 수 있는 환경이 마련된다.
BIOS의 UMA 프레임 버퍼 크기 설정 화면
ScreenshotAptio Setup 메뉴에서 GPU에 할당할 메모리 크기를 512M부터 96G까지 선택하는 과정을 보여준다. 실제 하드웨어 수준에서 메모리 파티션을 조정하는 핵심 단계를 시각적으로 증명한다.
04
모델의 양자화(Quantization) 수준은 추론의 정확도와 VRAM 요구 사항 사이의 균형을 결정한다. Q4와 같은 낮은 비트의 양자화는 메모리를 절약하지만 복잡한 논리 체인, 언어적 뉘앙스, 지시 이행 능력에서 정밀도 손실을 유발한다. 반면 VRAM을 충분히 확보하여 Q8이나 FP16 수준의 모델을 사용하면 사실 관계의 신뢰도가 높아지고 긴 문맥에서도 일관된 출력을 유지하는 등 전반적인 추론 품질이 향상된다.

용어 해설

통합 메모리 아키텍처(UMA)
CPU와 GPU가 동일한 물리적 RAM 풀을 공유하는 구조이다. 별도의 전용 비디오 메모리가 없는 시스템에서 효율적인 자원 활용을 가능하게 하지만, 설정에 따라 운영체제가 인식하는 가용 메모리가 제한될 수 있다.
비디오 램(VRAM)
그래픽 처리 장치(GPU)가 이미지 데이터와 모델 가중치를 저장하는 데 사용하는 전용 메모리이다. LLM 추론 시 모델의 파라미터 크기와 양자화 수준에 비례하여 대량의 VRAM이 요구된다.
양자화(Quantization)
모델의 가중치를 낮은 비트 수(예: 16비트에서 4비트)로 변환하여 메모리 사용량을 줄이는 기법이다. 모델 크기를 획기적으로 줄여주지만, 정밀도 손실로 인해 복잡한 추론 시 품질 저하가 발생할 수 있다.
기본 입출력 시스템(BIOS)
컴퓨터 하드웨어를 초기화하고 운영체제에 제어권을 넘겨주는 펌웨어이다. 통합 GPU 시스템에서는 시스템 RAM 중 얼마를 GPU 전용으로 할당할지 결정하는 UMA 설정을 포함한다.
커널(Kernel)
운영체제의 핵심부로 하드웨어 자원을 관리한다. 리눅스 커널은 sysfs 인터페이스를 통해 GPU의 VRAM 사용량 및 할당량 정보를 사용자 공간에 텍스트 파일 형태로 제공한다.

기술

  • AMD Ryzen
  • Linux Kernel
  • Ollama
  • DeepSeek-V2
  • LPDDR5X

활용 사례

  • 로컬 LLM 서버 구축
  • 70B 파라미터 모델 추론
  • 미니 PC 기반 AI 인프라 최적화
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 05.수집 2026. 03. 05.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.