TL;DR
64GB DDR5를 탑재한 Acemagic S3A의 Radeon 680M 통합 GPU에서 약 30B 파라미터 MoE 모델의 세 가지 양자화 형식을 비교했습니다. MXFP4 MoE는 프롬프트 처리에서 258.36 t/s로 가장 빨랐고, Q4_K_XL은 토큰 생성에서 13.13 t/s로 가장 빨랐습니다. 모델이 시스템 RAM으로 오프로딩되는 UMA 환경에서는 메모리 대역폭과 양자화 배치가 단계별 성능을 갈랐습니다. 긴 컨텍스트와 RAG에는 MXFP4 MoE를, 실시간 채팅에는 Q4_K_XL을 선택하는 결과입니다.
실용적 조언
- 대화형 채팅이나 스트리밍 UI에서는 Q4_K_XL을 우선 선택하는 편이 적합합니다. 일반적인 대화에서는 프롬프트 처리 속도 160.31 t/s와 218.22 t/s의 차이보다 응답 생성 속도 13.13 t/s가 체감 지연에 더 직접적으로 영향을 줍니다. 모델을 같은 환경에서 비교할 때는 파일명뿐 아니라 llama-bench가 읽은 GGUF 내부 모델명과 양자화 형식을 함께 확인해야 합니다.
- RAG나 긴 문서를 한 번에 주입하는 작업에서는 MXFP4 MoE가 유리합니다. 이 형식은 pp512에서 258.36 t/s를 기록해 Q4_K_XL의 160.31 t/s보다 약 60% 높은 프롬프트 처리량을 냈으며, 긴 컨텍스트를 읽는 대기 시간을 줄이는 데 초점을 맞출 수 있습니다. 다만 Radeon 680M처럼 fp4가 0으로 표시되는 장치에서는 MXFP4가 네이티브 FP4 연산이 아니라 런타임 변환이나 에뮬레이션을 거칠 수 있으므로 토큰 생성 속도까지 함께 측정해야 합니다.
섹션별 상세
용어 해설
- 통합 메모리 구조(UMA)
- — UMA는 CPU와 GPU가 별도의 VRAM 대신 시스템 메모리를 함께 사용하는 구조입니다. 이 환경에서는 모델 가중치와 GPU 연산 데이터가 DDR5 메모리 대역폭을 공유하므로, 대형 양자화 모델의 추론 속도가 메모리 전송량과 지연 시간에 크게 좌우됩니다.
- 혼합 전문가 구조(Mixture of Experts)
- — Mixture of Experts는 전체 파라미터를 매번 모두 계산하지 않고 입력마다 일부 Expert만 활성화하는 모델 구조입니다. 이 글의 약 30B 파라미터 모델은 실제 연산량과 메모리 읽기를 줄여 통합 GPU에서도 프롬프트 처리 속도를 높이는 요인으로 다뤄집니다.
- Flash Attention
- — Flash Attention은 Attention 계산 과정에서 메모리 접근과 중간 결과 저장을 줄이도록 연산을 재구성하는 기법입니다. 이 테스트에서는 긴 프롬프트를 처리할 때 캐시 지역성을 개선해 MXFP4 MoE의 pp512 성능을 뒷받침하는 요소로 사용됐습니다.
- MXFP4 양자화(MXFP4)
- — MXFP4는 모델 가중치를 4비트 계열 표현으로 압축하는 양자화 형식입니다. 테스트 장비의 Radeon 680M은 네이티브 FP4를 지원하지 않아 MXFP4 연산을 런타임 변환이나 에뮬레이션 방식으로 처리하며, 프롬프트 처리와 토큰 생성에서 서로 다른 속도 특성을 보였습니다.
- Q4_K 양자화(Q4_K)
- — Q4_K는 GGUF 모델에서 사용되는 4비트 양자화 계열입니다. Q4_K_M과 Q4_K_XL은 같은 계열로 표시되지만 파일 크기와 메모리 배치가 다르며, 이 테스트에서는 Q4_K_XL이 토큰 생성에서 가장 높은 13.13 t/s를 기록했습니다.
언급된 도구
Ubuntu Vulkan prebuilt binary를 사용해 GGUF 모델을 실행하고 llama-bench로 프롬프트 처리 및 토큰 생성 속도를 측정했습니다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.