본문으로 건너뛰기
r/LocalLLaMA조회 1

Radeon 680M에서 양자화 포맷별 속도 역전

Radeon 680M 통합 GPU에서 MXFP4는 입력 처리, Q4_K_XL은 토큰 생성에 앞섰습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

64GB DDR5를 탑재한 Acemagic S3A의 Radeon 680M 통합 GPU에서 약 30B 파라미터 MoE 모델의 세 가지 양자화 형식을 비교했습니다. MXFP4 MoE는 프롬프트 처리에서 258.36 t/s로 가장 빨랐고, Q4_K_XL은 토큰 생성에서 13.13 t/s로 가장 빨랐습니다. 모델이 시스템 RAM으로 오프로딩되는 UMA 환경에서는 메모리 대역폭과 양자화 배치가 단계별 성능을 갈랐습니다. 긴 컨텍스트와 RAG에는 MXFP4 MoE를, 실시간 채팅에는 Q4_K_XL을 선택하는 결과입니다.

실용적 조언

  • 대화형 채팅이나 스트리밍 UI에서는 Q4_K_XL을 우선 선택하는 편이 적합합니다. 일반적인 대화에서는 프롬프트 처리 속도 160.31 t/s와 218.22 t/s의 차이보다 응답 생성 속도 13.13 t/s가 체감 지연에 더 직접적으로 영향을 줍니다. 모델을 같은 환경에서 비교할 때는 파일명뿐 아니라 llama-bench가 읽은 GGUF 내부 모델명과 양자화 형식을 함께 확인해야 합니다.
  • RAG나 긴 문서를 한 번에 주입하는 작업에서는 MXFP4 MoE가 유리합니다. 이 형식은 pp512에서 258.36 t/s를 기록해 Q4_K_XL의 160.31 t/s보다 약 60% 높은 프롬프트 처리량을 냈으며, 긴 컨텍스트를 읽는 대기 시간을 줄이는 데 초점을 맞출 수 있습니다. 다만 Radeon 680M처럼 fp4가 0으로 표시되는 장치에서는 MXFP4가 네이티브 FP4 연산이 아니라 런타임 변환이나 에뮬레이션을 거칠 수 있으므로 토큰 생성 속도까지 함께 측정해야 합니다.

섹션별 상세

Acemagic S3A의 AMD Ryzen 7 6800H와 Radeon 680M 통합 GPU에서 64GB DDR5 메모리로 약 16~17GiB 크기의 모델을 실행했습니다. 모델이 일반적인 iGPU 전용 VRAM을 넘기 때문에 가중치와 연산 데이터가 시스템 RAM으로 오프로딩됐고, 성능은 약 50~65GB/s인 DDR5 메모리 대역폭과 PCIe 및 Northbridge 링크 지연의 영향을 받았습니다. Radeon 680M의 실행 정보에 fp16은 1로 표시됐지만 bf16과 fp4는 0이어서 네이티브 FP4 연산을 사용할 수 없는 조건이었습니다.
파일명에는 GLM-4.7이 들어 있지만 llama-bench는 파일명 대신 GGUF 내부 헤더를 읽어 세 모델을 deepseek2 30B.A3B로 표시했습니다. 따라서 측정 대상은 약 30B 파라미터의 MoE 구조로 해석되며, MXFP4 MoE 파일은 15.79 GiB, Q4_K_XL 파일은 16.31 GiB, Q4_K_M 파일은 17.05 GiB였습니다. 모델 이름과 내부 메타데이터가 다를 수 있다는 점 때문에 파일명만으로 벤치마크 대상을 판단하면 안 된다는 사실이 드러났습니다.
세 양자화 형식은 3회 실행의 산술 평균으로 비교했으며, MXFP4 MoE는 프롬프트 처리에서 258.36 t/s로 가장 빨랐지만 토큰 생성은 11.66 t/s로 가장 느렸습니다. Q4_K_M은 pp512 218.22 t/s와 tg128 12.09 t/s를 기록했고, Q4_K_XL은 프롬프트 처리 160.31 t/s 대신 토큰 생성 13.13 t/s로 1위를 차지했습니다. 토큰 생성 표준편차가 ±0.02~0.06 t/s에 그쳐 열과 전력 공급, 백그라운드 작업의 영향이 작았던 안정적인 측정으로 평가됐습니다.
MXFP4 MoE는 MoE 구조와 낮은 비트 폭으로 Attention 계산 중 활성 연산과 메모리 읽기를 줄이고 Flash Attention으로 캐시 지역성을 개선해 긴 입력에서 유리한 결과를 냈습니다. 반면 토큰을 한 개씩 생성하는 단계는 메모리 대역폭의 영향을 더 크게 받았고, Q4_K_XL의 메모리 배치가 RADV 드라이버의 프리페치에 더 잘 맞아 Q4_K_M보다 약 13%, MXFP4보다 약 12% 빠른 스트리밍 속도를 보였습니다. 이 차이는 프롬프트를 한꺼번에 넣는 작업과 응답을 실시간으로 생성하는 작업에서 최적 양자화 형식이 달라진다는 의미입니다.

용어 해설

통합 메모리 구조(UMA)
UMA는 CPU와 GPU가 별도의 VRAM 대신 시스템 메모리를 함께 사용하는 구조입니다. 이 환경에서는 모델 가중치와 GPU 연산 데이터가 DDR5 메모리 대역폭을 공유하므로, 대형 양자화 모델의 추론 속도가 메모리 전송량과 지연 시간에 크게 좌우됩니다.
혼합 전문가 구조(Mixture of Experts)
Mixture of Experts는 전체 파라미터를 매번 모두 계산하지 않고 입력마다 일부 Expert만 활성화하는 모델 구조입니다. 이 글의 약 30B 파라미터 모델은 실제 연산량과 메모리 읽기를 줄여 통합 GPU에서도 프롬프트 처리 속도를 높이는 요인으로 다뤄집니다.
Flash Attention
Flash Attention은 Attention 계산 과정에서 메모리 접근과 중간 결과 저장을 줄이도록 연산을 재구성하는 기법입니다. 이 테스트에서는 긴 프롬프트를 처리할 때 캐시 지역성을 개선해 MXFP4 MoE의 pp512 성능을 뒷받침하는 요소로 사용됐습니다.
MXFP4 양자화(MXFP4)
MXFP4는 모델 가중치를 4비트 계열 표현으로 압축하는 양자화 형식입니다. 테스트 장비의 Radeon 680M은 네이티브 FP4를 지원하지 않아 MXFP4 연산을 런타임 변환이나 에뮬레이션 방식으로 처리하며, 프롬프트 처리와 토큰 생성에서 서로 다른 속도 특성을 보였습니다.
Q4_K 양자화(Q4_K)
Q4_K는 GGUF 모델에서 사용되는 4비트 양자화 계열입니다. Q4_K_M과 Q4_K_XL은 같은 계열로 표시되지만 파일 크기와 메모리 배치가 다르며, 이 테스트에서는 Q4_K_XL이 토큰 생성에서 가장 높은 13.13 t/s를 기록했습니다.

언급된 도구

llama.cpp중립

Ubuntu Vulkan prebuilt binary를 사용해 GGUF 모델을 실행하고 llama-bench로 프롬프트 처리 및 토큰 생성 속도를 측정했습니다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 19.수집 2026. 08. 19.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.