TL;DR
CMP 170HX는 A100과 같은 silicon을 사용하지만 MMA 명령어마다 정확히 256 cycle의 stall이 삽입되어 Tensor 성능이 6.3 TFLOPS로 제한됐습니다. 제한을 해제하면 지연이 24.0 cycles로 줄고 처리량이 193 TFLOPS로 올라가 A100의 full per-SM rate 대비 95%에 도달했습니다. llama.cpp pp512 처리량은 599.6 tok/s에서 3468 tok/s로 5.8배 증가했으며, Qwen3.8-27B-FP8의 vLLM prefill에서는 197W의 CMP 170HX 한 장이 454W를 쓰는 2×3090 구성보다 높은 성능을 냈습니다. 작성자는 전력 제한과 무관하게 약 10초 만에 unlock 여부를 확인할 수 있는 cycle-exact probe도 제공한다고 밝혔습니다.
주요 논점
CMP 170HX의 Tensor 성능 저하는 물리적 제약이 아니라 MMA 명령어마다 삽입된 정확한 256-cycle stall 때문이며, 이를 해제하면 A100에 가까운 처리량을 회복한다는 주장입니다.
실용적 조언
- CMP 170HX의 unlock 상태는 cycle-exact probe로 약 10초 안에 확인할 수 있습니다. 이 검사는 전력 제한의 영향을 받지 않으며 live workload와 함께 실행해도 안전하다고 작성자는 밝혔습니다. 따라서 단순히 표시되는 VRAM 용량이나 일반적인 benchmark 결과만 보지 않고 MMA 명령어의 실제 지연을 확인하는 방식이 핵심입니다.
섹션별 상세
용어 해설
- Tensor Core
- — 행렬 곱셈과 누산을 전용으로 처리해 신경망 연산을 가속하는 GPU 내부 연산 유닛입니다. 이 글에서는 MMA 명령어의 실행 지연이 Tensor 처리량과 직접 연결되며, CMP 170HX에서는 해당 경로에 인위적인 대기 사이클이 삽입된 것으로 측정됐습니다.
- MMA 명령어(MMA Instruction)
- — 행렬 곱셈·누산을 수행하는 GPU 명령어로, Tensor Core의 핵심 연산 경로에 해당합니다. 글의 측정은 MMA 명령어 사이의 지연 사이클을 세어 CMP 170HX의 Tensor 성능 제한이 실제 하드웨어 처리 속도인지 특정 stall인지 구분하는 방식입니다.
- TFLOPS
- — 초당 수행 가능한 부동소수점 연산 횟수를 조 단위로 나타낸 성능 지표입니다. 여기서는 Tensor 처리량이 6.3 TFLOPS에서 193 TFLOPS로 변한 결과를 통해 제한 해제 전후의 연산 성능 차이를 수치화했습니다.
- Tensor Parallel
- — 하나의 모델 연산을 여러 GPU에 나눠 실행하는 병렬화 방식입니다. 글에서는 2개의 RTX 3090을 묶은 Tensor Parallel 구성과 CMP 170HX 한 장의 prefill 처리량·전력 소비를 비교해 단일 GPU의 효율을 평가했습니다.
- Prefill
- — 생성형 언어 모델이 입력 프롬프트 전체를 한 번에 처리해 첫 토큰 생성에 필요한 내부 상태를 만드는 단계입니다. 글의 llama.cpp pp512와 vLLM 비교는 긴 입력을 처리하는 이 단계에서 CMP 170HX의 제한 해제 효과가 크게 나타나는지를 측정한 사례입니다.
언급된 도구
pp512에서 CMP 170HX의 prompt 처리량을 측정하는 데 사용했습니다.
Qwen3.8-27B-FP8 serving 환경에서 CMP 170HX와 2×3090 Tensor Parallel 구성의 prefill 성능을 비교하는 데 사용했습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.