본문으로 건너뛰기

CMP 170HX Tensor 성능 제한의 명령어 수준 측정

CMP 170HX의 256-cycle Tensor stall을 해제하자 처리량이 6.3에서 193 TFLOPS로 상승했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

CMP 170HX는 A100과 같은 silicon을 사용하지만 MMA 명령어마다 정확히 256 cycle의 stall이 삽입되어 Tensor 성능이 6.3 TFLOPS로 제한됐습니다. 제한을 해제하면 지연이 24.0 cycles로 줄고 처리량이 193 TFLOPS로 올라가 A100의 full per-SM rate 대비 95%에 도달했습니다. llama.cpp pp512 처리량은 599.6 tok/s에서 3468 tok/s로 5.8배 증가했으며, Qwen3.8-27B-FP8의 vLLM prefill에서는 197W의 CMP 170HX 한 장이 454W를 쓰는 2×3090 구성보다 높은 성능을 냈습니다. 작성자는 전력 제한과 무관하게 약 10초 만에 unlock 여부를 확인할 수 있는 cycle-exact probe도 제공한다고 밝혔습니다.

주요 논점

01찬성소수

CMP 170HX의 Tensor 성능 저하는 물리적 제약이 아니라 MMA 명령어마다 삽입된 정확한 256-cycle stall 때문이며, 이를 해제하면 A100에 가까운 처리량을 회복한다는 주장입니다.

실용적 조언

  • CMP 170HX의 unlock 상태는 cycle-exact probe로 약 10초 안에 확인할 수 있습니다. 이 검사는 전력 제한의 영향을 받지 않으며 live workload와 함께 실행해도 안전하다고 작성자는 밝혔습니다. 따라서 단순히 표시되는 VRAM 용량이나 일반적인 benchmark 결과만 보지 않고 MMA 명령어의 실제 지연을 확인하는 방식이 핵심입니다.

섹션별 상세

01
작성자는 CMP 170HX가 A100과 같은 silicon을 사용하지만 Tensor Core가 크게 제한되고 64GB 중 56GB가 firmware로 잠겨 있다는 점을 구매 후 확인했습니다. 특히 Tensor 성능 저하의 원인을 단순한 전력 제한이나 물리적 한계로 보지 않고 instruction level에서 하루 동안 측정했습니다. 이 접근은 제품 사양이나 체감 사용기보다 GPU 명령어 실행 경로를 직접 검증하려는 시도입니다.
02
MMA 명령어마다 정확히 256 cycle의 stall이 삽입됐고, 3,500회 측정에서 변동이 전혀 없었습니다. 제한을 해제하자 지연은 24.0 cycles로 줄었으며, 이는 RTX 3090에서 측정한 32.9 cycles보다 짧습니다. 작성자는 물리적 한계라면 이런 정수 단위의 고정 지연이 반복되기 어렵다는 점을 근거로 해당 제한이 register 값에 의한 hardcoded throttle이라고 판단했습니다.
03
제한 해제 뒤 Tensor throughput은 6.3 TFLOPS에서 193 TFLOPS로 상승해 full A100의 per-SM rate 대비 95%에 도달했습니다. llama.cpp의 pp512 처리량도 599.6 tok/s에서 3468 tok/s로 5.8배 증가했습니다. Qwen3.8-27B-FP8을 vLLM으로 serving할 때는 CMP 170HX 한 장이 197W로 동작하면서 454W를 소비하는 2×3090 Tensor Parallel 구성 전체보다 prefill에서 앞섰습니다.

용어 해설

Tensor Core
행렬 곱셈과 누산을 전용으로 처리해 신경망 연산을 가속하는 GPU 내부 연산 유닛입니다. 이 글에서는 MMA 명령어의 실행 지연이 Tensor 처리량과 직접 연결되며, CMP 170HX에서는 해당 경로에 인위적인 대기 사이클이 삽입된 것으로 측정됐습니다.
MMA 명령어(MMA Instruction)
행렬 곱셈·누산을 수행하는 GPU 명령어로, Tensor Core의 핵심 연산 경로에 해당합니다. 글의 측정은 MMA 명령어 사이의 지연 사이클을 세어 CMP 170HX의 Tensor 성능 제한이 실제 하드웨어 처리 속도인지 특정 stall인지 구분하는 방식입니다.
TFLOPS
초당 수행 가능한 부동소수점 연산 횟수를 조 단위로 나타낸 성능 지표입니다. 여기서는 Tensor 처리량이 6.3 TFLOPS에서 193 TFLOPS로 변한 결과를 통해 제한 해제 전후의 연산 성능 차이를 수치화했습니다.
Tensor Parallel
하나의 모델 연산을 여러 GPU에 나눠 실행하는 병렬화 방식입니다. 글에서는 2개의 RTX 3090을 묶은 Tensor Parallel 구성과 CMP 170HX 한 장의 prefill 처리량·전력 소비를 비교해 단일 GPU의 효율을 평가했습니다.
Prefill
생성형 언어 모델이 입력 프롬프트 전체를 한 번에 처리해 첫 토큰 생성에 필요한 내부 상태를 만드는 단계입니다. 글의 llama.cpp pp512와 vLLM 비교는 긴 입력을 처리하는 이 단계에서 CMP 170HX의 제한 해제 효과가 크게 나타나는지를 측정한 사례입니다.

언급된 도구

llama.cpp중립

pp512에서 CMP 170HX의 prompt 처리량을 측정하는 데 사용했습니다.

vLLM중립

Qwen3.8-27B-FP8 serving 환경에서 CMP 170HX와 2×3090 Tensor Parallel 구성의 prefill 성능을 비교하는 데 사용했습니다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 22.수집 2026. 08. 22.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.