TL;DR
대형 모델 추론에서 시간당 GPU 가격과 실제 토큰당 비용이 서로 다르게 움직이는 비교 결과입니다. Modal의 8× B300은 vLLM, tensor parallel 8, native MXFP4로 실행돼 약 27분의 cold boot 뒤 0.92~1.02초 TTFT와 약 92 tok/s의 decode 속도를 기록했으며, 출력 토큰 100만 개당 비용은 190달러였습니다. 1-bit UD-IQ1_S를 8× A100-80GB와 llama.cpp에서 실행한 구성은 시간당 비용이 2.8배 낮았지만 TTFT 7~60초, decode 약 9 tok/s로 토큰당 비용이 약 620달러까지 올랐습니다. 다만 1-bit 출력에서도 올바른 산술과 일관된 문장이 유지돼, 성능·지연시간·품질 요구에 따라 양자화 구성의 활용 여지가 남았습니다.
실용적 조언
- 추론 비용을 비교할 때 시간당 GPU 가격만 보지 말고 TTFT, decode tok/s, 출력 토큰당 비용을 함께 측정해야 합니다.
- 긴 출력이나 연속 요청이 많은 환경에서는 B300의 높은 처리량이 토큰당 비용을 낮출 수 있으므로 warm 운영 비용과 함께 계산해야 합니다.
- 간헐적 요청이나 품질 허용 범위가 넓은 환경에서는 1-bit UD-IQ1_S를 A100에서 실행하는 구성을 검토할 수 있지만, 7~60초 TTFT와 약 9 tok/s decode 속도를 감안해야 합니다.
섹션별 상세
이미지 분석

표는 B300·vLLM 조합이 native MXFP4 가중치 1,561GB를 사용하고 약 92 tok/s의 decode 속도와 190달러의 100만 토큰당 비용을 기록한 반면, A100·llama.cpp 조합은 1-bit UD-IQ1_S 594GB를 사용하고 약 9 tok/s와 약 620달러를 기록했음을 정리합니다. A100 구성은 시간당 가격이 19.99달러로 더 낮지만 TTFT가 7.3~60.4초까지 늘어나며, B300 구성은 시간당 56.79달러와 약 27분의 cold boot를 감수하고 더 낮은 지연시간과 높은 처리량을 얻습니다.
8× B300과 8× A100-80GB 환경에서 모델 크기, 메모리 적재 여부, 시간당 가격, 부팅 시간, TTFT, decode 속도, 토큰당 비용과 출력 품질을 비교한 표입니다.

두 번째 이미지는 첫 번째 이미지와 동일한 비교표로, GPU 시간당 비용과 실제 토큰 생성 비용이 반대 방향으로 움직이는 사례를 담고 있습니다. A100 구성은 2.8배 저렴한 시간당 가격에도 약 10배 느린 decode 속도 때문에 100만 토큰당 비용이 약 3.3배 높아졌고, 1-bit 출력은 올바른 산술과 일관된 문장을 유지했습니다.
8× B300·vLLM과 8× A100-80GB·llama.cpp의 추론 비용과 성능 차이를 수치로 비교한 표입니다.
용어 해설
- Tensor Parallelism
- — 하나의 대형 모델을 여러 GPU에 분할해 각 GPU가 일부 연산을 맡는 병렬 추론 방식입니다. 이 글에서는 8개 GPU에 모델을 나눠 적재하고 vLLM의 tensor parallel 8 설정으로 실행 시간을 줄이는 데 사용됐습니다.
- 첫 토큰 지연시간(Time to First Token)
- — 요청을 받은 뒤 첫 번째 출력 토큰이 생성될 때까지 걸리는 시간입니다. 모델 로딩과 프롬프트 처리 속도를 함께 반영하므로 대화형 서비스의 초기 응답성을 판단하는 지표로 쓰이며, 글에서는 TTFT로 측정됐습니다.
- 디코드 속도(Decode Speed)
- — 프롬프트 처리가 끝난 뒤 모델이 출력 토큰을 연속 생성하는 속도입니다. 초당 생성 토큰 수로 측정하며, 글에서는 GPU 구성과 양자화 방식에 따라 약 92 tok/s와 약 9 tok/s로 크게 갈렸습니다.
언급된 도구
8× B300에서 tensor parallel 8과 native MXFP4 설정으로 대형 모델을 추론하는 데 사용됐습니다.
8× A100-80GB에서 594GB 크기의 1-bit UD-IQ1_S Dynamic GGUF를 실행하는 데 사용됐습니다.
8× B300 GPU 인스턴스를 시간당 과금 방식으로 실행하는 호스팅 환경으로 사용됐습니다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.