TL;DR
Google과 SemiAnalysis가 공개한 TPUv7 Ironwood의 첫 외부 추론 결과에서 Qwen3.5 397B FP8 기준 Ironwood는 100 tokens/s/user에서 B200보다 약 19%, B300보다 약 34% 낮은 토큰 비용을 기록했고, 20 tokens/s/user에서는 칩당 처리량도 두 GPU보다 높았습니다. 이 비용 우위는 낮은 칩 시간당 비용과 TPU의 ICI 네트워크, SparseCore, MXU에 맞춘 DP Attention·MoE·GDN·Paged Attention 최적화가 함께 만든 결과입니다. 소프트웨어 측면에서는 JAX와 TorchAX를 거치는 기존 경로 대신 PyTorch의 PrivateUse1 디바이스와 StableHLO·XLA 컴파일 경로를 사용하는 TorchTPU가 vLLM과 SGLang의 외부 지원 기반으로 자리 잡고 있습니다. 다만 TPUv7은 FP4를 지원하지 않고 외부 Disaggregated Serving도 아직 완전히 최적화되지 않아 일부 지연 구간에서는 B200이나 GB300 NVL72가 앞서며, Speculative Decoding·Prefill-Decode 분리·KV cache Offloading·추가 모델 지원이 상용 경쟁력의 다음 조건으로 남아 있습니다.
섹션별 상세











용어 해설
- 달러당 성능(Performance per Dollar)
- — 하드웨어의 절대 처리량이 아니라 같은 비용으로 얼마나 많은 토큰을 처리하는지 나타내는 지표입니다. 시간당 비용과 토큰 처리량을 함께 계산하므로, TPU처럼 최고 처리량이 GPU보다 낮아도 시간당 임대료나 총소유비용이 낮으면 우위를 확보할 수 있습니다. 실제 서비스의 인프라 투자 효율을 비교할 때 사용됩니다.
- 총소유비용(Total Cost of Ownership)
- — 칩 가격만이 아니라 서버 구성, 전력, 냉각, 네트워크, 운영 기간을 포함해 가속기를 사용하는 전체 비용을 추정하는 방식입니다. 이 글에서는 외부 구매자가 부담하는 TPU TCO와 Google 내부 작업에 적용한 칩 시간당 비용을 나누어 GPU와 비교합니다. 비용 곡선의 위치가 TCO 가정에 따라 크게 달라지는 이유를 설명하는 기준입니다.
- StableHLO
- — PyTorch나 JAX에서 생성된 연산 그래프를 컴파일러가 처리할 수 있도록 표현하는 중간 표현입니다. TorchTPU에서는 PyTorch 연산이 StableHLO로 낮아진 뒤 XLA를 거쳐 TPU 실행 파일로 변환됩니다. 따라서 사용자 인터페이스는 PyTorch에 가깝게 유지하면서 TPU용 컴파일 경로를 활용할 수 있습니다.
- Mixture-of-Experts
- — 모델의 모든 Expert를 매 토큰마다 실행하지 않고 Router가 일부 Expert를 선택해 계산량을 줄이는 구조입니다. 선택된 토큰이 Expert별로 불규칙하게 모이기 때문에 라우팅, 재배열, Grouped Matrix Multiplication, 결과 결합이 주요 병목이 됩니다. 이 글은 SparseCore와 TensorCore의 역할을 나누어 MoE 처리를 최적화합니다.
- Speculative Decoding
- — 작은 Draft 모델이 여러 토큰을 먼저 추측하고 큰 모델이 한 번의 Forward Pass에서 추측 결과를 검증하는 추론 기법입니다. Decode가 가중치를 HBM에서 읽는 메모리 대역폭에 묶일 때, 유휴 상태인 행렬 연산 자원을 여러 토큰 검증에 사용해 한 번의 가중치 읽기 비용을 분산합니다. 검증에서 살아남은 토큰은 원래 모델이 생성했을 결과와 같으므로 품질 저하 없이 처리량을 높이는 것이 목표입니다.
- Prefill-Decode Disaggregation
- — 입력 문맥을 처리하는 Prefill과 새 토큰을 순차 생성하는 Decode를 서로 다른 TPU 풀에서 실행하는 구조입니다. 두 단계의 계산 특성과 부하에 맞춰 각각 독립적으로 확장하고 조정할 수 있으며, KV cache를 풀 사이에서 전달해야 합니다. Google은 TPU-Sync와 llm-d 지원을 통해 이 내부 운영 방식을 외부 TPU 스택으로 옮기고 있습니다.
기술
- TPUv7 Ironwood
- B200
- B300
- GB300 NVL72
- Qwen3.5 397B
- vLLM
- SGLang
- TorchAX
- TorchTPU
- PyTorch
- JAX
- Pallas
- StableHLO
- XLA
- TorchDynamo
- AOTAutograd
- FX graph
- SparseCore
- TensorCore
- MXU
- HBM
- FP8
- FP4
- TPU-Sync
- llm-d
- Mooncake Store
- WEKA
- VAST
활용 사례
- Qwen3.5 397B 기반 단일 토큰 LLM 추론
- 고동시성 MoE 모델 Serving
- 긴 문맥과 높은 Prefix Reuse를 갖는 다중 턴 Agentic Workload
- Prefill과 Decode를 분리한 대규모 추론 서비스
- KV cache를 DRAM·NVMe Pool로 확장하는 장문 대화 서비스
- vLLM과 SGLang에서 PyTorch Native TPU Serving
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.