본문으로 건너뛰기

Tokens per Second (TPS)

초당 토큰 수

초당 토큰 수는 모델이 생성하는 토큰의 처리 속도를 나타내는 지표다. 작성자는 vLLM 전환 뒤 qwen3.8 reasoning 처리 속도가 143tok/s까지 올라갔다고 기록했다. 생성 속도가 높아지면서 reasoning 사용이 감당할 만한 수준이 됐다는 평가로 이어졌다.