본문으로 건너뛰기

dspark

DSpark

글에서 vLLM이 지원하는 speculative decoding 관련 구성 요소로 언급됩니다. 작성자의 테스트에서는 speculation을 쓰지 않는 설정과 비교해 coding token decode 속도가 거의 2~3배 빨라졌지만, 해당 속도와 Prefix-Caching 버그의 관계는 별도로 확인되지 않았습니다.