본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
큰 모델을 더 빠르게 만드는 작은 모델, Speculative Decoding
LLM 추론 가속을 위한 Speculative Decoding과 Attention Drift 해결 (EAGLE 3.1)
vLLM 배포 설정을 최적화하는 계산기 도구
분리형 파이프라인에서 투기적 디코딩을 통한 AI 추론 가속화 방법
HydraLM: 100만 토큰 문맥에서 100% 검색 정확도를 달성한 긴 문맥 추론 모델
SPEED-Bench: 투기적 디코딩(Speculative Decoding)을 위한 통합 및 다양성 벤치마크 도입
P-EAGLE: vLLM에서 병렬 투기적 디코딩을 통한 LLM 추론 가속화
Together AI가 제안하는 LLM 추론 비용 절감 및 성능 최적화 전략
Arctic Inference: LLM 서빙의 속도와 비용 트레이드오프 해결
Speculative Decoding 구현 및 교육용 저장소 공개
분산 llama.cpp RPC 풀을 활용한 추측성 디코딩 구현
TAPS: 추측 샘플링을 위한 작업 인지형 제안 분포 연구
임베딩 공간 프로빙을 통한 효율적인 학습 불필요 멀티 토큰 예측
MIT 연구진, 유휴 컴퓨팅 자원을 활용해 추론 모델 학습 속도 2배 향상
병렬 토큰 예측을 통한 효율적인 문서 파싱
True Positive Weekly #142: 2025년 AI 연구 성과와 코딩 에이전트의 진화
AutoJudge: 태스크 특화 손실 추측 디코딩을 통한 LLM 추론 가속화
Together AI, 주요 오픈소스 모델에 대해 업계 최고 수준의 추론 속도 달성
TiDAR: 디퓨전으로 생각하고 자기회귀로 말하는 새로운 AI 아키텍처
고성능 추론을 위한 머신러닝 기법: 투기적 디코딩과 MoE 프루닝
← 피드로 돌아가기
Speculative Decoding
Architecture (AI 아키텍처)
약 36개 아티클
관련 태그:
vLLM
NVIDIA
Together AI
Blackwell
Qwen
Cerebras
EAGLE
DeepSeek-R1
Qwen2.5
B200