용어 해설
- duration
- — 오디오의 재생 길이(초 단위). ASR에서 입력 길이는 인코더-디코더 처리 시간에 강하게 기여하므로, 요청당 처리 길이를 예측하는 주요 척도이다.
- 예상 출력 토큰 수(estimated-output-tokens)
- — 디코더가 생성할 것으로 예상되는 출력 토큰 수의 추정치이다. 스케줄링에서 이 값을 기준으로 우선순위를 매겨 대기 시간을 줄이는 데 활용된다.
- Shortest Job First
- — 도착한 요청 중 처리 시간이 가장 짧은 것을 우선 처리하는 스케줄링 정책으로, 평균 대기 시간을 최소화한다. 긴 작업에 대한 기아 현상이 발생할 수 있다.
- Highest Response Ratio Next
- — 대기 시간과 추정된 처리 시간을 함께 고려해 우선순위를 매기는 스케줄링 정책으로, 기아 현상을 완화한다.
- vLLM
- — LLM 추론 엔진으로, OpenAI 계열 엔진과 유사한 API를 제공하는 고성능 서빙 엔진이다.
- Whisper
- — Encoder–Decoder 기반의 음성 인식 모델로, 본 연구에서 ASR 워크로드의 주된 모델로 사용된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.