본문으로 건너뛰기
HF Daily Papers조회 1

GORGO: 크로스-리전 네트워크 인식형 LLM 서빙을 위한 온라인 튜닝

GORGO는 네트워크 지연·큐 대기·프리필 비용을 가중합으로 정량화하고 온라인 진화 전략으로 가중치를 튜닝하여 p95 TTFT를 6.9–15.5% 및 p95 E2E 지연을 14.3–30.9% 개선했다.

용어 해설

KV 캐시(KV-Cache)
입력 시퀀스의 key-value 상태를 저장해 이전에 계산한 토큰 생성 중간 결과(prefill)를 재사용하는 메커니즘이다. 캐시에 존재하는 접두사는 재연산 없이 바로 재사용되어 프리필 비용이 줄어들며, 멀티턴 챗 시나리오에서 TTFT를 크게 낮출 수 있다. 본 논문에서는 캐시 지역성(cache locality)과 복제본 간 라우팅 결정의 핵심 요소로 취급된다.
첫 토큰 응답 시간(Time-to-First-Token (TTFT))
클라이언트 요청이 시작된 시점부터 모델이 첫 번째 토큰을 반환할 때까지 걸리는 전체 지연을 의미한다. 네트워크 왕복 시간, 프리필 처리 시간, 그리고 앞선 요청들로 인한 큐잉 지연의 합으로 구성되어 라우팅 정책의 최적화 대상이 된다. p95나 p99 같은 상위 퍼센타일 지표로 서비스 품질을 평가하는 핵심 지표로 사용되었다.
프리픽스 캐시(Prefix Cache)
요청의 접두사(앞부분) 토큰을 단일 복제본의 캐시에 저장해 동일 또는 유사한 접두사를 가진 이후 요청에서 프리필을 건너뛰게 하는 전략이다. 접두사 재사용률이 높을수록 프리필로 인한 비용이 크게 줄어 TTFT 개선 효과가 커진다. 논문에서는 복제본 선택 시 프리픽스 캐시 중복(overlap)을 비용 항으로 포함해 라우팅 결정을 내렸다.
연속 배칭(Continuous Batching)
엔진가 새 요청을 현재 실행 중인 배치에 이어서 즉시 수용할 수 있게 하는 처리 패러다임으로, 배치 크기가 허용하는 한 프리필·토큰 재사용을 촉진한다. 동일 복제본으로 모든 요청을 집중시키면 낮은 TTFT를 달성할 수 있지만 메모리 포화와 HOL(queue) 지연으로 E2E/ITL tail가 악화될 위험이 존재한다. GORGO의 튜너는 이 동작을 학습 공간에서 실수로 찾을 수 있음을 관찰했다.
1+1 진화 전략(1+1 Evolutionary Strategy)
하나의 부모 해설과 하나의 자식 해설을 비교해 더 나은 쪽을 선택하는 단순한 진화 기반 하이퍼파라미터 튜닝 기법이다. 로그 공간에서 곱셈식 변이를 적용하고 성공 확률 규칙(Rechenberg의 1/5 규칙)을 따라 보폭(σ)을 조정해 빠르게 수렴한다. 논문에서는 w_rtt와 w_queue 두 차원에서 오버헤드 없이 온라인으로 가중치를 조정하기 위해 사용되었다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 30.수집 2026. 07. 08.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.