TL;DR
Production AI agent는 분류, 간단한 도구 호출, 진행 확인, 복잡한 추론을 모두 가장 비싼 frontier model로 보내면서 불필요한 비용과 지연을 감수하는 경우가 많습니다. NVIDIA NeMo Switchyard는 agent와 모델 사이에 proxy 겸 library 형태의 라우팅 계층을 두고, 요청 또는 대화 turn마다 실제 처리 모델을 선택합니다. 튜토리얼은 OpenRouter와 openai/gpt-4o 및 openai/gpt-4o-mini를 연결해 무작위 라우팅에서 classifier 기반 deterministic routing, stage_router, escalation_router로 확장하는 과정을 보여줍니다. 예시 로그에서는 쉬운 요청이 weak 모델에서 1,428ms, 복잡한 Redis race-condition 요청이 strong 모델에서 4,475ms에 처리됐으며, 품질과 비용의 균형은 항상 strong·always weak·router 세 구성을 실제 workload에서 비교해야 판단할 수 있습니다.
섹션별 상세
defaults:
base_url: https://openrouter.ai/api/v1
api_key: ${OPENROUTER_API_KEY}
routes:
ab-test:
type: random_routing
strong:
model: openai/gpt-4o
weak:
model: openai/gpt-4o-mini
strong_probability: 0.3
rng_seed: 42
fallback_target_on_evict: weakstrong과 weak 두 모델에 요청을 무작위로 배분하는 기본 Switchyard 라우팅 설정입니다.
switchyard serve \
-c routes.random.yaml \
--host 127.0.0.1 \
--port 4000지정한 YAML 라우팅 설정으로 Switchyard 서버를 로컬 4000번 포트에서 실행합니다.
defaults:
base_url: https://openrouter.ai/api/v1
api_key: ${OPENROUTER_API_KEY}
routes:
smart:
type: deterministic
classifier:
model: openai/gpt-4o-mini
strong:
model: openai/gpt-4o
weak:
model: openai/gpt-4o-mini
profile: general
session_affinity: true
fallback_target_on_evict: weakclassifier가 요청을 평가해 weak 모델 또는 strong 모델로 보내는 결정론적 라우팅 설정입니다.
용어 해설
- 모델 라우팅(Model Routing)
- — 하나의 AI 애플리케이션이 모든 요청을 동일한 모델로 보내지 않고, 요청의 난이도나 작업 단계에 따라 여러 모델 중 적절한 대상을 선택하는 방식입니다. 비용과 지연 시간을 줄이면서 강한 모델의 품질을 최대한 유지하는 것이 핵심입니다.
- 프록시(Proxy)
- — 클라이언트와 실제 모델 서버 사이에 위치해 요청을 전달하고 응답을 중계하는 구성 요소입니다. Switchyard에서는 애플리케이션이 실제 upstream 모델을 직접 알지 않아도 라우팅 계층이 대상 모델을 선택하도록 만드는 역할을 합니다.
- 분류기 기반 라우팅(Classifier Routing)
- — 별도의 classifier가 각 요청을 약한 모델이 처리할 수 있는지 추정한 뒤, 설정된 기준에 따라 저비용 모델이나 강한 모델로 보내는 방식입니다. 요청 난이도를 사전에 판단한다는 점에서 실행 결과를 보고 올리는 escalation routing과 구분됩니다.
- 에스컬레이션 라우팅(Escalation Routing)
- — 먼저 저비용 모델에 요청을 보낸 뒤, 반복 실패나 지속적인 문제 같은 신호가 나타날 때 강한 모델로 작업을 넘기는 방식입니다. 요청을 처음부터 분류하는 대신 실제 처리 과정의 결과를 이용하므로 장시간 이어지는 agent 세션에 적합합니다.
- Prometheus 메트릭(Prometheus Metrics)
- — 서버 요청 수, 오류, 지연 시간, 토큰 사용량, 라우팅 동작 등을 수치로 수집하는 관측 데이터입니다. Switchyard는 /metrics 엔드포인트를 통해 이런 정보를 제공해 라우팅이 품질과 비용을 실제로 개선했는지 비교할 수 있게 합니다.
기술
- NVIDIA NeMo Switchyard
- OpenRouter
- uv
- Rust
- Cargo
- Prometheus
- openai/gpt-4o
- openai/gpt-4o-mini
활용 사례
- Production AI agent의 요청별 모델 선택
- Coding agent의 turn별 모델 배정
- 저비용 모델 우선 처리와 조건부 escalation
- LLM 비용·품질·지연 시간 비교 실험
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

