용어 해설
- LLM 라우팅(LLM Routing)
- — 질의마다 여러 LLM 후보 중 적절한 모델을 선택하는 방법입니다. 라우터는 질의·사용자·대화 이력을 인코딩하고 후보 모델별 점수를 계산한 뒤, 응답 품질과 추론 비용을 함께 고려해 dispatch 대상을 결정합니다. 모델별 능력과 가격 차이를 활용해 고정 모델보다 효율적인 배치를 목표로 합니다.
- 순차적 의사결정 과정(Sequential Decision Process)
- — 라우팅을 현재 상태를 관찰하고 모델 호출 또는 종료 행동을 반복하는 과정으로 표현하는 형식입니다. 상태에는 질의, 선택적 사용자 정보, 지금까지의 응답 이력이 포함되며, 각 호출은 다음 상태를 만듭니다. 최종 목표는 응답 품질을 높이면서 전체 호출 비용을 낮추는 정책을 학습하는 것입니다.
- 컨텍스트 인코더(Context Encoder)
- — 라우팅 상태를 모델 선택에 사용할 표현으로 변환하는 구성 요소입니다. 질의만 벡터로 바꾸거나 사용자 정보와 대화 이력까지 결합할 수 있으며, 자연어 상태를 그대로 prompt에 넣는 방식도 포함됩니다. 어떤 상태 부분을 읽는지가 single-turn, multi-turn, personalized 라우팅을 구분합니다.
- 모델 인코더(Model Encoder)
- — 후보 LLM 각각을 라우터가 비교할 수 있는 표현으로 변환하는 구성 요소입니다. 모델 크기·가격 같은 정적 메타데이터, 과거 성능 프로필, 학습된 embedding, prompt에 삽입하는 모델 이름과 설명을 사용할 수 있습니다. 컨텍스트 표현과의 호환도를 계산하면 후보별 routing score가 만들어집니다.
- 성능·비용 상충 관계(Performance–Cost Trade-off)
- — LLM 라우팅에서 응답 품질과 추론 비용을 하나의 선택 기준으로 함께 다루는 관계입니다. 품질 성능은 accuracy, F1, LLM judge 점수 등으로 측정하고 비용은 호출별 token 수와 가격으로 계산합니다. 비용 가중치가 커지면 값비싼 대형 모델보다 저렴한 후보를 선택하는 정책이 유리해집니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



