TL;DR
최신 LLM의 품질 점수 차이가 좁아지면서 특정 모델 하나를 고르는 일보다 작업별 routing, 캐시, Provider 선택, 평가 체계를 갖춘 파이프라인이 성능과 비용을 좌우합니다. 같은 모델 이름도 Provider의 serving과 cache 정책에 따라 결과가 달라지고, 토큰 단가가 낮아도 재시도나 과도한 출력 때문에 성공한 작업당 비용이 커질 수 있습니다. 따라서 실제 production task를 모사한 테스트에서 입력, 토큰, latency, 출력 품질을 측정하고, 컴파일러·linter·테스트 같은 결정론적 검사를 확률적 모델 호출 앞뒤에 배치해야 합니다. 글의 실험에서는 4주 동안 모델 교체만으로 평균 runtime이 50% 줄고 비용이 10배 이상 감소했으므로, hot swapping이 가능한 느슨한 결합 구조와 지속적인 실험이 장기적인 차이를 만듭니다.
섹션별 상세


- Ito의 실험에서는 14개 모델을 하나의 고정 coding task에 6회씩 실행해 공개 benchmark와 실제 production 결과의 차이를 확인했다. — 본문의 “Their benchmarks are not your benchmarks” 절과 14개 모델·6회 실행 설명
- KAT-Coder-Pro V2.5는 초당 113 tokens를 생성했지만 토큰 5,536개를 사용해 10위에 머물렀고, GPT-5.5는 1,777토큰을 사용했다. — 본문의 14개 모델 coding task 결과 문단과 제공된 두 번째 이미지의 속도·완료시간 차트 출처
- DeepSeek V4 Pro는 동일한 작업을 0.0017달러에 끝내 Claude Fable 5보다 약 73배 저렴했다. — 본문의 “Price per token also failed to predict price per task” 절
- DoorDash의 code review agent에서는 가장 싼 모델이 항상 가장 싼 review를 만드는 것은 아니며, 성공한 review당 비용이 중요한 단위였다. — 본문의 DoorDash 인용문과 “The unit that matters is not token price” 문장

- Vercel AI Gateway는 GLM-5.2와 MiniMax M3에서 OpenRouter와 Together AI보다 캐시 적중률이 낮았고, 입력 토큰의 약 97%가 cache read였다. — 본문의 “Can you optimize the provider layer?” 절 후반부
- Ito의 평균 runtime은 4주 동안 50% 줄었고 비용은 10배 이상 감소했다. — 본문의 “Encourage a culture of experimentation” 절 마지막 성과 문장
용어 해설
- 모델 라우팅(Model Routing)
- — 모델 라우팅은 작업의 종류와 품질·비용·지연시간 조건에 따라 서로 다른 모델로 요청을 분배하는 방식입니다. 입력된 작업을 분류한 뒤 적합한 모델에 전달하고, 결과 품질과 사용량을 측정해 경로를 조정합니다. 모델별 강점과 가격 차이를 활용해 전체 시스템의 성공 비용을 낮추는 데 중요합니다.
- 캐시 적중률(Cache Hit Rate)
- — 캐시 적중률은 반복되는 입력이나 prefix를 저장된 결과에서 재사용한 요청의 비율입니다. 적중하면 동일한 입력 토큰을 다시 처리하지 않아 비용과 지연시간이 줄어들지만, Provider마다 캐시 정책과 성능이 달라질 수 있습니다. 이 글에서는 입력 토큰의 약 97%가 캐시 읽기였기 때문에 비용 차이를 만드는 핵심 요소로 나타났습니다.
- 결정론적 피드백(Deterministic Feedback)
- — 결정론적 피드백은 모델의 확률적 판단만 기다리지 않고 컴파일러, linter, type checker, test suite 같은 규칙 기반 도구로 결과를 검증하는 방식입니다. 실패가 발견되면 사람에게 전달하기 전에 자동 수정 단계를 실행할 수 있습니다. 코드 에이전트의 반복 오류를 줄이고 검증 가능한 근거를 남기는 데 중요합니다.
- 핫 스와핑(Hot Swapping)
- — 핫 스와핑은 시스템 전체를 다시 설계하지 않고도 실행 중인 모델이나 Provider를 다른 구성으로 교체하는 구조입니다. 작업별 라우팅 계층과 독립적인 평가·테스트 인터페이스를 두어 후보 모델을 같은 조건에서 비교하고 즉시 전환합니다. 모델 세대가 몇 주 단위로 바뀌는 환경에서 특정 Vendor에 묶이지 않게 하는 핵심 설계 원칙입니다.
- 유효 컨텍스트(Effective Context)
- — 유효 컨텍스트는 모델이 제공받은 컨텍스트 창의 크기만이 아니라 실제 endpoint에서 안정적으로 처리할 수 있는 입력 범위를 뜻합니다. Provider의 serving 방식과 quantization 같은 구현 선택이 같은 모델 이름의 동작을 바꿀 수 있어 별도 측정이 필요합니다. 따라서 모델 단위 leaderboard만으로 실제 작업 성능을 판단하기 어렵게 만드는 요소입니다.
기술
- OpenAI
- Anthropic
- KimiK3
- KAT-Coder-Pro V2.5
- GPT-5.5
- GPT-5.6
- Claude Fable 5
- Claude Sonnet 4.6
- Claude Sonnet 5
- Opus 4.8
- Luna
- Terra
- Sol
- DeepSeek V4 Pro
- GLM-5.2
- MiniMax M3
- Vercel AI Gateway
- OpenRouter
- Together AI
- Llama 3.3 70B
- gpt-oss-120B
활용 사례
- AI code review
- coding agent pipeline
- 저장소별 review rule 적용
- 작업별 모델 라우팅
- Provider별 inference 최적화
- 실제 브라우저와 devcontainer를 이용한 LLM 평가
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
