본문으로 건너뛰기

Augment Prism: 비용 절감과 품질 유지를 위한 지능형 모델 라우팅 시스템

Augment가 사용자 요청의 복잡도를 분석해 최적의 모델로 연결함으로써 품질 저하 없이 비용을 최대 30% 절감하는 모델 라우팅 시스템 Prism을 공개했다.

섹션별 상세

01
코딩 에이전트 작업의 90%는 상대적으로 가벼운 작업임에도 불구하고 사용자가 선택한 최고 사양 모델로 실행되어 비용 낭비가 발생하고 있다. 분석 결과 상위 10%의 어려운 작업이 전체 LLM 라운드의 57%를 차지하며, 나머지 대다수 작업은 프론티어 모델의 높은 비용을 지불할 필요가 없는 수준으로 나타났다. Prism은 이러한 작업 불균형을 해소하기 위해 각 요청에 맞는 모델을 동적으로 할당한다.
Prism의 모델 라우팅 개념을 형상화한 다이어그램
Diagram중심에서 퍼져나가는 동심원 구조를 통해 하나의 입력이 여러 모델 계층으로 라우팅되는 Prism의 핵심 아키텍처 개념을 추상적으로 표현한다.
02
Prism은 모델 전환 시 발생하는 프롬프트 캐시 에빅션 비용을 고려하여 라우팅 결정을 내린다. 모델을 변경하면 기존 캐시를 사용할 수 없어 비용과 지연 시간이 약 10배 증가할 수 있으므로, Prism은 새로운 모델 사용으로 얻는 이득이 캐시 재설정 비용보다 클 때만 전환을 수행한다. 이를 통해 단순한 라우팅보다 훨씬 높은 비용 효율성을 확보했다.
03
내부 멀티 턴 코딩 벤치마크에서 Prism은 타겟으로 삼은 프론티어 모델들과 대등하거나 더 높은 품질 점수를 기록했다. Prism (GPT + Kimi) 조합은 GPT 5.5 대비 품질 점수 +0.30(GPT 5.5는 +0.21)을 기록하면서도 작업당 비용은 5.25달러로 7.31달러인 원본보다 저렴했다. 이는 라우팅 시스템이 품질 저하 없이 경제성을 확보할 수 있음을 입증한다.
내부 코딩 에이전트 벤치마크에서 모델별 품질 점수와 작업당 비용을 비교한 버블 차트
ChartPrism 변체들이 타겟 모델인 GPT 5.5 및 Opus 4.7보다 왼쪽 상단에 위치하여, 더 높은 품질을 제공하면서도 비용은 현저히 낮음을 시각적으로 보여준다. 특히 Prism (GPT + Kimi) 조합이 가장 높은 품질 점수를 기록하고 있음을 확인할 수 있다.
04
라우팅을 위한 플래너 모델의 오버헤드는 전체 비용의 약 0.03% 수준으로 매우 미미하며 지연 시간 또한 최적화되어 있다. 플래너 실행에는 평균 2.6초가 소요되지만, 전체 턴의 96%는 이전 결정을 재사용하는 도구 호출 결과이므로 실제 사용자 체감 지연 시간 증가는 크지 않다. 현재는 이 초기 지연 시간을 더 줄이기 위한 최적화 작업이 진행 중이다.

기술

  • GPT 5.5
  • Opus 4.7
  • Sonnet 4.6
  • Gemini Flash 3.0
  • Kimi K2.6

활용 사례

  • 엔터프라이즈 규모의 AI 코딩 에이전트 배포
  • 대규모 코드베이스 리팩터링 및 테스트 자동화
  • LLM API 비용 최적화 파이프라인

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 03.수집 2026. 05. 03.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.