TL;DR
Shopify는 운영 실패를 자동 비평자와 중재자, 재생 재입력으로 연결하는 플라이휠 루프를 도입해 실제 트래픽에서 얻은 '어려운 사례'를 매일 학습 신호로 압축합니다. 판정자(judge)를 루브릭과 백테스트로 보정한 뒤, 자가 치유 파이프라인과 감독 증류(SFT)·GRPO를 번갈아 적용해 소형 모델이 프론티어 기반 초기 시스템보다 품질에서 앞서도록 만듭니다. 추가로 Gist 토큰으로 정적 시스템 프롬프트를 축소해 지연과 비용을 크게 낮춰 GraphQL agent 사례에서는 처리량 유지하면서 연간 비용을 약 96% 줄였다는 운영적 근거를 제시합니다.
빠른 이해
새로운 점
운영 실패를 자동 비평·중재·재생 루프로 변환해 매일 전체 파라미터를 재학습하는 일련의 자동화·증류 파이프라인을 상용 트래픽에 적용한 점이 실무적 차별점입니다.
핵심 메커니즘
운영에서 낮은 점수를 받은 대화를 자동 비평자들이 수리 지침으로 변환하고 재생 결과가 판정자 기준을 통과하면 해당 궤적을 SFT로 증류한 뒤 GRPO로 보상 최적화를 수행해 모델 파라미터를 갱신하는 루프입니다.
핵심 수치
- 운영 처리량: 최대 2,000 requests/min- GraphQL agent의 상용 처리량으로 본문에 명시됨
- 운영비 감소: 약 96% 절감- 프론티어 모델 추정치 ≈ $27M/year → 파인튜닝 모델 ≈ $1M/year
- 프롬프트 토큰 압축: 약 6,000 → 약 1,500 토큰- Gist 압축 적용 전후 토큰 수 비교
- time-to-first-token 감소: 약 19% 감소- Gist 토큰 적용 시 부하 테스트(350 rpm) 결과
- end-to-end 지연 감소: 약 38% 감소- Gist 토큰 적용 시 부하 테스트(350 rpm) 결과
- 처리량/하드웨어 이득: 약 16% 처리량 증가, 약 14% GPU 절감- 동일 GPU에서의 초당 요청·토큰 처리량 변화로 산출된 근사치
섹션별 상세
품질 정의와 루브릭


판정자 보정과 검증

프론티어 기반 초기 제품과 자동 연구

자가 치유 파이프라인으로 실패를 학습 신호로 변환
# Optimize the teacher
## Data
Pull production conversations and synthetic rollouts.
## Environment
prompts/ system and tool prompts
tools/ tool definitions
harness/ agent control flow
## Evaluation
Run the calibrated judge. Keep a change only if the score improves.
## Optimizer
GEPA or Agentic Context Engineering, written as markdown.
## Loop
Propose an edit → evaluate → keep or discard → repeat.프로젝트의 autoresearch 설정 파일 예시로, 데이터 소스와 편집 가능 디렉터리, 평가용 판정자, 최적화 알고리즘(GEPA 등) 및 제안→평가→유지/폐기 루프를 하나의 마크다운에 지정해 자동 실험을 수행하도록 구성하는 형식입니다. 이 구성은 사람-검증-자동 반복 사이의 경계를 명확히 해 작은 편집만으로도 안전하게 성능 변화를 검증하게끔 만듭니다.

파라미터 공간 최적화: SFT와 GRPO
Gist 토큰으로 프롬프트 비용 절감
- Gist 토큰으로 시스템 프롬프트를 약 6,000토큰에서 약 1,500토큰으로 압축해 time-to-first-token은 약 19% 감소, end-to-end 지연은 약 38% 감소했다. — 본문의 Gist 압축 실험 수치와 해당 수치가 요약된 문단, 이미지(프라이빗 실험 결과) 참조.
GraphQL agent 사례: 운영 증거


- 자가 치유 파이프라인과 지속 학습으로 파인튜닝된 모델이 프론티어 기반 초기 제품 성능을 능가한다. — 본문 설명과 GraphQL agent 사례, 이미지 7(GraphQL distillation)에서 데이터셋 크기별 judge 점수 상승이 근거로 제시됨.
- 프론티어 모델로 서비스했을 경우 연간 운영비가 약 2,700만 달러로 추정되었고, 파인튜닝 모델로는 약 100만 달러로 줄어 비용이 96% 감소했다. — 본문의 비용 추정 수치 문장 및 GraphQL agent 비용 비교 서술.
- GraphQL agent는 최대 2,000 requests per minute를 처리한다. — 본문의 GraphQL agent 운영 현황 문장.
용어 해설
- 플라이휠(지속 학습 루프)(Flywheel)
- — 생산 환경에서 발생한 실패 사례를 판정(judge)으로 점수화하고, 판정 점수를 보상 신호로 삼아 수집→수정→재생(replay)→파인튜닝을 주기적으로 수행해 모델 파라미터로 압축하는 지속 학습 루프입니다. 루프는 자동화된 비평자 패널, 중재자(arbitrer), 재생 재입력과 인간 보정 단계를 포함해 매일 새로운 학습 궤적을 추가합니다. 핵심 목적은 반복되는 운영 지식을 프롬프트·코드가 아닌 모델의 연속적 파라미터 공간에 반영해 소형 모델이 프론티어 모델 성능을 능가하도록 만드는 것입니다.
- 판정자(주석자) 보정(Judge calibration)
- — 제품 요구를 점수화한 루브릭을 바탕으로 자동 판정자(judge)의 프롬프트를 튜닝하고, 백테스트·감퇴 테스트로 오프라인 메트릭이 실제 트래픽을 반영하는지 확인하는 과정입니다. 보정은 소수의 전문가 간 일관성(예: Cohen's kappa)으로 시작해 판정자가 사람과 비슷한 상한선까지 동작하도록 만듭니다. 판정자는 이후 강화학습 보상 신호와 재생 스코어링의 기준이 됩니다.
- Gist 토큰 압축(Gist compression)
- — 긴 정적 시스템 프롬프트를 고정된 길이의 학습된 임베딩 토큰 집합으로 대체해 시퀀스 길이를 크게 줄이는 기법입니다. 교사 모델(긴 프롬프트) 출력을 유지하도록 gist 토큰 임베딩을 학습시키고 모델 파라미터는 동결해 품질 저하 없이 프롬프트 길이를 축소합니다. 결과적으로 추론시 어텐션 비용과 지연을 줄여 처리량을 늘리고 운영비를 절감합니다.
기술
- GraphQL
- GEPA
- Agentic Context Engineering
- GRPO
- Gist tokens
- Toloka
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

