본문으로 건너뛰기

소형 역할 기반 벤치마크 결과와 Codex 라우팅 제안이 제시된 벤치마크 리포트로서 세부 수치와 시간·토큰 기반 계량이 제공되었다. 이 문서는 전략적 판단 과제, 레포지토리 기반 실행 브리프, 의도 삽입 결함 수리라는 세 가지 작업 유형을 동일한 프롬프트로 비교해 모델별 성능과 비용 지표를 제시했다. 최종적으로 저자는 측정값을 근거로 역할별 모델 배치를 권고하는 라우팅 구성을 도출했다.

동일 프롬프트 기반 소형 역할 벤치마크에서 Sol 계열 모델들이 전략 판단과 구현 경로에서 일관된 우위를 보였고 시간과 추론 토큰 수치로 구체적 차이를 제시했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 전략적 메모, 레포지토리 기반 실행 브리프, 의도 삽입 결함 수리라는 세 가지 역할별 소형 벤치마크를 동일한 프롬프트와 고정 루브릭으로 수행해 모델별 점수와 실행 시간 및 reasoning tokens를 계측했다. 결과는 Fable 5 레퍼런스가 전략 과제에서 최고 점수를 기록했고 Sol 계열이 전반적으로 근접하거나 우수한 시간을 보이며 토큰 효율성에서 실무적 강점을 보였다는 점을 나타냈다. 레포지토리 기반 브리프에서는 medium 프로파일이 시간과 토큰 효율에서 장점이 있었고 의도 삽입 결함 수리에서는 여러 경로가 첫 시도 통과를 달성해 낮은 프로파일이 빠른 구현에 적합함을 보였다. 작성자는 샘플 수의 한계와 비블라인드 평가를 한계로 지적하며 블라인드 홀드아웃과 추가 재현을 권했으며 이를 바탕으로 역할별 Codex 라우팅 구성안을 제시했다.

실용적 조언

  • 전략 판단용 세션에는 추론 품질이 높지만 토큰 사용과 지연이 상대적으로 큰 모델을 제한적으로 배치하고 운영/통합용 세션에는 중간 프로파일을 배치해 비용과 처리량을 최적화하라고 제안한다.
  • 의도 삽입 결함 수리 같은 반복적 구현 작업에는 낮은 입력 소모와 짧은 응답 시간을 보이는 라우팅을 우선적으로 사용해 빠른 실패-복구 사이클을 확보하라고 권한다.
  • 벤치마크 재현을 위해서는 블라인드 홀드아웃과 샘플 크기 확대, 로컬 CLI·API 오버헤드 분리 계측을 포함한 추가 실험을 먼저 수행하라고 권고한다.

섹션별 상세

01
벤치마크의 설계는 전략적 메모 세 건, 레포지토리 기반 실행 브리프 한 건, 의도 삽입 결함 수리 두 건으로 구성되어 있고 동일한 프롬프트와 비교용 고정 피스처를 사용해 모델 간 결과를 계량했다. 각 전략 과제는 판단·근거·위험·경계·실행 가능성·효율성 항목을 포함한 고정 루브릭으로 채점되었으며 평가자가 모델 정체를 알고 채점했다. 실험은 로컬 워크플로우 지표로서 일반 지능 점수가 아닌 실무적 적합성을 측정하는 목적이었다. 이 설계는 동일 조건 비교와 역할별 배치 결정을 위한 기본 데이터로 사용되었다.
02
전략적 과제 결과에서 Fable 5 레퍼런스는 여러 과제에서 최고 점수(예: 95, 95, 92)를 기록했고 Sol 계열은 대부분의 경쟁 모델을 근접하게 따랐으며 표에는 Sol max 94, Sol high 94 근처의 점수가 표기되어 있다. 평가자는 응답 시간과 추론 토큰을 추가 메트릭으로 수집해 Sol high가 평균 81.5초와 369 reasoning tokens를 사용한 반면 Sol max는 216.9초와 5,178 reasoning tokens를 사용해 과잉추론을 보였다고 기록했다. 이러한 시간과 토큰 차이는 동일 결과를 내면서도 처리 비용과 지연에서 실질적 차이를 만든다는 근거가 되었다. 따라서 점수 외에 지연과 토큰 효율이 역할 배치 결정에 핵심적인 영향을 미쳤다.
03
레포지토리 기반 실행 브리프 테스트에서는 Sol high가 로컬 점수 93과 관찰 시간 80.73초, reasoning tokens 1,818을 기록한 반면 Sol medium은 점수 91로 약간 낮지만 70.66초와 779 토큰으로 더 빠르고 적은 토큰을 사용했다. 이 결과는 더 적은 추론 토큰이 반드시 낮은 품질을 의미하지 않음을 보여주며 실무상 통합 작업에는 medium 프로파일이 운영면에서 유리할 수 있음을 시사했다. 작성자는 통합 단계에는 high를, 운영 프로파일에는 medium을 유지하는 혼합 라우팅을 선택했다. 이 결정은 품질과 비용 간의 트레이드오프를 실제 수치로 비교해 도출된 것이다.
04
의도 삽입 결함 수리 실험에서는 여러 경로가 첫 번째 시도에서 테스트를 통과해 코드 수정 능력이 실무적으로 유효함이 확인되었고 Sol low·GPT-5.4 mini low·GPT-5.4 medium 경로는 각각 평균 약 37.2s, 37.8s, 43.7s의 관찰 시간을 보이며 높은 성공률을 기록했다. 반면 Luna 계열과 Terra 계열의 max 프로파일은 더 긴 시간(예: Terra max 102.20s, Luna max 121.34s)과 과도한 추론 단계를 보였고 일부 경우 과잉 추론으로 인한 지연을 초래했다. 작성자는 이러한 성능 격차를 바탕으로 역할별 구체적 라우팅을 제안했고 실무 운영에서 긴급한 구현은 낮은 프로파일을, 심층 검토는 고프로파일을 배치하는 정책을 권했다.

용어 해설

추론 토큰(Reasoning tokens)
추론 토큰은 모델이 내부적으로 생성하거나 소비하는 중간 토큰 수로서 판단 과정의 길이와 비용을 직접적으로 나타낸다. 입력 프롬프트와 모델이 생성하는 중간 서술을 합산해 계측하며 긴 추론은 토큰 사용량과 지연을 증가시킨다. 본 글에서는 동일한 과제에서 각 모델이 사용한 reasoning tokens 수를 비교해 효율성과 과잉추론 여부를 판단하는 근거로 삼았다.
레포지토리 기반 실행(Repository-grounded)
레포지토리 기반 실행은 모델이 코드 저장소나 문서에서 직접 컨텍스트를 읽어 실행 방안을 생성하거나 변경 사항을 제안하는 작업 프로필을 말한다. 입력으로 저장소 스냅샷과 관련 파일을 받아 의존성·통합 흐름을 점검하고 출력으로 실행 브리프나 패치 제안을 낸다. 본 문서에서는 저장소 기반 실행 브리프 성능을 시간과 추론 토큰으로 계측했다.
의도 삽입 결함 수리(Planted bug repair)
의도 삽입 결함 수리는 테스트 재현성을 위해 코드에 고의로 결함을 넣고 에이전트가 이를 자동으로 진단하고 패치하는 성능 시험법이다. 입력으로 결함이 포함된 코드와 테스트 스위트를 제공하면 모델이 수정 패치를 생성하고 직접 테스트를 실행해 성공 여부를 산출한다. 본 벤치마크에서는 복수의 모델이 동일한 결함 세트를 얼마나 빠르고 정확히 복구하는지를 비교했다.
모델 라우팅(Routing)
모델 라우팅은 작업 유형과 성능 요구에 따라 서로 다른 모델을 역할별로 배치해 워크플로우를 최적화하는 운영 전략이다. 입력으로 작업 특성(전략 판단, 구현, 리뷰 등)을 받고 처리 단계별로 적합한 모델을 할당하며 출력으로 일관된 품질과 비용 효율을 목표로 한다. 작성자는 벤치마크 결과를 기반으로 Codex 라우팅을 구성해 운영 프로파일을 제안했다.

언급된 도구

raw API중립

모델 호출과 토큰 소비를 직접 측정하는 데 사용된 인터페이스

CLI중립

로컬 지연과 작업 오버헤드를 포함한 워크플로우 실행을 위해 사용된 실행 표면

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 11.수집 2026. 07. 11.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.