본문으로 건너뛰기
r/ClaudeCode조회 1

Claude Code 성능 회귀 분석: 시스템 프롬프트인가 모델 자체의 문제인가

Claude Code의 시스템 프롬프트를 제거하고 벤치마크를 수행한 결과, 성능 변화가 미미하여 회귀 원인이 모델이나 서버 측에 있음을 확인했다.

섹션별 상세

작성자는 Claude Code 원본 빌드, 시스템 프롬프트와 도구 설명을 제거한 unbound 버전, 그리고 unbound 버전에 32k thinking을 강제한 세 가지 환경을 구성했다. 모든 테스트는 Opus 4.7 모델과 동일한 설정으로 진행되었다.
TerminalBench 1.0을 통한 벤치마크 결과, 원본 빌드와 unbound 버전 간의 성능 차이는 거의 없었다. 원본 빌드는 54.61%, unbound 버전은 57.24%의 정확도를 기록하여 프롬프트 최적화가 성능에 미치는 영향이 제한적임이 확인됐다.
Claude Code 빌드별 TerminalBench-Core v0.1.1 성능 비교 차트
Chart세 가지 빌드(Stock, Unbound + forced 32k, Unbound)의 정확도를 비교한다. 결과적으로 Unbound 버전이 57.24%로 가장 높으나, Stock 버전(54.61%)과 큰 차이를 보이지 않아 프롬프트 수정이 성능에 결정적이지 않음을 나타낸다.
작성자는 성능 회귀가 프롬프트 제약이 아닌 Opus 4.7 모델 자체의 변화나 서버 측 업데이트에서 기인했을 가능성을 제기했다. 다만, TerminalBench가 이러한 성능 변화를 진단하기에 적절한 도구인지에 대해서는 추가적인 검토가 필요하다는 의견을 덧붙였다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 20.수집 2026. 04. 20.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.