TL;DR
BridgeBench 재실행은 July 1 버전과 이후 nerfed 버전의 세 가지 작업별 성능을 동일한 절차로 비교했고, Debugging 점수가 86.2에서 25.9로 60.3점 감소했으며 Refactoring은 73.6에서 38.4로 35.2점, Hallucination은 75.9에서 61.7로 14.2점 감소했다. 측정 방식은 각 작업별 입력을 두 버전에 동일하게 투입해 0-100 점수로 정량화하는 벤치마크 절차였고 그래프는 막대와 수치로 변화를 직접 제시하였다. 결과는 nerf 조치가 작업 유형에 따라 성능 저하 폭이 다르게 나타났음을 시사하며 특히 디버깅 능력에서 큰 손실이 관찰되었다.
섹션별 상세
이미지 분석

차트는 Debugging, Refactoring, Hallucination 세 작업에 대해 July 1 버전(오렌지)과 이후 nerfed 버전(연회색)의 점수를 나란히 표시했다. 각 막대 상단의 수치와 아래의 Change 라벨이 점수 차이를 명확히 제시하며 Debugging에서 60.3점, Refactoring에서 35.2점, Hallucination에서 14.2점의 감소가 기록되었다. 이 시각 자료는 버전 변경 후 작업별 성능 차이를 정량적으로 확인하는 근거로 사용될 수 있다.
BridgeBench 재실행 결과를 막대그래프로 표시해 각 작업별 Before/After 점수와 변화량을 나타낸 차트이다.

두 번째 이미지는 동일한 데이터를 다른 파일 URL로 제공하며 차트 구성과 수치가 일치해 시각적 중복 증거를 제공한다. 이 중복 이미지는 원문에 포함된 성능 수치의 신뢰성을 보강하는 역할을 하며 원본 차트의 수치 표기를 그대로 재현하고 있다. 따라서 이미지 자체가 게시물의 핵심 근거로서 활용될 수 있다.
첫 번째 이미지의 동일한 그래픽 파일로서 Before와 After 점수 비교를 다시 제공하는 차트이다.
용어 해설
- BridgeBench
- — BridgeBench는 모델의 여러 작업별 성능을 동일한 데이터·절차로 비교하기 위해 사용되는 벤치마크로서, 입력 문제를 각 모델에 투입해 0-100 점수로 정량화한 후 버전 간 차이를 계산하여 성능 변화를 평가하는 데 사용된다.
- Nerf
- — nerf는 모델의 특정 동작이나 출력을 억제하기 위해 파라미터·정책·데이터 필터링 등을 적용해 의도적으로 성능을 낮추는 조치로, 안전·정책 준수 또는 오답 억제 목적에서 특정 능력의 축소로 이어질 수 있다.
- Hallucination
- — Hallucination은 모델이 근거가 없는 사실 또는 잘못된 정보를 생성하는 현상으로, 출력의 신뢰성 저하로 이어지기 때문에 평가에서는 사실성·정확성 지표로 정량화하거나 감소시키는 방향으로 조정이 시도된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.