TL;DR
Featherbench은 단일 Python 파일로 28개 실사용 태스크를 고정해 한 번에 한 변수만 바꾸는 방식으로 LLM을 비교하는 하니스이며, Ed-o-meter는 그 결과를 공개하는 리더보드다. 평가 기준은 체커로 검증 가능한 바닥과 인간 루브릭이 채점하는 천장으로 나뉘며 모든 모델이 블라인드로 상호 심사해 심판 편향 행렬을 공개한다. 실행은 OpenRouter를 통해 통합 호출하고 각 통과율에 윌슨 신뢰구간을 붙이며, 결과 공개와 MIT 라이선스로 재현성을 우선시한다.
섹션별 상세
- Featherbench는 모델이 작업을 정책상 거부할 때 이를 실패로 계상한다. 이 판단은 사용자 관점에서 거부된 결과와 실패한 결과가 동일한 실무적 불완전성을 초래한다고 보기 때문이다. 원시 JSONL 데이터는 공개되어 있어 다른 계정 방식으로 재산출이 가능하다. — 본문의 FAQ 항목 'How should a benchmark count model refusals?'와 'Featherbench counts benign refusals as failures' 문장을 찾으십시오.
- 모든 선택된 모델이 블라인드로 각 응답을 채점하며 심판 편향 행렬을 공개해 심판별 평균 점수를 노출한다. 이 방식은 편향을 제거하지 못하면 측정 가능한 형태로 드러내려는 설계적 선택이다. 공개된 행렬로 누가 어느 쪽으로 관대하거나 엄격했는지를 후속 분석에 활용할 수 있다. — 본문 중 'every selected model judges every response, blind'와 'harness publishes a judge-bias matrix' 구문을 확인하십시오.
- 모델 호출은 OpenRouter를 경유해 단일 API 키와 청구 관계로 여러 제공처 모델을 평가하도록 구성되었다. 이 설계는 공급자별 SDK가 재시도나 연결 풀링으로 비교를 오염시키는 위험을 줄이고 새 모델 추가를 설정 파일 변경 한 줄로 끝내기 위해 선택되었다. 또한 OpenRouter의 allow_fallbacks:false 설정으로 업스트림 대체 경로를 고정했다는 기술적 설명이 본문에 포함되어 있다. — 본문의 'The models are called through OpenRouter' 단락과 FAQ의 관련 문장을 찾아보십시오.
용어 해설
- 심판 편향 행렬(judge-bias matrix)
- — 각 심판(모델)이 각 응시자(테스트 대상 모델)에 대해 평균적으로 매긴 점수를 표로 나타낸 것이다. 이 행렬은 심판 간 편향을 수치로 노출해 어느 정도 점수 차이가 심판 성향에 기인하는지를 밝히는 용도로 사용된다.
- 윌슨 신뢰구간(Wilson interval)
- — 이진 성공률의 불확실성을 표현하기 위한 통계적 구간이다. 단일 통과 비율에 대해 표준 오차 대신 윌슨 방정식을 사용해 더 안정적인 신뢰구간을 그린다.
- 체커와 규준(루브릭)(checker vs rubric)
- — 체커는 객관적 최소요건(금지어, 필수 문구 등)을 기계적으로 검증하고, 루브릭은 톤·페이싱·절충 같은 정성적 요소를 채점하기 위해 설계된 평가 규칙의 집합이다. 두 계층은 각각 바닥(floor)과 천장(ceiling)을 판단한다.
- 거부를 실패로 계상(refusal as failure)
- — 모델이 정책 등에 따라 작업을 거부했을 때 이를 사용자 관점에서 기능 실패로 처리하는 규칙이다. 작성자는 거부와 잘못된 응답이 실무에서 동일한 불완전성을 초래한다고 보고 거부를 실패로 집계한다.
- 태스크 분류(실사용·코딩·보안·데이터·도구)(task categories)
- — 28개 태스크를 실사용, 코딩, 보안, 데이터, 도구 사용의 다섯 범주로 나누어 커버리지를 넓히는 전략이다. 범주별 가중치는 균형보다 적용범위를 중시해 실제 요구를 더 잘 포착하려는 목적이다.
기술
- Python
- jinja2
- OpenRouter
- GitHub
활용 사례
- 프로덕션에서 비용·지연·품질의 균형을 맞추기 위해 최소 '충분한' 모델 선택
- 모델 거부 행동과 jailbreak 회귀 탐지
- 벤치마크에 노출된 모델 최적화(Goodhart 위험) 회피
- 새 모델이 실제 워크플로우에 미치는 영향을 독립적으로 평가
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.