TL;DR
Snorkel의 GDPVal+ 약 2,000개 샘플을 Harbor 파이프라인으로 자동 평가한 결과 Grok 4.5는 평균 통과율 29%로 GPT 5.5(22%)와 Opus 4.8(21%)를 앞섰다. 각 모델 출력은 LLMaJ와 전문가 루브릭으로 항목별 보상 점수를 산출해 완전 보상(r = 1.0)일 때만 'pass'로 판정되었고 Grok 4.5는 특히 법률·교육·의료·QA 분석 분야에서 큰 우위를 보였다. 실패 모드 분류에서는 Grok 4.5의 '도메인 누락' 비중이 40%로 경쟁 모델보다 낮았으나 전문가 수준 과제의 평균 통과율은 여전히 33%를 밑돌아 추가 개선 여지가 남아 있다.
빠른 이해
새로운 점
전문가 수준의 실제 직장 업무 평가에서 Grok 4.5가 평균 통과율과 오류 비중 모두에서 경쟁 모델들을 앞섰다는 통계적 결과
핵심 메커니즘
평가는 Harbor 파이프라인에서 모델이 각 과제를 한 번 실행하여 최종 산출물을 저장하는 입력 단계, LLMaJ 검증기가 전문가 루브릭에 따라 항목별 보상 점수를 산출하고 완전 보상(r = 1.0)을 기준으로 'pass'를 판정하는 처리 단계, 그리고 모델별 통과율과 오류 분포를 집계해 비교 결과를 도출하는 출력 단계로 구성된다.
핵심 수치
- Grok 4.5 평균 통과율: 29%- 약 2,000개 GDPVal+ 샘플 기준
- GPT 5.5 평균 통과율: 22%- 약 2,000개 GDPVal+ 샘플 기준
- Opus 4.8 평균 통과율: 21%- 약 2,000개 GDPVal+ 샘플 기준
섹션별 상세
연구 개요 및 데이터셋
평가 방법론과 실행 파이프라인
주요 성능 결과
- Grok 4.5는 해당 평가 샘플에서 평균 통과율 29%를 기록해 GPT 5.5(22%)와 Opus 4.8(21%)보다 높았다. — Results: Mean pass rates 단락
- 법률 업무에서 Grok 4.5의 통과율은 40%로 경쟁 모델의 27~28%보다 높게 나타났다. — Results: Mean pass rates 단락 내 도메인별 성능표기
실패 모드 분류와 결론적 해석
- 실패 모드 분석에서 '도메인 누락' 비중이 Grok 4.5는 40%였고 GPT 및 Opus는 51~52%로 보고되었다. — Results: Failure mode analysis 단락
용어 해설
- GDPVal+
- — Snorkel이 전문가가 설계한 직장 내 전문적 추론 과제들을 모아 만든 데이터셋으로, 문서·스프레드시트·프레젠테이션 형태의 실제 산출물을 생성하도록 모델을 평가하도록 설계되었다. 각 과제는 도메인 전문가가 프롬프트와 채점 루브릭을 생성하며, 모델 출력은 전문가 기준의 채점으로 판정된다. 전문 업무별 성능 차이를 측정하는 용도로 활용되어 모델의 실무 적합성을 검증하는 데 중요하다.
- Harbor
- — LLM 및 에이전트의 실제 과제 수행을 자동으로 실행하고 평가하도록 설계된 오픈소스 프레임워크로, 과제 실행(k=1 방식)과 결과 저장, 자동 검증기 트리거링을 처리한다. 검증기는 각 과제의 전문가 루브릭에 따라 보상 점수를 산출하고 통과 기준을 판단하며 재현 가능한 벤치마크 파이프라인을 제공한다. 일관된 평가 파이프라인이 필요할 때 모델 간 비교 실험을 자동화하는 데 핵심 역할을 한다.
- LLMaJ
- — 모델 출력의 채점을 자동화하기 위해 사용되는 LLM 기반 검증기로, Gemini 3.5 Flash 같은 모델을 내부적으로 사용하여 전문가 루브릭에 따라 보상 점수와 판정 결정을 생성한다. 출력 문서를 루브릭 항목별로 평가하고 완전한 보상 점수(r=1.0)를 얻었을 때 'pass'로 판정한다. 자동화된 채점 절차를 통해 대규모 과제 샘플의 통계적 비교가 가능하다.
- Agent harness
- — 모델이 도구 호출, 문서 생성/처리, 웹 검색 등 보조 기능을 사용할 수 있게 연결하는 실행 환경으로, 동일 모델이라도 하니스 설정에 따라 성능이 달라질 수 있다. 본 평가는 GPT 5.5와 Opus 4.8에 Stirrup 하니스를, Grok 4.5에는 Grok Build 하니스를 각각 연결하여 비교를 수행했다. 하니스는 도구 접근성과 작업 흐름 제어를 규정하여 복합 업무 수행 능력에 직접적인 영향을 준다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
