KiCad 25개 작업으로 드러난 에이전트 한계와 16% 완전 성공률
KiCad 기반 25개 전기설계 작업 벤치마크에서 에이전트의 전체 성공률은 16%로, 기존 회로 편집은 수행 가능하지만 새 회로 빌드는 거의 전면 실패했다.
The Snorkel에서 수집한 AI/ML 콘텐츠를 모아볼 수 있는 전용 피드입니다.
KiCad 기반 25개 전기설계 작업 벤치마크에서 에이전트의 전체 성공률은 16%로, 기존 회로 편집은 수행 가능하지만 새 회로 빌드는 거의 전면 실패했다.
Snorkel 팀의 Vincent Sunn Chen은 AI 에이전트 능력은 빠르게 성장하지만 현실적이고 엄격한 벤치마크가 부족해 평가 격차가 심화되고 있다고 진단했다.
JudgmentBench는 변호사 50여 명이 남긴 3,000건 이상의 루브릭 점수와 쌍별 선호 판단을 비교해 선호 기반 비교가 품질 순서 복원에서 루브릭을 압도함을 실증했다.
에이전틱 에이전트의 역량이 벤치마크와 데이터 설계 속도를 앞지르므로 더 긴 작업, 복잡한 환경, 정교한 채점기를 포함한 평가 인프라가 필요하다.
Continual Learning Bench는 상태유지 실행과 비상태 실행의 성능 차이를 '게인'으로 계산해 모델이 실제로 경험에서 학습했는지를 정량화하는 표준화된 벤치마크이다.
Continual Learning Bench는 동일 작업 시퀀스에서 메모리 유무(stateful vs stateless)를 비교해 이전 인스턴스 경험이 이후 성능을 개선하는지를 reward와 gain으로 분리 측정하는 벤치마크이다.
Agents’ Last Exam은 55개 전문 분야의 1,500개 실제 작업을 환경 전체를 포함한 GCUA 세팅으로 자동 채점해 최상위 모델도 가장 어려운 티어에서 평균 완전 통과율이 1% 미만임을 보여주었다.
Grok 4.5는 Snorkel의 GDPVal+ 약 2,000개 전문 과제 샘플에서 평균 통과율 29%를 기록해 GPT 5.5(22%)와 Opus 4.8(21%)보다 우수한 성능을 보였다.
Senior SWE-Bench는 실제 풀리퀘스트 기반 100개 장기 과제로 코딩 에이전트를 평가하며 최고 모델의 tasteful solve율은 29.1%로 나타났다.