본문으로 건너뛰기

$OneMillion-Bench: 언어 에이전트는 인간 전문가와 얼마나 떨어져 있는가?

기존 벤치마크가 시험 문제 풀이 수준에 머물러 있는 한계를 극복하기 위해, 실제 산업 현장의 고부가가치 업무를 기반으로 에이전트의 성능을 평가한다. 법률, 금융, 의료 등 5대 전문 분야에서 2,000시간 이상의 전문가 투입을 통해 구축되었으며, 에이전트가 창출하는 결과물을 실제 노동 비용으로 환산하여 경제적 숙련도를 정량화한다.

용어 해설

다단계 추론(Multi-step Reasoning)
복잡한 문제를 해결하기 위해 정보를 순차적으로 처리하고 중간 결론을 도출하며 최종 답안에 도달하는 사고 과정이다. 에이전트가 단순 답변을 넘어 실행 계획을 세우고 수정하는 데 필수적이다.
루브릭 기반 평가(Rubric-based Evaluation)
미리 정의된 세부 채점 기준(루브릭)에 따라 결과물의 품질을 다각도로 측정하는 방식이다. 단순 정답 여부보다 논리성, 형식, 전문성 등 정성적 요소를 객관화하는 데 중요하다.
에이전트적 신뢰성(Agentic Reliability)
AI 에이전트가 주어진 과제를 수행할 때 일관된 성능을 유지하고, 제약 조건을 준수하며, 오류 없이 목표를 달성하는 능력을 의미한다. 실무 투입을 위한 핵심 지표다.
네거티브 루브릭(Negative Rubrics)
잘못된 정보 제공이나 규정 위반 등 치명적인 오류에 대해 가중치가 높은 감점을 부여하는 채점 방식이다. 모델의 안전성과 전문적 윤리를 엄격히 관리하기 위해 사용된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 09.수집 2026. 03. 11.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.