본문으로 건너뛰기

Agent Benchmark

에이전트 벤치마크

AI 모델이 단순히 텍스트를 생성하는 것을 넘어, 도구를 사용하거나 복잡한 워크플로우를 자율적으로 수행하는 능력을 측정한다. 구글의 최신 모델들은 이 벤치마크에서 경쟁사 상위 모델들을 제치며 실질적인 작업 수행 능력을 증명하고 있다.