Agent Benchmark
에이전트 벤치마크
AI 모델이 단순히 텍스트를 생성하는 것을 넘어, 도구를 사용하거나 복잡한 워크플로우를 자율적으로 수행하는 능력을 측정한다. 구글의 최신 모델들은 이 벤치마크에서 경쟁사 상위 모델들을 제치며 실질적인 작업 수행 능력을 증명하고 있다.
에이전트 벤치마크
AI 모델이 단순히 텍스트를 생성하는 것을 넘어, 도구를 사용하거나 복잡한 워크플로우를 자율적으로 수행하는 능력을 측정한다. 구글의 최신 모델들은 이 벤치마크에서 경쟁사 상위 모델들을 제치며 실질적인 작업 수행 능력을 증명하고 있다.