본문으로 건너뛰기

구글, 역대 최고 성능의 Gemini 3 공개 및 벤치마크 기록 경신

구글이 코딩 앱 연동과 압도적인 벤치마크 성적을 보유한 차세대 모델 Gemini 3를 출시하며 AI 시장의 주도권을 강화했다.

섹션별 상세

01
구글은 Gemini 3를 출시하며 Gemini 앱과 AI Search 기능에 즉시 적용했다. 이 모델은 이전 세대보다 향상된 추론 능력과 멀티모달 이해력을 갖추고 있으며, 특히 코딩 작업에 최적화된 전용 앱과의 연동을 통해 개발자 생산성을 극대화한다.
02
함께 공개된 벤치마크 결과에 따르면, Gemini 3 Pro는 Humanity's Last Exam, AIME 2025, MathArena Apex 등 고난도 학술 및 수학 평가에서 Claude Sonnet 4.5와 GPT-5.1을 능가하는 성과를 보였다. 특히 AIME 2025 수학 벤치마크에서는 코드 실행 기능을 포함할 경우 100%의 정확도를 달성했다.
Gemini 3 Pro와 경쟁 모델들(Claude Sonnet 4.5, GPT-5.1 등)의 다양한 벤치마크 성능 비교표.
ChartGemini 3 Pro가 수학(AIME 2025), 과학 지식(GPQA), 에이전트 작업(Vending-Bench 2) 등 거의 모든 지표에서 경쟁 모델들을 압도하고 있음을 보여준다. 특히 수학 분야에서 코드 실행 시 100%를 기록한 점과 에이전트 작업에서의 큰 점수 차이가 핵심이다.
03
에이전트 기능과 롱 컨텍스트 처리 능력에서도 괄목할 만한 성장을 보였다. Vending-Bench 2와 같은 장기 에이전트 작업에서 타 모델 대비 압도적인 순자산 가치(Net worth)를 기록했으며, 100만 토큰 이상의 긴 문맥에서도 높은 성능을 유지하는 것으로 나타났다.
04
Gemini 3 출시 소식에 힘입어 알파벳의 주가는 급등했으며, 기업 가치 4조 달러 달성을 목전에 두고 있다. 시장 분석가들은 구글의 AI 기술력이 경쟁사들과의 격차를 벌리며 실질적인 비즈니스 가치로 전환되고 있다고 평가한다.

용어 해설

미국 수학 초청 시험 2025(AIME 2025)
고등학생 수준의 고난도 수학 문제 해결 능력을 평가하는 벤치마크로, AI 모델의 논리적 추론과 계산 정확도를 측정하는 핵심 지표이다. Gemini 3 Pro는 이 테스트에서 코드 실행 기능을 결합했을 때 100%의 정확도를 달성했다.
에이전트 기반 코딩(Agentic Coding)
AI가 단순히 코드를 생성하는 것을 넘어, 스스로 코드를 실행하고 오류를 수정하며 전체 소프트웨어 개발 프로세스를 자율적으로 수행하는 방식이다. 이는 단순한 텍스트 완성을 넘어선 고도의 문제 해결 능력을 요구한다.
긴 문맥 처리(Long Context)
수십만에서 수백만 토큰에 달하는 방대한 양의 정보를 한 번에 입력받아 이해하고 처리할 수 있는 모델의 능력이다. Gemini 3는 100만 토큰 이상의 데이터에서도 높은 정보 검색 및 추론 성능을 유지한다.
멀티모달 추론(Multimodal Reasoning)
텍스트뿐만 아니라 이미지, 영상, 오디오 등 다양한 형태의 데이터를 동시에 분석하고 그 사이의 관계를 파악하여 결론을 도출하는 지능이다. MMMU-Pro와 같은 벤치마크를 통해 이 성능을 측정한다.

기술

  • Gemini 3
  • Gemini 3 Deepthink
  • Gemini App
  • AI Search

활용 사례

  • 자율 코딩 에이전트
  • 고난도 수학 및 과학 문제 해결
  • 대규모 문서 분석
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2025. 11. 26.수집 2026. 02. 21.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.