본문으로 건너뛰기
The AI Grid조회 3

Grok 4.5 성능 분석: 코딩 벤치마크와 비용 효율성

xAI가 출시한 Grok 4.5의 벤치마크 성능과 비용 효율성을 분석하고, 커뮤니티에서 제기된 데이터 오염 논란 및 향후 업데이트 계획을 다룬다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

xAI가 공개한 Grok 4.5는 frontier 수준의 지능을 합리적인 비용과 고속 추론 성능으로 제공하며, 특히 코딩 및 공학 작업에서 뛰어난 효율을 보인다. DeepSWE, Terminal Bench, Harvey's Legal Agent Benchmark 등 주요 벤치마크에서 기존 모델들과 대등하거나 우수한 성능을 기록했으나, 일부 커뮤니티에서는 학습 데이터에 Cursor 코드베이스가 포함되었다는 '오염' 의혹이 제기되기도 했다. 향후 Grok은 Imagine을 활용한 에이전트 모드와 1M 컨텍스트 윈도우 업데이트를 통해 게임 개발 및 복잡한 작업 지원을 강화할 예정이다.

챕터별 상세

00:00

Grok 4.5 소개

Grok 4.5는 frontier 수준의 지능을 합리적인 비용으로 제공하는 모델이다. 실세계 소프트웨어 및 공학 작업에서 고속 추론 성능을 구현했다.
tsx
import { weather } from "@lib/weather";
import { SkyPlate } from "./SkyPlate";
import { HourlyStrip } from "./HourlyStrip";
import { TenDayForecast } from "./TenDayForecast";
import { DetailWidgets } from "./DetailWidgets";
import { TickTemp } from "./TickTemp";

export function WeatherApp() {
  return (
    <main className="relative min-h-dvh w-full">
      <SkyPlate />

Grok 4.5가 생성한 날씨 앱 컴포넌트의 초기 구조 예시이다.

00:28

DeepSWE 1.0 벤치마크

DeepSWE 1.0 벤치마크에서 Grok 4.5는 62%의 점수를 기록했다. 이는 Opus 4.8 Max의 55.8%보다 높은 수치이다.
01:03

DeepSWE 1.1 벤치마크

DeepSWE 1.1 버전에서도 Grok 4.5는 코딩 작업에서 우수한 성능을 보였다. 벤치마크 결과는 모델의 코딩 능력을 입증하는 지표로 활용된다.
01:17

Terminal Bench 2.1 분석

Terminal Bench 2.1은 AI 에이전트의 터미널 작업 능력을 평가한다. Grok 4.5는 83.3%의 점수를 기록하며 Opus 4.8 Max를 상회했다.
02:03

가격 및 토큰 효율성

Grok 4.5는 타 모델 대비 저렴한 비용으로 frontier 수준의 지능을 제공한다. 토큰 효율성이 높아 사용 시 비용 절감 효과가 크다.
02:43

SWE Bench 결과

SWE Bench Pro에서 Grok 4.5는 64.7%의 해결률을 기록했다. OpenAI는 SWE Bench Pro의 신뢰성 문제로 30%의 오류를 발견하고 재평가를 권고했다.
03:03

벤치마크 신뢰성 논란

OpenAI는 SWE Bench Pro의 신뢰성 문제를 지적했다. 벤치마크 결과가 항상 모델의 실제 frontier 능력을 정확히 반영하지는 않는다.
04:40

Cursor 벤치마크

Cursor 벤치마크는 실제 코드베이스를 기반으로 모델의 코딩 능력을 평가한다. Grok 4.5는 이 벤치마크에서 상위권의 성능을 보였다.
10:48

Harvey Legal Agent 벤치마크

Harvey Legal Agent 벤치마크는 법률 문서 작업 능력을 평가한다. Grok 4.5는 12.92%의 해결률로 1위를 기록했다.
12:09

데이터 오염 논란

일부 사용자는 Grok 4.5의 벤치마크 점수가 데이터 오염으로 인한 결과라고 주장한다. Cursor 코드베이스가 학습 데이터에 포함되었다는 의혹이 제기되었다.
15:39

데모 비교: 쉐이더 생성

Fable 5와 Grok 4.5, Opus 4.8을 사용하여 쉐이더 생성 작업을 수행했다. 모델마다 결과물의 차이가 존재하며, 이는 개인의 선호도에 따라 다르게 평가된다.
16:55

데모 비교: 로켓 발사

로켓 발사 시뮬레이션 작업에서 Grok 4.5, Opus 4.8, GLM 5.2, Sonnet 5를 비교했다. 각 모델은 서로 다른 코딩 능력과 작업 수행 방식을 보였다.
17:45

향후 업데이트 계획

xAI는 Grok에 Imagine을 활용한 에이전트 모드와 1M 컨텍스트 윈도우 업데이트를 예고했다. 이는 게임 개발 및 복잡한 작업 지원을 강화할 예정이다.

용어 해설

DeepSWE
소프트웨어 엔지니어링 작업 수행 능력을 평가하는 벤치마크이다. 실제 코드베이스를 기반으로 AI 에이전트의 문제 해결 및 코드 작성 능력을 측정한다.
터미널 벤치마크(Terminal Bench)
AI 에이전트가 터미널 환경에서 실제 셸 명령어를 사용하여 작업을 완료하는 능력을 평가하는 벤치마크이다. 정적 코드 분석보다 실무적인 엔지니어링 역량을 측정한다.
컨텍스트 윈도우(Context Window)
모델이 한 번에 처리할 수 있는 입력 텍스트의 최대 길이를 의미한다. 이 값이 클수록 더 긴 문서나 복잡한 코드베이스를 한 번에 이해하고 작업할 수 있다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 09.수집 2026. 07. 09.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.