TL;DR
xAI가 공개한 Grok 4.5는 frontier 수준의 지능을 합리적인 비용과 고속 추론 성능으로 제공하며, 특히 코딩 및 공학 작업에서 뛰어난 효율을 보인다. DeepSWE, Terminal Bench, Harvey's Legal Agent Benchmark 등 주요 벤치마크에서 기존 모델들과 대등하거나 우수한 성능을 기록했으나, 일부 커뮤니티에서는 학습 데이터에 Cursor 코드베이스가 포함되었다는 '오염' 의혹이 제기되기도 했다. 향후 Grok은 Imagine을 활용한 에이전트 모드와 1M 컨텍스트 윈도우 업데이트를 통해 게임 개발 및 복잡한 작업 지원을 강화할 예정이다.
챕터별 상세
Grok 4.5 소개
import { weather } from "@lib/weather";
import { SkyPlate } from "./SkyPlate";
import { HourlyStrip } from "./HourlyStrip";
import { TenDayForecast } from "./TenDayForecast";
import { DetailWidgets } from "./DetailWidgets";
import { TickTemp } from "./TickTemp";
export function WeatherApp() {
return (
<main className="relative min-h-dvh w-full">
<SkyPlate />Grok 4.5가 생성한 날씨 앱 컴포넌트의 초기 구조 예시이다.
DeepSWE 1.0 벤치마크
DeepSWE 1.1 벤치마크
Terminal Bench 2.1 분석
가격 및 토큰 효율성
SWE Bench 결과
벤치마크 신뢰성 논란
Cursor 벤치마크
Harvey Legal Agent 벤치마크
데이터 오염 논란
데모 비교: 쉐이더 생성
데모 비교: 로켓 발사
향후 업데이트 계획
용어 해설
- DeepSWE
- — 소프트웨어 엔지니어링 작업 수행 능력을 평가하는 벤치마크이다. 실제 코드베이스를 기반으로 AI 에이전트의 문제 해결 및 코드 작성 능력을 측정한다.
- Terminal Bench
- — AI 에이전트가 터미널 환경에서 실제 셸 명령어를 사용하여 작업을 완료하는 능력을 평가하는 벤치마크이다. 정적 코드 분석보다 실무적인 엔지니어링 역량을 측정한다.
- Context Window
- — 모델이 한 번에 처리할 수 있는 입력 텍스트의 최대 길이를 의미한다. 이 값이 클수록 더 긴 문서나 복잡한 코드베이스를 한 번에 이해하고 작업할 수 있다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

