본문으로 건너뛰기

DeepLearning.AI The Batch: Claude Opus 4.5, Amazon Nova 2 출시 및 AI 에이전트 구축 가이드

앤드류 응의 에이전트 구축 팁부터 Claude Opus 4.5, Amazon Nova 2 출시 및 과학용 AI를 위한 미 정부의 Genesis Mission까지 최신 AI 동향을 다룬다.

섹션별 상세

01
앤드류 응은 aisuite 패키지와 MCP(Model Context Protocol)를 활용해 누구나 쉽게 자율적인 에이전트를 구축할 수 있는 방법을 제안했다. aisuite는 여러 LLM 제공자를 쉽게 전환할 수 있게 해주며, MCP 지원을 통해 파일 시스템 접근이나 웹 검색 같은 도구를 에이전트에게 간편하게 부여할 수 있다.
python
import aisuite as ai
from aisuite.mcp import MCPClient

# Step 1: Initialize MCP Client for using filesystem based tools
filesystem = MCPClient(
    command="npx",
    args=["-y", "@modelcontextprotocol/server-filesystem", os.getcwd()]
)

# Step 2: Execute agent using frontier model
client = ai.Client()
response = client.chat.completions.create(
    model="openai:gpt-5.1", # Swap with Gemini, Opus, or others.
    messages=[{"role": "user", "content": prompt}],
    # Pass filesystem tool, or provide your own tool to save files.
    tools=filesystem.get_callable_tools(),
    max_turns=5
)

aisuite와 MCP를 사용하여 파일 시스템 접근 권한을 가진 AI 에이전트를 초기화하고 실행하는 예시 코드

aisuite와 MCP를 사용하여 Snake 게임을 생성하는 Python 코드와 실제 실행 화면을 보여주는 스크린샷이다.
Screenshot앤드류 응이 제안한 간단한 에이전트 구축 레시피를 시각화한 것이다. 왼쪽의 코드는 MCP 파일 시스템 도구를 초기화하고 LLM에 게임 제작을 요청하는 과정을 담고 있으며, 오른쪽은 그 결과로 생성된 현대적인 Snake 게임 인터페이스를 보여준다.
02
Anthropic은 이전 모델보다 토큰 생성 효율이 높고 코딩 성능이 뛰어난 Claude Opus 4.5를 출시했다. 이 모델은 동일한 결과를 내는 데 경쟁 모델 대비 절반 수준의 토큰만 사용하며, 특히 터미널 작업과 복잡한 엔지니어링 시험에서 인간 전문가를 능가하는 성능을 입증했다.
Claude Opus 4.5와 다른 주요 모델들의 코딩 및 추론 성능을 비교한 벤치마크 표이다.
ChartClaude Opus 4.5가 SWE-bench Verified(80.9%) 및 Terminal-bench 2.0(59.3%)에서 Sonnet 4.5나 GPT-5.1 등 경쟁 모델을 앞서는 성능을 보여준다. 특히 에이전트 도구 사용 및 대학 수준 추론(GPQA)에서 최상위권 성적을 기록하고 있음을 확인할 수 있다.
03
미국 백악관은 에너지부 산하 17개 국립 연구소와 민간 기업(OpenAI, Nvidia 등)이 협력하여 과학 연구를 가속화하는 'Genesis Mission'을 발표했다. 이 프로젝트는 연방 데이터셋을 활용해 과학용 파운데이션 모델과 자율 실험 로봇 시스템을 구축하여 에너지, 의학, 반도체 분야의 혁신을 목표로 한다.
04
Amazon은 멀티모달 추론과 브라우저 자동화 기능을 갖춘 Nova 2 모델 제품군(Pro, Lite, Omni, Sonic)을 공개했다. 특히 Nova 2 Pro는 에이전트 벤치마크인 τ²-Bench에서 최상위권 성적을 기록했으며, Nova Forge 서비스를 통해 기업이 자체 데이터를 결합하여 모델을 커스텀 학습시킬 수 있는 환경을 제공한다.
Amazon Nova 2 Pro와 Claude, GPT, Gemini 모델들의 성능을 다양한 지표로 비교한 표이다.
ChartNova 2 Pro가 특히 에이전트 워크플로 지표인 τ²-Bench Telecom(92.7%)에서 매우 높은 성적을 거두었음을 보여준다. MMLU-Pro나 GPQA Diamond 같은 핵심 지능 지표에서는 Gemini 3 Pro Preview 등에 비해 다소 낮지만, 실무적인 도구 사용 능력에서 경쟁력이 있음을 나타낸다.
05
삼성 연구진이 개발한 Tiny Recursive Model(TRM)은 반복적인 솔루션 정제 과정을 통해 Sudoku와 ARC-AGI 퍼즐에서 대형 모델을 능가하는 성능을 보였다. 500만~700만 파라미터의 작은 크기임에도 불구하고, 컨텍스트 임베딩을 재귀적으로 업데이트하는 방식을 통해 논리적 추론이 필요한 복잡한 그리드 문제를 효과적으로 해결했다.

용어 해설

모델 컨텍스트 프로토콜(MCP)
Anthropic이 제안한 개방형 표준으로, AI 모델이 로컬 파일 시스템, 데이터베이스, 웹 검색 등 외부 도구 및 데이터 소스와 안전하고 표준화된 방식으로 연결되도록 돕는 프로토콜이다.
에이전트 워크플로(Agentic Workflow)
AI가 단순히 질문에 답하는 것을 넘어, 스스로 계획을 세우고 필요한 도구를 선택하여 실행하며 여러 단계를 거쳐 복잡한 목표를 달성하는 자율적인 작업 흐름을 의미한다.
소프트웨어 엔지니어링 벤치마크(SWE-bench)
AI 모델의 실제 소프트웨어 개발 능력을 평가하기 위한 지표로, GitHub의 실제 오픈소스 이슈를 해결하는 능력을 측정하여 모델의 코딩 및 문제 해결 역량을 검증한다.
재귀적 정제(Recursive Refinement)
모델이 한 번에 정답을 내는 대신, 자신의 이전 출력을 다시 입력으로 받아 반복적으로 수정하고 개선하여 최종 결과물의 정확도를 높이는 학습 및 추론 방식이다.
다중 벡터 검색(Multi-Vector Retrieval)
이미지나 텍스트를 단일 벡터가 아닌 여러 개의 세부 벡터(패치 단위 등)로 표현하여 검색 정확도를 높이는 기법으로, 복잡한 멀티모달 RAG 시스템 구축에 필수적이다.

기술

  • Claude Opus 4.5
  • Amazon Nova 2
  • aisuite
  • MCP
  • Tiny Recursive Model

활용 사례

  • 자율 코딩 에이전트
  • 과학 연구 자동화
  • 브라우저 자동화 워크플로
  • 복잡한 논리 퍼즐 해결
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2025. 12. 10.수집 2026. 03. 06.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.