TL;DR
Nvidia의 연구에서 Claude Opus 5는 모델만 사용했을 때 ARC-AGI-3에서 30%를 기록했지만, 메모리 관리와 감독 에이전트를 포함한 Custom Harness를 적용하자 100%에 도달했습니다. 장기 작업에서는 모델의 추론 능력뿐 아니라 문맥·메모리·피드백을 관리하고 막다른 경로에서 개입하는 Harness가 성능과 비용을 크게 바꿉니다. Nvidia는 Agentic Variation Operators 같은 연구용 구조와 Nemo 구성 요소를 통해 Open Harness의 통제권을 강조하며, 같은 모델도 Harness에 따라 비용이 2배까지 달라질 수 있다고 전합니다.
섹션별 상세
용어 해설
- Harness
- — AI 모델을 에이전트로 작동시키는 실행 구조로, 메모리와 문맥 관리, 피드백 처리, 도구·라이브러리 연결을 맡습니다. 모델의 응답 능력뿐 아니라 장기 작업의 방향 유지와 비용에도 영향을 줍니다.
- 장기 작업(Long-horizon Tasks)
- — 단일 프롬프트에 답하는 대신 여러 결정을 긴 시간 동안 순서대로 연결해 결과물을 완성하는 작업입니다. 문서 편집처럼 중간 상태와 이전 선택을 계속 기억해야 하므로 에이전트의 메모리와 감독 구조가 중요합니다.
- 감독 에이전트(Supervising Agent)
- — 주 에이전트의 작업 흐름을 지켜보다가 방향을 잃거나 막다른 경로를 택할 때 올바른 탐색을 유도하는 보조 에이전트입니다. Nvidia 연구에서는 최고경영자처럼 개입해 장기 추론의 오류를 줄이는 역할을 맡았습니다.
- 에이전트 시스템(Agentic System)
- — 모델 하나만으로 구성되지 않고 Harness, 실행 환경, 도구, 기술 라이브러리와 모델을 함께 묶은 시스템입니다. 실제 성능은 모델 선택과 더불어 문맥 처리, 메모리, 피드백, 감독 계층을 어떻게 구성하는지에 따라 달라집니다.
기술
- Claude Opus 5
- ARC-AGI-3
- Agentic Variation Operators
- Nemo
- Claude Code
- Codex
- Hermes
활용 사례
- 문서 편집
- 지시 없이 2D 게임의 규칙을 파악하는 Interactive Reasoning
- 여러 결정을 연결하는 장기 작업
- AI 에이전트의 비용 및 보안 제어
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.