TL;DR
NVIDIA의 AVO는 Persistent Memory, Supervisor, Tools를 결합해 모델이 장시간 작업을 이어가는 general-purpose agent architecture입니다. GPU-kernel 최적화에서 7일 동안 500개가 넘는 방향과 40개 커널 버전을 탐색해 NVIDIA DGX B200에서 cuDNN 대비 최대 3.5%, FlashAttention-4 대비 최대 10.5% 높은 성능을 냈습니다. 같은 구조를 ARC-AGI-3에 연결한 결과 Claude Opus 5 기반 AVO는 공개 세트 25개 환경의 183개 레벨을 모두 완료해 100.00 RHAE와 6,624회 행동을 기록했습니다. VISTA의 7,542회와 비교해 약 12% 적은 행동이지만 시스템 구성이 달라 직접적인 AVO 기여도 측정은 아니며, 핵심 결론은 모델 단독 성능보다 메모리·도구·피드백·복구를 포함한 전체 에이전트 구조가 장기 자율 작업을 좌우한다는 점입니다.
빠른 이해
새로운 점
GPU-kernel 최적화에 사용한 동일한 AVO 구조를 ARC-AGI-3의 직접 상호작용 환경으로 옮겨 100.00 RHAE와 6,624회 행동을 기록했다는 점입니다.
핵심 메커니즘
AVO는 후보와 외부 관찰을 입력으로 받아 Context Inspection, Planning, Implementation, Evaluation을 반복하고, Persistent Memory에 구현·측정·추론을 저장합니다. Supervisor는 탐색 궤적의 정체나 반복 실패를 감지하면 조건부 개입으로 대체 전략을 유도하며, 평가에 실패한 후보는 Diagnose and Repair 경로를 거쳐 다시 루프에 들어갑니다. GPU 커널에서는 코드·컴파일러·프로파일러·하드웨어 성능 결과가 피드백이고, ARC-AGI-3에서는 64 x 64 텍스트 그리드 관찰과 환경 행동 결과가 피드백이므로 입력 인터페이스만 바뀌고 상태 누적과 재시도 구조는 유지됩니다.
핵심 수치
- ARC-AGI-3 RHAE: 100.00- 공개 세트 25개 환경, 183개 레벨 전체 완료
- ARC-AGI-3 환경 행동: 6,624회- AVO와 Claude Opus 5 조합
- VISTA 환경 행동: 7,542회- Claude Opus 5로 동일한 183개 공개 세트 완료를 보고한 비교 수치
- 행동 수 비교: 약 12% 적음- AVO 6,624회와 VISTA 7,542회 비교이며 통제된 ablation은 아님
- GPU 커널 탐색: 7일, 500개 초과 방향, 40개 커밋 버전- attention-kernel 자율 최적화 실험
- 커널 성능: cuDNN 대비 최대 3.5%, FlashAttention-4 대비 최대 10.5% 향상- NVIDIA DGX B200 시스템의 평가 구성
섹션별 상세
AVO의 장기 자율 작업 구조

GPU 커널 탐색에서의 성능 결과
ARC-AGI-3에 적용한 동일한 에이전트


공개 세트 성능과 비교의 범위
- AVO는 ARC-AGI-3에서 6,624회 환경 행동을 사용했고 VISTA의 7,542회보다 약 12% 적은 행동으로 동일한 공개 세트를 완료했다. — 본문의 AVO performance results 단락에 AVO와 VISTA의 행동 수 및 약 12% 비교가 기재됨. 출처
장기 에이전트 설계에서 얻은 시사점
용어 해설
- 장기 작업 에이전트(Long-Horizon Agent)
- — 한 번의 모델 호출이나 짧은 대화로 끝나지 않는 여러 단계 작업을 장시간 수행하는 에이전트입니다. 외부 도구로 행동하고 결과를 관찰하며, 메모리와 피드백을 이용해 계획을 수정하고 실패 뒤에도 현재 상태에서 작업을 이어가는 구조가 핵심입니다.
- 영속 메모리(Persistent Memory)
- — 이전 구현, 평가 결과, 컴파일러·프로파일러 출력, 누적 추론을 다음 작업에서도 사용할 수 있도록 보존하는 저장 구조입니다. 에이전트가 매번 탐색을 처음부터 반복하지 않고 현재 상태에서 이어서 행동하게 만들어 장기 작업의 연속성을 높입니다.
- 상대적 인간 행동 효율(Relative Human Action Efficiency (RHAE))
- — ARC-AGI-3에서 과제 완료 여부와 레벨별 행동 효율을 첫 시도 인간 기준과 비교해 집계하는 평가 지표입니다. 같은 문제를 풀더라도 환경 행동 수를 적게 사용하면 효율 측면의 점수가 높아지므로 장기 탐색과 행동 절약을 함께 평가합니다.
- GPU 커널 최적화(GPU-Kernel Optimization)
- — GPU에서 실행되는 연산 커널의 정확성, 메모리 동작, 스케줄링, 처리량을 반복 실험으로 개선하는 작업입니다. AVO는 코드를 검사하고 수정한 뒤 하드웨어 기반 테스트와 프로파일링 결과를 받아 다음 후보를 선택하는 방식으로 최적화를 진행합니다.
- 직접 상호작용 방식(Direct Interaction)
- — 에이전트가 명시적인 프로그램형 세계 모델을 먼저 구축하기보다 환경에 직접 행동을 입력하고 상태 변화를 관찰하며 규칙과 목표를 추론하는 방식입니다. AVO의 ARC-AGI-3 설정에서는 이미지 토큰 없이 64 x 64 텍스트 그리드를 관찰하고 가능한 행동의 효과를 상호작용으로 파악합니다.
기술
- AVO
- ARC-AGI-3
- Claude Opus 5
- GPT-5.6 Sol
- VISTA
- Tycho
- Claude Code
- Codex
- cuDNN
- FlashAttention-4
- NVIDIA DGX B200
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.