본문으로 건너뛰기

AVO, ARC-AGI-3 공개 세트 100% 달성

NVIDIA AVO가 장기 메모리와 감독 루프로 ARC-AGI-3 공개 세트 183개 레벨을 모두 완료했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

NVIDIA의 AVO는 Persistent Memory, Supervisor, Tools를 결합해 모델이 장시간 작업을 이어가는 general-purpose agent architecture입니다. GPU-kernel 최적화에서 7일 동안 500개가 넘는 방향과 40개 커널 버전을 탐색해 NVIDIA DGX B200에서 cuDNN 대비 최대 3.5%, FlashAttention-4 대비 최대 10.5% 높은 성능을 냈습니다. 같은 구조를 ARC-AGI-3에 연결한 결과 Claude Opus 5 기반 AVO는 공개 세트 25개 환경의 183개 레벨을 모두 완료해 100.00 RHAE와 6,624회 행동을 기록했습니다. VISTA의 7,542회와 비교해 약 12% 적은 행동이지만 시스템 구성이 달라 직접적인 AVO 기여도 측정은 아니며, 핵심 결론은 모델 단독 성능보다 메모리·도구·피드백·복구를 포함한 전체 에이전트 구조가 장기 자율 작업을 좌우한다는 점입니다.

빠른 이해

새로운 점

GPU-kernel 최적화에 사용한 동일한 AVO 구조를 ARC-AGI-3의 직접 상호작용 환경으로 옮겨 100.00 RHAE와 6,624회 행동을 기록했다는 점입니다.

핵심 메커니즘

AVO는 후보와 외부 관찰을 입력으로 받아 Context Inspection, Planning, Implementation, Evaluation을 반복하고, Persistent Memory에 구현·측정·추론을 저장합니다. Supervisor는 탐색 궤적의 정체나 반복 실패를 감지하면 조건부 개입으로 대체 전략을 유도하며, 평가에 실패한 후보는 Diagnose and Repair 경로를 거쳐 다시 루프에 들어갑니다. GPU 커널에서는 코드·컴파일러·프로파일러·하드웨어 성능 결과가 피드백이고, ARC-AGI-3에서는 64 x 64 텍스트 그리드 관찰과 환경 행동 결과가 피드백이므로 입력 인터페이스만 바뀌고 상태 누적과 재시도 구조는 유지됩니다.

핵심 수치

  • ARC-AGI-3 RHAE: 100.00- 공개 세트 25개 환경, 183개 레벨 전체 완료
  • ARC-AGI-3 환경 행동: 6,624회- AVO와 Claude Opus 5 조합
  • VISTA 환경 행동: 7,542회- Claude Opus 5로 동일한 183개 공개 세트 완료를 보고한 비교 수치
  • 행동 수 비교: 약 12% 적음- AVO 6,624회와 VISTA 7,542회 비교이며 통제된 ablation은 아님
  • GPU 커널 탐색: 7일, 500개 초과 방향, 40개 커밋 버전- attention-kernel 자율 최적화 실험
  • 커널 성능: cuDNN 대비 최대 3.5%, FlashAttention-4 대비 최대 10.5% 향상- NVIDIA DGX B200 시스템의 평가 구성

섹션별 상세

AVO의 장기 자율 작업 구조

NVIDIA의 AVO는 단일 응답으로 코드를 생성하는 대신 장시간 이어지는 작업에서 모델의 상태와 행동을 관리하도록 설계된 general-purpose coding agent system입니다. 에이전트는 기존 구현과 문서를 검사하고, 변경 계획을 세우고, 코드를 실행한 뒤 평가 결과에 따라 다음 후보를 선택하는 순환을 반복합니다. Persistent Memory는 이전 구현과 평가·컴파일러·프로파일러 결과를 보존하고, Supervisor는 탐색이 정체되거나 비생산적 순환이 이어질 때 다른 전략으로 전환하도록 개입합니다. 이 구조는 모델이 한 번에 완성된 답을 내놓지 못하는 GPU 커널 최적화와 낯선 게임 환경 모두에서 피드백을 누적하며 작업을 지속하게 하는 기반입니다.
AVO 구조도는 입력된 후보·지식 기반·평가기를 바탕으로 검사, 계획, 구현, 평가, 진단·수정을 반복하는 루프와 Memory, Tools, Reasoning, Supervisor를 연결합니다.
Diagram중앙 순환 구조는 AVO의 입력에서 후보 생성과 평가까지 이어지는 장기 자율 작업 흐름을 보여줍니다. Supervisor의 조건부 개입과 실패 뒤 repair and retry 경로는 Persistent Memory와 함께 탐색 정체와 오류를 처리하는 시스템 메커니즘을 보완합니다.

GPU 커널 탐색에서의 성능 결과

AVO는 attention-kernel 최적화에서 7일 동안 500개가 넘는 최적화 방향을 탐색하고 40개의 커널 버전을 커밋했습니다. 각 후보는 코드 변경 뒤 실행 테스트와 하드웨어 성능 측정을 거쳤으며, 그 결과 NVIDIA DGX B200의 평가 설정에서 multihead attention 커널이 cuDNN보다 최대 3.5%, FlashAttention-4보다 최대 10.5% 높은 성능을 기록했습니다. 이후 에이전트는 약 30분의 추가 자율 작업으로 진화한 커널을 grouped-query attention에 맞게 조정했습니다. 수치의 핵심은 최종 커널 하나의 결과뿐 아니라 검사, 수정, 실행, 측정, 재시도를 7일 동안 수동 단계 지정 없이 이어간 탐색 과정에 있습니다.
근거
  • AVO는 attention-kernel 최적화에서 7일 동안 500개가 넘는 방향을 탐색하고 40개 커널 버전을 커밋했다. 본문의 GPU-kernel optimization 단락에 7일, 500개 초과 최적화 방향, 40개 커밋 버전이 기재됨. 출처
  • NVIDIA DGX B200 평가에서 AVO 커널은 cuDNN보다 최대 3.5%, FlashAttention-4보다 최대 10.5% 높은 성능을 기록했다. 본문의 attention-kernel study 성능 문장에 비교 대상과 최대 성능 차이가 기재됨. 출처

ARC-AGI-3에 적용한 동일한 에이전트

NVIDIA는 GPU 최적화에 사용한 AVO의 핵심 구조를 명시적 규칙과 목표가 없는 ARC-AGI-3의 낯선 상호작용 환경에 연결했습니다. AVO는 가능한 행동을 입력하고 환경 변화를 관찰한 뒤, 불완전한 증거에서 가설을 세우고 상태를 메모리에 남기며 다음 행동을 수정하는 순서를 반복했습니다. 이 설정에서 LLM에는 이미지나 image token을 보내지 않고 각 관찰을 정확한 64 x 64 텍스트 그리드로 제공했으며, VISTA와 달리 AVO의 자체 실행 루프와 메모리·감독 구조를 사용했습니다. 도메인과 피드백 채널은 달라졌지만 가설 수립, 행동, 결과 관찰, 상태 보존, 오류 복구라는 계산 패턴은 유지됐습니다.
검은 배경 위에 AVO와 ARC-AGI-3 표기가 있는 인물형 에이전트가 여러 퍼즐 화면을 다루고 있으며, 전면 진행 막대가 100%를 표시합니다.
Infographic이미지는 AVO가 ARC-AGI-3 과제를 수행해 100% 진행률에 도달했다는 기사의 핵심 결과를 시각적으로 나타냅니다. 퍼즐 화면과 ARC-AGI-3 표기는 에이전트가 단순 텍스트 생성이 아니라 여러 환경과 레벨에서 상호작용하는 설정임을 보완합니다.
ARC-AGI-3 공개 세트의 여러 게임 화면과 레벨 진행 상태가 배열되어 있으며, 하단에 183개 레벨과 25개 게임 단위가 표시됩니다.
Screenshot이미지는 ARC-AGI-3 공개 세트가 25개 환경과 총 183개 레벨로 구성된다는 평가 범위를 직접 보여줍니다. 다양한 격자형 게임 화면은 AVO가 하나의 고정된 문제를 푸는 것이 아니라 낯선 환경의 규칙과 목표를 상호작용으로 추론해야 했다는 점을 보완합니다.
근거
  • AVO는 ARC-AGI-3 공개 세트 25개 환경의 183개 레벨을 모두 완료해 100.00 RHAE를 기록했다. 본문의 ARC-AGI-3 성능 결과 단락과 Figure 2 캡션에 공개 세트, 25개 환경, 183개 레벨, 100.00 RHAE가 함께 기재됨. 출처
  • ARC-AGI-3 설정에서 AVO의 LLM은 이미지 토큰 없이 정확한 64 x 64 텍스트 그리드를 관찰했다. 본문의 ARC-AGI-3 task interface 비교 단락에 AVO 관찰 방식과 64 x 64 텍스트 그리드가 기재됨. 출처

공개 세트 성능과 비교의 범위

AVO는 Claude Opus 5와 함께 ARC-AGI-3 공개 세트의 25개 환경과 183개 레벨을 모두 완료해 100.00 RHAE를 기록했고, 환경 행동은 6,624회였습니다. 같은 모델을 사용한 VISTA의 보고 수치는 7,542회 행동으로 동일한 183개 공개 세트를 완료한 결과여서 AVO가 약 12% 적은 행동을 사용한 비교가 됩니다. 다만 두 시스템은 agent backend, 관찰 표현, 메모리, context management가 달라 통제된 ablation으로 볼 수 없으며 AVO 메모리의 개별 기여도 이 실험만으로 분리되지 않습니다. ARC Prize가 별도로 보고한 Claude Opus 5의 공개 세트 약 30% 수치와도 reasoning 설정과 시스템 구성이 다르므로, 100.00 점을 모델 자체의 기여도로 해석하기보다 완전한 에이전트 시스템 평가의 결과로 읽어야 합니다.
근거
  • AVO는 ARC-AGI-3에서 6,624회 환경 행동을 사용했고 VISTA의 7,542회보다 약 12% 적은 행동으로 동일한 공개 세트를 완료했다. 본문의 AVO performance results 단락에 AVO와 VISTA의 행동 수 및 약 12% 비교가 기재됨. 출처

장기 에이전트 설계에서 얻은 시사점

AVO 실험은 장기 작업 능력이 언어 모델의 단일 호출 성능만으로 결정되지 않고 메모리, 도구, 피드백, 복구를 포함한 전체 시스템에서 형성된다는 관점을 뒷받침합니다. GPU 최적화에서는 컴파일러, 테스트, 프로파일러와 처리량이 피드백이었고 ARC-AGI-3에서는 환경 전이와 행동 결과가 피드백이었지만, 두 경우 모두 가설을 행동으로 시험하고 결과를 다음 상태에 반영했습니다. AVO는 GPT-5.6 Sol과의 제한적 실험에서도 일부 matched-level 비교에서 Sol의 wall-clock 시간이 짧고 Claude Opus 5의 환경 행동 수가 적은 상이한 운영 특성을 확인했지만, 체계적 비교는 후속 과제로 남겼습니다. 따라서 향후 general-purpose agent는 특정 도메인 지식을 덧붙이는 일뿐 아니라 상태를 오래 유지하고 도구 행동을 실행하며 실패 뒤 탐색을 재개하는 시스템 설계에 초점을 맞출 필요가 있습니다.

용어 해설

장기 작업 에이전트(Long-Horizon Agent)
한 번의 모델 호출이나 짧은 대화로 끝나지 않는 여러 단계 작업을 장시간 수행하는 에이전트입니다. 외부 도구로 행동하고 결과를 관찰하며, 메모리와 피드백을 이용해 계획을 수정하고 실패 뒤에도 현재 상태에서 작업을 이어가는 구조가 핵심입니다.
영속 메모리(Persistent Memory)
이전 구현, 평가 결과, 컴파일러·프로파일러 출력, 누적 추론을 다음 작업에서도 사용할 수 있도록 보존하는 저장 구조입니다. 에이전트가 매번 탐색을 처음부터 반복하지 않고 현재 상태에서 이어서 행동하게 만들어 장기 작업의 연속성을 높입니다.
상대적 인간 행동 효율(Relative Human Action Efficiency (RHAE))
ARC-AGI-3에서 과제 완료 여부와 레벨별 행동 효율을 첫 시도 인간 기준과 비교해 집계하는 평가 지표입니다. 같은 문제를 풀더라도 환경 행동 수를 적게 사용하면 효율 측면의 점수가 높아지므로 장기 탐색과 행동 절약을 함께 평가합니다.
GPU 커널 최적화(GPU-Kernel Optimization)
GPU에서 실행되는 연산 커널의 정확성, 메모리 동작, 스케줄링, 처리량을 반복 실험으로 개선하는 작업입니다. AVO는 코드를 검사하고 수정한 뒤 하드웨어 기반 테스트와 프로파일링 결과를 받아 다음 후보를 선택하는 방식으로 최적화를 진행합니다.
직접 상호작용 방식(Direct Interaction)
에이전트가 명시적인 프로그램형 세계 모델을 먼저 구축하기보다 환경에 직접 행동을 입력하고 상태 변화를 관찰하며 규칙과 목표를 추론하는 방식입니다. AVO의 ARC-AGI-3 설정에서는 이미지 토큰 없이 64 x 64 텍스트 그리드를 관찰하고 가능한 행동의 효과를 상호작용으로 파악합니다.

기술

  • AVO
  • ARC-AGI-3
  • Claude Opus 5
  • GPT-5.6 Sol
  • VISTA
  • Tycho
  • Claude Code
  • Codex
  • cuDNN
  • FlashAttention-4
  • NVIDIA DGX B200
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 08. 21.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.