본문으로 건너뛰기

LLM 없이 ft09에서 100% 달성한 비신경망 에이전트

Orivael의 규칙·검색 기반 에이전트가 ARC-AGI-3 ft09에서 모든 레벨을 80행동으로 해결했으나 관측 샘플링 오류가 주요 실패 원인으로 드러났다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Orivael의 비신경망 에이전트가 ARC-AGI-3의 ft09에서 6/6 레벨을 80 행동으로 해결해 공식 스코어카드상 100%를 기록했으며 전체 모델 추론 비용은 $0.00으로 보고되었다. 주요 실패 원인은 관측 샘플링과 환경 존재성 간의 혼동으로, 샘플링에 대한 철저한 조사 결과가 곧 전체 환경의 완전성으로 잘못 해석되는 패턴이 반복되었다. 작성자는 메커닉 인식 이후에는 에이전트가 매우 효율적이지만, 새로운 세계의 종류를 식별해 이전 가정을 전이하지 않는 방법을 찾는 것이 남은 핵심 과제라고 밝히며 관련 분야 연구자의 의견을 구하고 있다.

주요 논점

01찬성다수

비신경망 규칙·검색 기반 접근만으로도 구조화된 추론 문제의 일부에서 높은 성과를 낼 수 있다는 사실이 이번 결과로 입증된다.

02중립소수

시스템이 특정 레벨에서 효율적이라는 증거는 명확하지만, 공개된 나머지 게임들이 대부분 미해결 상태라는 점에서 범용성은 아직 확인되지 않았다.

03찬성다수

관측 샘플링 오류가 반복적 실패의 핵심 원인이라는 관찰은 능동적 지각과 불확실성 모델링을 우선 과제로 만들 만큼 설계상 중요한 통찰을 제공한다.

합의점 vs 논쟁점

합의점

  • 여러 예시는 관측의 부분성과 샘플링 에일리어싱이 규칙 기반 시스템에서 치명적인 오류를 유발할 수 있다는 점을 가리킨다; 동일 타일의 색 차이나 반타일 측정 차이만으로도 잘못된 상태 추정을 촉발하며, 그 결과로 행동 불가 판정이나 잘못된 상호작용 판단이 발생한다. 이 문제는 입력→표상→결정의 파이프라인에서 관측 불확실성을 명시적으로 처리하지 않으면 재발할 가능성이 크다는 점을 실험적으로 뒷받침한다. 따라서 관측 전략·재측정·가설 검증 루틴을 통합하는 설계가 다수의 참가자에게 공통 과제로 인식된다.
  • Arc 스코어와 행동 수 같은 정량 지표를 함께 제시한 점은 결과의 신뢰도를 높였다는 데에 동의가 모인다; 비용이 $0.00이라고 명시한 부분은 LLM 등 대형 모델 추론 비용과 분명히 대비되는 근거를 제공하며, 재현 가능한 스코어카드 링크로 검증 가능한 증거를 제공했다. 그러므로 이 실험은 '비신경망으로도 일정한 성공을 재현할 수 있다'는 주장에 대해 검증 가능한 근거를 일부 제공한 것으로 평가된다.

논쟁점

  • 일부 독자는 'LLM이 전혀 필요 없다'는 서술을 일반화의 증거로 받아들이기 어려워할 것이다; 특정 레벨의 규칙성이 높고 관측이 상대적으로 단순한 환경에서는 규칙 기반 방법이 잘 작동하지만, 더 복잡하거나 자연언어적 추론이 필요한 문제로 확장되지 않을 수 있다. 따라서 이 주장은 환경 특성과 문제 범위의 한계를 명확히 하는 보완적 증거가 필요하다는 반론을 불러일으킨다.
  • 작성자가 제시한 실패 원인들이 관측 샘플링에 집중되어 있으나, 일부 독자는 표현 학습이나 일반화 메커니즘의 부재도 주요 원인이라고 볼 수 있다; 즉 관측을 더 풍부하게 압축·일반화하는 신경 모델이 결합되면 문제를 완화할 수 있다는 의견과 충돌할 가능성이 있다. 이 견해 차이는 규칙 기반 설계의 우선순위와 하이브리드 통합의 필요성에 대한 실무적 논쟁으로 이어진다.

실용적 조언

  • 관측이 부분적이고 스크롤링 창이 존재할 가능성이 있는 환경에서는 동일 위치를 여러 오프셋으로 샘플링해 교차검증하는 능동적 관측 루틴을 도입하는 것이 우선권을 가져야 한다. 구체적으로는 반타일·정중앙·인접 칸 등 여러 측정 위치를 정책으로 순회하면서 일관성 검사를 하고, 불일치가 발견되면 가설을 생성해 추가 탐색으로 검증하는 파이프라인을 설계할 것을 권한다. 이렇게 하면 샘플링 에일리어싱과 색상 충돌로 인한 오인식을 상당 부분 줄일 수 있다.
  • 환경의 부분성을 다루기 위해 관측적 불확실성을 표상하는 메커니즘을 도입하면 유리하다; 예컨대 각 타일에 대한 확률적 존재성 분포를 유지하고 행동 전 판단 단계에서 불확실성 기준을 적용해 추가 탐색이나 안전한 행동을 선택하도록 하면 잘못된 완전성 가정을 피할 수 있다. 이는 규칙 기반 결정 과정과 결합해 가설 기반의 시험·검증 루프를 자동화하는 방식으로 구현할 수 있다.
  • 메커닉을 식별한 뒤의 효율성은 분명한 장점이므로, 메커닉 인식 모듈을 별도로 설계해 초기 탐색 단계에서 가능한 규칙 후보를 빠르게 생성·검증하도록 하는 것이 실용적이다. 후보 생성은 관측 패턴의 반복성·상태 전이 형식·상호작용 결과의 결정론성을 특징으로 삼아 점수화하고, 높은 점수 후보만을 사용해 결정론적 플래닝을 적용하면 전체 행동 비용을 낮출 수 있다.

섹션별 상세

작성자는 Orivael에서 ARC-AGI-3 벤치마크를 상대로 비신경망 에이전트를 개발해 일부 결과를 보고했고, 그중 ft09에서 6/6 레벨을 80 행동으로 완료해 100%를 기록했다. 시스템은 입력으로 그리드 원형 데이터를 직접 받아 행동을 출력하는 구조이며, 추론·계획·행동 선택 과정에 LLM이 전혀 개입하지 않는다. 오픈된 스코어카드 링크와 행동 수 비교(인간 기준 208 행동)를 근거로 성능과 비용(모델 추론 비용 $0.00)을 제시해 실험적 성과와 근거를 함께 제공한다.
주된 실패 패턴은 관측 샘플링과 환경 존재성의 혼동으로 요약되며, 구체적 사례로 동일 색상으로 표기된 스프라이트와 벽의 혼동, 반타일 간격 샘플링으로 인한 에일리어싱, 스크롤링 창으로 인한 부분적 보드 인식 등이 제시된다. 시스템이 샘플된 영역을 철저히 조사한 결과를 전체 환경에 대한 완전 탐색으로 잘못 해석해 잘못된 결론에 도달하는 메커니즘이 반복적으로 관찰되었다. 이 증거는 단일 관측에서의 완전성 가정이 잘못되었을 때 규칙·검색 기반 에이전트가 어떻게 실패하는지를 보여주며, 관측 불완전성을 처리하는 설계가 중요하다는 점을 부각한다.
효율성 측면에서 저자는 특정 게임의 메커닉을 정확히 규명하면 에이전트가 매우 효율적으로 행동한다는 점을 강조한다; 예컨대 ft09의 여섯 레벨은 각 레벨에서 4/7/14/16/26/13 행동으로 완료되어 인간 기준보다 적은 행동으로 해결되었다. 이는 메커닉 인식이 이루어졌을 때 결정론적 계획과 탐색이 단기 행동 비용을 크게 낮출 수 있음을 보여 주며, 성능 지표와 행동 분포를 근거로 효율성이 실험적으로 검증되었다. 다만 전체 벤치마크에서는 25개 공개 게임 중 20개가 아직 손대지 않은 상태여서 보편적 성공으로 일반화되지는 못한다.
현 단계에서의 핵심 난제는 '새로운 세계의 종류를 어떻게 식별할 것인가'이며, 작성자는 이전 세계에서의 가정을 자동으로 전이하지 않는 메커니즘을 연구 중이라고 적었다. 기술적으로는 관측의 부분성, 상태 전이 규칙의 비일관성, 액션 효과의 문맥 의존성이 문제를 일으키며 이들을 해결하려면 능동적 관측 전략이나 메타-가설 선택 메커니즘이 필요하다. 이 논점은 ARC·world model·active perception 연구자들에게 직접적인 연구 과제를 제공하며 후속 연구 방향을 명확히 제시한다.

용어 해설

월드 모델(World model)
환경의 상태와 전이 규칙을 내부 표현으로 유지해 다음 관측이나 결과를 예측하는 구조를 말한다. 입력으로 센서·관측을 받고 내부 표상에서 시뮬레이션을 실행한 뒤 행동을 계획하는 과정으로 구성된다. 벤치마크에서는 관측의 부분성이나 스크롤링 창과 같은 관측 제약을 명시적으로 모델링하지 않으면 오인식으로 이어지기 쉽다.
능동적 지각(Active perception)
에이전트가 필요한 정보를 얻기 위해 정책적으로 관찰 행동을 선택하는 전략이다. 단순한 패시브 관찰이 아니라 탐사 행동을 통해 관측을 바꾸고 불확실성을 줄이는 입력→행동→관측 루프를 포함한다. ARC 스타일 환경에서는 동일 타일의 색·샘플링 위치 차이로 잘못 추정되는 문제를 줄이기 위해 관측 전략 설계가 핵심 역할을 한다.
프로그램 합성(Program synthesis)
문제 서술이나 입출력 예시로부터 규칙적 처리 절차를 형식적 코드로 생성하는 기법을 뜻한다. 입력으로 예시·사양을 받고 검색·최적화로 후보 프로그램을 만들며, 검증을 통해 올바른 동작을 보장하려고 한다. ARC 문제 해결에서는 규칙을 규명해 짧고 결정론적인 행동 시퀀스를 생성하는 데 유리하나 관측의 부분성 때문에 일반화 실패가 발생할 수 있다.
비신경망 추론(Non-neural reasoning)
신경망 대신 규칙 기반, 심볼릭, 검색 중심의 알고리즘으로 인과·계획·탐색 문제를 처리하는 접근이다. 입력으로 정형화된 상태 표현을 받고 명시적 검사·검색·제어 흐름으로 행동을 선택하며, 비용은 알고리즘 복잡도에 의존한다. OP 사례에서는 LLM 없이 그리드 직접 해석과 탐색만으로 일부 레벨을 완전 해결했으나 관측왜곡에 취약한 한계가 드러났다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 10.수집 2026. 08. 10.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.