TL;DR
사람의 시각은 반복적으로 시선을 옮기며 가설을 세우고 검증하는 능력에 의존하는데, 이 능력은 방사선 판독, 연결 구조 검증, 미세 속성 비교 같은 실제 고위험 작업에 필수적이다. ActiveVision은 현대 MLLM이 단일 이미지 인코딩에 의존하는지 아니면 반복 관찰 루프를 실행하는지를 수량화 가능한 방식으로 만들었다. 이 결과는 모델 설계와 학습 목표가 지각과 추론의 루프를 연결하도록 바뀌어야 한다는 점을 시사한다.
왜 중요한가
사람의 시각은 반복적으로 시선을 옮기며 가설을 세우고 검증하는 능력에 의존하는데, 이 능력은 방사선 판독, 연결 구조 검증, 미세 속성 비교 같은 실제 고위험 작업에 필수적이다. ActiveVision은 현대 MLLM이 단일 이미지 인코딩에 의존하는지 아니면 반복 관찰 루프를 실행하는지를 수량화 가능한 방식으로 만들었다. 이 결과는 모델 설계와 학습 목표가 지각과 추론의 루프를 연결하도록 바뀌어야 한다는 점을 시사한다.
핵심 기여
반복 관찰 능력을 분리해 측정하는 ActiveVision 벤치마크 도입
ActiveVision은 분산 스캐닝, 순차적 횡단, 시각 속성 전이의 세 축에 걸친 17개 과제를 제공해 한 번의 요약으로 풀 수 없는 구조적 시각 문제들을 측정했다. 각 과제는 절차적 스캐폴드와 포토리얼리스틱 재렌더링을 통해 현실적 텍스처와 잡음을 도입하면서도 정확한 정답을 보존한다. 이를 통해 모델의 반복적 시각 증거 재참조 능력을 직접적으로 수치화할 수 있다.
절차적 스캐폴드와 GPT-image-2 재렌더링을 결합한 생성 파이프라인
각 인스턴스는 결정적 파이썬 생성기로 기하학적 정답을 만든 뒤 GPT-image-2 프롬프트로 재렌더링되어 포토리얼리스틱 이미지를 생성한다. 이 파이프라인은 기하학적 토폴로지는 변형시키지 않으면서 텍스처·조명·잡음을 도입해 현실적 입력을 구현한다. 결과적으로 모델과 코드 기반 추출법의 견고성이 실제 입력 회복 능력에 따라 평가되도록 설계되었다.
광범위한 전면 평가를 통한 인간 대비 모델 성능 격차 정량화
85개 항목(각 제너레이터별 5개 인스턴스)에서 최고 노력 수준의 모델도 낮은 정확도를 보였고 인간 평균은 96.1%로 나타났다. 구체적으로 GPT-5.5의 xhigh 런이 10.6%를 달성했고 Claude Fable 5는 3.5%에 그쳤다. 추가적인 추론 예산 투입은 정확도를 소폭 개선했으나 근본적 성능 격차는 유지되었다.
에이전트 기반 코드 실행 실험으로 도구 사용의 한계 규명
모델이 자체적으로 비전 코드를 작성·실행하는 에이전트 실험에서 도구 사용은 특정 속성 비교 과제에서 큰 성과를 냈지만 순차적 횡단 과제와 뒤엉킨 루프 과제는 여전히 실패했다. 최강의 에이전트(Fable 5 기반)는 50.6%를 달성했지만 실행 시간과 비용이 크게 증가했다(항목당 12–15분, $2.74–$7.63). 코드 기반 접근도 포토리얼리스틱 잡음 앞에서는 도구의 실패를 감지·교정할 능력이 부족했다.
핵심 아이디어 이해하기
현대의 멀티모달 대형 언어 모델은 이미지 입력을 단일 고정 토큰 시퀀스로 인코딩해 그 위에서 일련의 추론을 수행하는 방식이 일반적이다. 이 접근은 이미지의 전역적 요약을 한 번 만들어 두고 그 요약에 대해 언어적 추론을 진행하게 하므로, 지역별 좌표·연속적 경로·미세 속성처럼 언어 한 문장에 수집하기 어려운 정보는 손실된다. ActiveVision은 그러한 손실을 의도적으로 만들어 모델이 이미지 자체를 반복적으로 참조해야만 정답에 도달하도록 설계되었다.
관련 Figure

이미지는 ActiveVision이 겨냥하는 세 가지 인지 축을 직관적으로 보여주며 각 과제가 왜 반복적 시각 증거 재검토를 요구하는지 시각적으로 확인시킨다. 왼쪽의 영역 세기 과제는 분산 스캐닝의 필요성을, 가운데의 끈은 순차적 횡단의 유지 난관을, 오른쪽의 템플릿 매칭은 미세 속성 전이를 요구함을 드러낸다. 이 예시는 벤치마크가 단순한 캡셔닝이 아니라 반복적 탐색을 측정하기 위해 디자인되었음을 보강한다.
세 가지 예시 과제(분리된 영역 개수 세기, 끈 따라가기, 템플릿과 실루엣 일치 개수 세기)를 통해 한 번의 응시로는 풀기 어려운 반복 관찰 요구를 시각적으로 제시하고 있다.
방법론
벤치마크는 세 가지 인지 축으로 구성된 17개의 과제 생성기를 포함한다. 각 생성기는 결정적 난수 시드를 받아 절차적 스캐폴드를 출력하고, 그 스캐폴드는 닫힌 윤곽선, 임의 스플라인 경로, 연속 좌표 등 기하학적 정답을 명확히 정의한다. 스캐폴드는 이후 GPT-image-2에 태스크별 프롬프트와 함께 전달되어 포토리얼리스틱 이미지를 생성하며 이 재렌더링은 위치·카운트·토폴로지를 보존하도록 설계되었다.
관련 Figure

그리드는 과제별 입력 예시와 간단한 작업 설명을 병치해 태스크 다형성과 난이도 분포를 시각적으로 전달한다. 이 배열은 특정 과제가 코드 기반 처리에 유리한지 또는 반복적 시야 재참조가 필수인지 같은 특성의 차이를 직관적으로 파악하게 한다. 벤치세트의 구성 원리를 이해하는 데 실무적 기준을 제공한다.
ActiveVision의 17개 과제를 한눈에 배열해 각 과제가 세 가지 가족(분산 스캐닝, 순차적 횡단, 시각 속성 전이)으로 어떻게 분포되는지를 보여준다.

도식은 파이프라인의 네 단계를 단계별로 연결해 절차적 스캐폴드의 기하 보존과 재렌더링의 역할을 명확히 한다. 또한 한 사례에서 실제 정답(n=10)이 보존되어 재렌더링 이전·이후에서 동일한 정답을 유지함으로써 평가는 실제 이미지의 잡음과 텍스처에도 불구하고 기하학적 정답을 기준으로 수행됨을 시사한다. 이 그림은 실험 재현성과 인스턴스의 결정성 측면을 뒷받침한다.
생성 파이프라인 도식으로, 결정적 생성기에서 스캐폴드가 나오고 GPT-image-2 프롬프트로 재렌더링되어 포토리얼리스틱 이미지와 동일한 기하학적 정답이 유지되는 흐름을 보인다.
주요 결과
주요 실험은 pure-CoT(체인오브토트) 조건에서 진행되었고 정확도는 항목별 정확한 일치 여부로 채점되었다. 최고 성능 모델(GPT-5.5 xhigh)은 85개 항목 중 9개 정답으로 10.6% 정확도를 보였고 인간 참가자 세 명은 평균 96.1%를 달성했다. 추론 노력의 계층을 높여 비용을 크게 늘려도 정확도 향상은 제한적이었고, 에이전트 기반 도구 사용은 속성 비교 과제에서 유의미한 이득을 보였지만 전체 격차를 해소하지는 못했다.
관련 Figure

플롯은 추론 노력과 비용을 늘려도 정확도가 인간 수준에 근접하지 못함을 시각적으로 드러낸다. 특히 GPT-5.5는 xhigh 설정에서 약 10.6%를 기록해 비용 증가 대비 성능 개선이 제한적임이 나타난다. 이 도표는 단순히 계산 자원 투입만으로는 반복 관찰 능력 격차를 해소할 수 없음을 시사한다.
API 비용(로그 스케일) 대비 정확도 산점도로, 모델별 추론 노력 수준에 따른 성능 분포와 인간 기준선(약 96.1%)을 비교하고 있다.

각 모델의 회귀선 기울기가 1보다 작아 항목 수가 증가할수록 모델의 과소집계가 심해지는 패턴이 관찰된다. 이 현상은 분산 스캐닝 과제에서 모델이 전체 캔버스를 완전하게 스캔하지 못하고 일부만 포착하는 행동과 일관된다. 회귀 기울기 수치는 모델의 보수적 카운팅 편향을 정량적으로 표현한다.
예측된 카운트 대 실제 정답 카운트 산점도와 회귀선을 모델별로 제시해 모델들이 실제 카운트를 과소추정하는 경향을 수량화하고 있다.

곡선은 첫 한두 단계 내에서 정확성이 급격히 떨어지며 전체 경로를 정확히 완료한 사례는 거의 없음을 보여준다. 이 패턴은 모델이 초기 프레임을 잃으며 추적 프레임을 유지하지 못하는 실패 모드를 시사한다. 따라서 횡단 실패는 장거리 누적 오류가 아니라 초반 프레임의 붕괴에서 기인한다.
세 가지 순차적 횡단 과제에서 걷기 경로의 앞부분 k단계가 전부 맞는 사례 비율을 시간축으로 보여주는 생존곡선이다.

막대그래프는 에이전트별 정확도 차이를 명확하게 보여주며 Fable 5 기반 에이전트가 50.6%로 가장 높았음을 확인할 수 있다. 그러나 인간 평균 96.1%와 비교하면 에이전트의 시간·비용을 고려한 효율성은 매우 낮다. 이 그림은 도구 사용이 일부 과제에서 유리하지만 전체 역량을 대체하지 못함을 시각적으로 요약한다.
Codex, Claude Code 계열 에이전트와 인간의 ActiveVision 정확도를 비교한 막대그래프로, 에이전트 중 최고도 인간 성능에 크게 못 미침을 나타낸다.
기술 상세
전체 생성 파이프라인은 네 단계로 구성된다: 결정적 파이썬 생성기(스캐폴드), 스캐폴드 출력(정확한 기하 및 GT), GPT-image-2 프롬프트(재렌더링 지시), 그리고 최종 포토리얼리스틱 이미지이다. 각 스캐폴드는 연속 좌표와 무기명 실루엣을 사용하며 닫힌 윤곽선은 랜덤 푸리에 계수 또는 주기 스플라인으로 합성돼 실루엣 공간이 연속적이고 비반복적이다. 평가에서는 각 생성기에서 N=5 인스턴스를 샘플링해 총 85개 항목으로 테스트했고 채점은 문자열 정규화 후 최종 블록의 정확한 일치로 수행되었다.
한계점
이미지는 GPT-image-2의 프롬프트 기반 재렌더링으로 생성된 합성적 분포에 속하므로 자연 이미지 전체 분포를 완전하게 대변하지 않는다. 또한 태스크 설계가 '한 번의 언어적 요약으로는 불가능'하도록 구성되어 있어 모델의 기술 발전으로 해당 성질이 약화되면 벤치마크의 난이도 조정이 필요하다. 에이전트 실험은 하나의 도구 집합과 샌드박스 환경에 한정되어 있어 모든 실전 배포 시나리오를 포괄하지는 않는다.
실무 활용
이 벤치마크는 도구를 포함한 자동화 워크플로에서 모델의 시각적 검증 능력을 평가하는 현실적 기준으로 사용 가능하다. GitHub 저장소가 공개되어 있어 코드와 데이터로 실험 재현이 가능하다. 다만 포토리얼리스틱 재렌더링은 통제된 합성 분포에서 생성되므로 실제 배포 전 별도의 도메인 적합성 검증이 필요하다.
- 시각적 검증 루틴을 가진 멀티모달 에이전트의 신뢰성 평가
- 의료 영상·제조 검사·항공 이미지에서 반복 관찰 요구 과제의 안전성 검증
- 비전 기반 툴체인(예: 템플릿 매칭·컨투어 추출)의 현실적 취약점 진단
- 모델 학습 목표를 설계할 때 지각–추론 루프를 포함한 손실함수 검증
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Active Observation
- — 시각적 증거를 한 번에 고정해 처리하는 대신 반복적으로 시야를 재조정하여 가설을 세우고 검증하는 인지적 과정이다. 관찰자는 관심 영역을 바꿔가며 지역 신호를 누적하고 경로를 추적하거나 미세 속성 비교를 수행한다. 이 논문에서는 MLLM이 이 루프를 수행하는지를 실험적으로 측정하는 핵심 역량으로 정의된다.
- Distributed Scanning
- — 이미지 전역에 흩어진 많은 지역 신호들을 빠짐없이 찾아 누적하는 연속적 탐색 작업이다. 탐색 실패는 일부 구역을 누락하거나 인접 신호를 잘못 개별화하는 형태로 나타난다. ActiveVision의 한 축으로서, 모델이 전체 캔버스를 반복적으로 훑어야 정답을 얻도록 설계되었다.
- Sequential Traversal
- — 연결된 구조를 시작점에서 끝까지 단계별로 따라가며 현재 위치와 방향을 유지하는 과업이다. 난이도는 경로 길이, 교차 밀도, 그리고 유사한 유인체의 존재에 따라 증가한다. 이 과업은 모델이 초기 프레임을 잃지 않고 단계적 추론을 계속할 수 있는지를 측정한다.
- Visual Attribute Transfer
- — 참조 영역에서 추출한 미세 속성(곡률, 길이, 형태 등)을 이미지 내 다른 후보와 비교해 일치 여부를 판정하는 작업이다. 속성 구별의 미묘성이나 후보 수가 많아지면 난도가 급상승한다. 이 축은 모델이 단일 요약이 아니라 지역별 측정을 반복해서 유지하는지를 테스트한다.
- Procedural Scaffold
- — 각 인스턴스의 정확한 기하학적 정답을 결정하기 위해 난수 시드로 생성되는 수학적/절차적 표현이다. 스캐폴드는 닫힌 윤곽선, 스플라인 경로, 영역 분할 등으로 구성되어 있으며 정확한 좌표·위치·토폴로지를 보존한다. 이 스캐폴드는 이후의 포토리얼리스틱 재렌더링으로도 정답을 유지하게 설계된다.
코드 예제
# creation.py (deterministic)
def generate(seed):
rng = default_rng(seed)
n = rng.integers(1, 16) # GT
loops = [closed_loop(rng) for _ in range(n)]
for _ in range(n):
return loops, n이 파이썬 코드는 절차적 생성기 예시로서 난수 시드를 받아 닫힌 루프 수와 루프 기하를 결정하는 스캐폴드를 출력한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
