NOOA 객체지향 에이전트의 ARC-AGI-3 RHAE 85.1% 성과
NOOA는 에이전트를 파이썬 객체로 표현해 타입화된 입출력·참조 전달·코드 실행 기반 루프·프로그래머블 컨텍스트·장기 메모리를 통합하여 여러 에이전트 벤치마크에서 효율성과 일관성을 개선했다.
Daily trending AI/ML papers from HuggingFace
NOOA는 에이전트를 파이썬 객체로 표현해 타입화된 입출력·참조 전달·코드 실행 기반 루프·프로그래머블 컨텍스트·장기 메모리를 통합하여 여러 에이전트 벤치마크에서 효율성과 일관성을 개선했다.
ProVisE라는 프로토콜화된 시각 평가 방식과 SpatialGen Bench를 통해 이미지 생성 모델의 픽셀 외현화 능력과 텍스트 VLM의 조합적 공간 추론 능력을 동일 메트릭으로 비교했으며 픽셀 외현화는 깊이와 접지성에 강하지만 조합적 추론에서는 텍스트 모델이 우위였다.
VCSD는 원본 이미지와 내용 제거 컨트롤 간의 토큰별 로그확률 차이를 이용해 EMA 교사의 분포를 대조적으로 조정하고 순방향 KL로 학생에게 증류하여 Qwen3 계열에서 일관된 성능 향상을 달성했다.
K12-KGraph는 중국 공식 교과서를 기반으로 교과 구조와 시각적 근거를 연결한 대규모 지식 그래프이며 이를 통해 23,640문항 벤치와 7,335샘플 SFT 데이터를 생성해 교육용 LLM과 VLM의 커리큘럼 인지를 개선했다.
ReferTrack은 이미지공간 바운딩박스 중 하나를 먼저 선택한 뒤 선택된 히스토리를 TVBI 토큰으로 주입해 단일 전방 카메라 환경에서 식별 중심의 추적 성능을 크게 향상시켰다.
AREX는 내부 연구 루프로 증거를 모으고 외부 자기개선 루프로 제약별 검증을 수행하여 부분 검증 상태를 재귀적으로 개선함으로써 긴 호라이즌의 심층 연구 과제를 효과적으로 해결한다.
Anchor-Align는 층별 고정 교사 증류와 행동을 언어 레이블로 변환한 동일-관찰 공동 감독을 결합해 VLM 표상을 보존하고 언어와 행동을 정렬함으로써 시뮬레이션과 실제 로봇에서 OOD 일반화와 성공률을 유의하게 향상했다.
하이퍼네트워크가 LoRA 어댑터를 생성해 고정 모델에 사실을 주입하며 깊이·폭·대상 모델·사실 수 축에서 파워법칙적 스케일링과 분포 외 일반화 우위를 실증했다.
ActiveVision은 반복적 시각 관찰을 직접 측정하는 17개 과제로 구성된 벤치마크로 인간 평균 96.1% 대비 최상위 MLLM이 10.6%에 그쳤음을 보고했다.
SetwiseEvalKit은 문서 집합을 3단계 9차원 루브릭으로 평가하고 Rubric4Setwise는 그 루브릭을 학습 없이 선택 신호로 활용해 더 적은 문서로 상위 성능을 달성했다.
Self Gradient Forcing은 자체 생성 이력을 재구성해 클린-타임스텝의 KV 쓰기 경로에 미래 손실의 그래디언트를 복원함으로써 긴 동영상 외삽 품질을 개선했다.
트릴리언 파라미터급 MoE 모델의 후처리에서 Ascend NPU 기반 계층적 최적화를 통해 MFU 34.22%와 2.93배 성능 향상을 달성하고 OR 특화 SFT 데이터 10K로 Pass@1 71.81%를 기록했다.
AlayaWorld는 15B video diffusion transformer를 기반으로 bounded visual context와 geometry-aligned spatial memory, 오류 재생 기반의 드리프트 완화, 그리고 분포매칭 증류를 결합해 4스텝 추론으로 24fps 장기 일관성 있는 인터랙티브 영상을 생성한다.
Mage-Flow는 경량 Mage-VAE와 4B NR-MMDiT를 결합해 네이티브 해상도에서 빠른 고품질 이미지 생성과 양방향 편집을 낮은 메모리로 실현한다.
AlayaRenderer-Flash는 G-buffer 조건의 autoregressive 스트리밍, 4단계 distillation, 경량화된 인코더·디코더를 결합해 AlayaRenderer를 0.56 FPS에서 31.54 FPS로 가속하여 실시간 게임 통합을 달성했다.
텍스트-이미지 diffusion transformer에서 챗 템플릿 토큰이 이미지→텍스트 어텐션의 주요 싱크이자 암묵적 의미 레지스터로 작동하며 이를 이용한 무학습 헤드 프루닝으로 어텐션 FLOPs를 20% 절감하고 GenEval 정확도는 1.4점만 감소함이 확인되었다.
DataFlow-Harness는 MCP와 재사용 가능한 DataFlow-Skills로 LLM 에이전트를 플랫폼에 그라운드하여 편집 가능한 DAG 워크플로를 생성하고 스크립트 대비 비용과 지연을 크게 줄였다.
ABot-World-0은 AAA 게임·시뮬레이션·인터넷 영상으로 학습한 행동 조건형 비디오 월드 모델로서 LongForcing 기반의 점진적 증류와 경량화된 추론 스택을 통해 단일 RTX 5090에서 720P·최대 16 FPS 실시간 롤아웃과 1.2초 액션-투-프레임 지연을 달성했다.
Apple-π는 400개 Orchard 영상과 Perception Formulation Deduction 3단계 프로토콜로 비디오 모델의 법 기반 물리 추론 능력을 정량적으로 평가한다.
HOMIE는 MLLM 특징을 전역 가이던스로 self-attention에 주입하고 모달리티·참조 임베딩으로 참조 결속을 보장해 인간-객체 중심 비디오 개인화 품질과 OCR 정확도를 동시에 개선했다.
SWE-Pruner Pro는 에이전트의 마지막-레이어 은닉 표현을 읽는 경량 헤드를 통해 툴 출력의 라인별 유지·제거를 예측하여 최대 39%의 토큰을 절감하면서 품질을 유지했다.
DeepSearch-Evolve는 검증 가능한 DeepSearch-World 환경과 420K 멀티홉 QA를 활용해 자기 증류 기반으로 웹 에이전트를 자가 개선하여 BrowseComp 31.2%, GAIA 61.5%, HotpotQA 93.4%를 달성했다.
EvolvingWorld는 오픈 스키마로 캐릭터 프로필과 위치·글로벌 월드 상태를 동시 추적하며 장기 서사에서 일관된 진화를 촉진하는 프레임워크와 벤치마크이다.
TimeLens2는 캡션 유도 제안과 교차 에이전트 합의로 93,232개의 고신뢰 다중스팬 라벨을 구성하고 temporal Wasserstein 보상을 도입하여 2B·4B·8B 모델이 장·다중스팬·질문형·1인칭 벤치에서 큰 성능 향상을 달성했다.