본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

pathwaycom/arc-task-gen

Python0 / 0

공개 세트와 닮은 ARC-AGI-1 새 과제를 생성해 모델 평가에 쓰는 Python 도구

TL;DR

이 저장소는 공개 ARC-AGI-1 과제와 비슷한 새 문제를 생성하는 독립 실행형 Python 연구용 데이터셋 도구입니다. 생성 결과는 train과 test 배열을 갖춘 표준 tasks.json이어서 기존 ARC 평가 하네스에 바로 연결할 수 있습니다. 공개 과제에 대한 모델의 사전 친숙도와 few-shot 규칙 추론을 분리해 평가하려는 경우 유용합니다. README에는 BDH-CQ의 150M-parameter configuration이 pass@2 29.5%와 작업당 $0.0007 비용을 기록했다는 수치가 포함돼 있습니다.

핵심 포인트

  • 이 저장소는 독립 실행형 Python 연구용 데이터셋 생성 도구입니다. 공개 ARC-AGI-1 평가 세트와 분포가 비슷한 새 과제를 만듭니다. 특정 프레임워크 플러그인이나 MCP 서버가 아니어서 기존 ARC 평가 하네스에 연결해 쓰는 용도입니다.
  • arc-task-gen은 공개 데이터셋의 특성을 맞춘 ARC-AGI-1 스타일 문제를 새로 생성합니다. 결과는 표준 ARC 형식의 tasks.json으로 저장되며 train과 test 배열을 포함합니다. 기존 ARC evaluation harness에서 읽을 수 있어 공개 과제의 사전 친숙도 영향을 줄이는 데 쓰입니다.
  • README는 BDH-CQ의 recurrent memory와 continuous latent space 기반 iterative reasoning을 평가 대상으로 둡니다. 150M-parameter configuration은 공개 ARC-AGI-1 평가 세트에서 pass@2 29.5%를 기록했습니다. 새로 생성한 비공개 평가 세트와 공개 세트 결과를 함께 비교하려는 연구에 적합합니다.

벤치마크

벤치마크지표비교
ARC-AGI-1 public evaluation setpass@229.5%150M-parameter BDH-CQ configuration의 README 공개 수치
ARC-AGI-1 task inferencecost per task$0.0007GPT-5.6 Luna (Low)보다 작업당 11배 저렴하다는 README 공개 수치

이미지 분석

ARC-AGI-1 pass@2 점수와 작업당 비용을 로그 축으로 비교한 효율성 프런티어 차트입니다.
차트의 가로축은 작업당 비용, 세로축은 ARC-AGI-1 pass@2 점수이며, 왼쪽 아래의 보라색 BDH-CQ 점들이 Low·Medium·High 설정을 구분합니다. BDH-CQ (High)는 29.5%와 작업당 $0.0007 지점에 배치되고, 점선은 Pre-BDH-CQ Pareto frontier를 나타내어 낮은 비용 구간의 비교 맥락을 제공합니다.

3.2k

Stars

17

Forks

+205

Trending

0

조회수

3.2k watchers1 open issuesMIT License

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.