pathwaycom/arc-task-gen
Python0 / 0
공개 세트와 닮은 ARC-AGI-1 새 과제를 생성해 모델 평가에 쓰는 Python 도구
TL;DR
이 저장소는 공개 ARC-AGI-1 과제와 비슷한 새 문제를 생성하는 독립 실행형 Python 연구용 데이터셋 도구입니다. 생성 결과는 train과 test 배열을 갖춘 표준 tasks.json이어서 기존 ARC 평가 하네스에 바로 연결할 수 있습니다. 공개 과제에 대한 모델의 사전 친숙도와 few-shot 규칙 추론을 분리해 평가하려는 경우 유용합니다. README에는 BDH-CQ의 150M-parameter configuration이 pass@2 29.5%와 작업당 $0.0007 비용을 기록했다는 수치가 포함돼 있습니다.
핵심 포인트
- 이 저장소는 독립 실행형 Python 연구용 데이터셋 생성 도구입니다. 공개 ARC-AGI-1 평가 세트와 분포가 비슷한 새 과제를 만듭니다. 특정 프레임워크 플러그인이나 MCP 서버가 아니어서 기존 ARC 평가 하네스에 연결해 쓰는 용도입니다.
- arc-task-gen은 공개 데이터셋의 특성을 맞춘 ARC-AGI-1 스타일 문제를 새로 생성합니다. 결과는 표준 ARC 형식의 tasks.json으로 저장되며 train과 test 배열을 포함합니다. 기존 ARC evaluation harness에서 읽을 수 있어 공개 과제의 사전 친숙도 영향을 줄이는 데 쓰입니다.
- README는 BDH-CQ의 recurrent memory와 continuous latent space 기반 iterative reasoning을 평가 대상으로 둡니다. 150M-parameter configuration은 공개 ARC-AGI-1 평가 세트에서 pass@2 29.5%를 기록했습니다. 새로 생성한 비공개 평가 세트와 공개 세트 결과를 함께 비교하려는 연구에 적합합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| ARC-AGI-1 public evaluation set | pass@2 | 29.5% | 150M-parameter BDH-CQ configuration의 README 공개 수치 |
| ARC-AGI-1 task inference | cost per task | $0.0007 | GPT-5.6 Luna (Low)보다 작업당 11배 저렴하다는 README 공개 수치 |
이미지 분석

3.2k
Stars
17
Forks
+205
Trending
0
조회수
3.2k watchers1 open issuesMIT License
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.