AREX-Skill의 기본 단위 Skill은 S=(SKILL.md,references/,scripts/)로 구성됩니다. SKILL.md는 선행 로드되는 Knowledge Interface로 목적·핵심 개념·Tool 사용법·Pointer·Example·Failure Mode를 담습니다. references/는 API 문서·Algorithm 세부사항·Parameter Configuration을 필요할 때 제공하고, scripts/는 정의된 입력과 출력을 가진 실행 Wrapper로 반복 구현을 줄입니다. 입력은 Agent의 Task와 현재 단계이고, 처리 과정은 SKILL.md의 조건에 맞는 Reference와 Script를 선택하는 것이며, 출력은 실행 결과나 다음 절차입니다.
하나의 Source에서 나온 Skill은 Graph G=(S,L)로 묶입니다. S는 개별 Skill 집합이고 L은 Skill 사이의 Routing·Dependency·Composition Link입니다. Entry Skill이 Source 범위와 사용 목적을 알려주면 Agent는 Task에 필요한 링크만 따라갑니다. 예를 들어 Setup Skill의 출력이 Evaluation Skill의 입력이 되고, 실패 시 Diagnosis 또는 Repair Skill로 이동하는 방식입니다. 전체 Graph를 한 번에 읽지 않으므로 현재 Context에는 선택된 Branch만 남습니다.
증류의 입력은 Repository·Paper·Task 중 하나인 Anchor와 그 Anchor에서 접근 가능한 선언적 자료입니다. Scope는 Source Understanding와 Capability Identification 또는 Task Decomposition와 Capability Gap Analysis로 필요한 범위를 정합니다. Ground는 자료를 Capability별 근거로 매핑하고, Construct는 실행 가능한 부분을 안정된 Interface로 감싸며, Verify는 Assertion-backed Case와 Repository-native 검사를 통해 Candidate를 Accepted Graph로 바꿉니다. 검사를 통과하지 못한 내용은 숨기지 않고 Construction Record R에 Evidence·Check·미해결 Gap으로 남깁니다.
Repository Collection은 GPT-5.5와 GPT-5.6-sol, xhigh reasoning effort로 구성됐고 Repository당 평균 할당 비용은 약 $40였습니다. 근거 범위는 Source Code, Documentation, Examples, Tests, Scripts, Configuration이며, Graph는 Data Preparation·Training·Inference·Evaluation·Serving·Troubleshooting·Maintenance Workflow로 분해됩니다. 최종 5,353개 Skill은 1,000개 Repository Graph에 배치됐고, 20개 Area와 178개 Capability Family 사이에 2,209개의 정확한 할당이 기록됐습니다.
실험에서는 Codex를 Harness로 사용하고 GPT-5.5 Backbone과 xhigh reasoning effort를 고정했습니다. Skill 생성 예산과 Downstream 실행 예산을 분리하고, with-skills와 without-skills 조건에서 실행 예산을 맞췄습니다. PaperBench는 153개 Source Paper에서 636개 Paper-derived Skill을 만들었고, MLE-bench는 75개 Competition별 Graph, FrontierCS는 188개 Task에 공통인 Recovery Graph, PassNet은 FX-Graph 검사·Pattern Matching·Semantics-preserving Rewrite·Triton 구현·Performance Diagnosis를 포함한 Benchmark-level Graph를 사용했습니다.