왜 중요한가
LLM agent의 skill library가 커지면 매번 전체 skill package를 불러오는 방식으로는 제한된 context budget 안에서 실행에 필요한 절차를 정확히 선택하기 어렵습니다. SkillZip은 반복 절차를 section-level graph와 계약 보존 매크로로 저장하고, 필요한 의존성과 검증기만 단계적으로 hydrate해 이 단위 불일치를 해결합니다. SkillsBench와 ALFWorld에서 SkillDAG보다 최대 12.2 points 높은 성능을 기록하면서 압축률 3.46 ×, dependency preservation 99.2%, verifier reachability 98.7%를 함께 달성했다는 점에서 효율과 실행 가능성을 동시에 측정한 접근입니다.
관련 Figure

그림은 동일한 spreadsheet 작업에서 전체 skill package를 불러오거나 텍스트로만 줄이면 재사용 단위와 실행 계약이 어긋나는 과정을 왼쪽의 세 실패 사례로 배치합니다. 아래의 SkillZip workflow는 section-level unit, contract preservation, execution-aware maintenance를 하나의 unified procedural graph로 묶고, PathHydrate·MotifZip·ReZip을 통해 필요한 절차를 선택·압축·유지하는 흐름을 나타냅니다.
기존 whole-skill·text compression·task-time graph 방식의 한계와 SkillZip의 section-level unified graph workflow를 비교한 도식입니다.
핵심 기여
섹션 수준 절차 그래프 구축
Sec2Graph가 skill package를 Intent, Input, Operation, Verifier, Output 등 실행 역할을 가진 source-grounded section node로 분해합니다. 각 노드는 typed I/O, 자원, guard, verifier 조건과 원본 위치를 함께 보존하고 의존성·복구·검증 edge로 연결됩니다. 이에 따라 whole-skill 단위에 가려졌던 공통 절차를 개별 occurrence와 source provenance를 유지한 채 재사용할 수 있습니다.
계약을 보존하는 그래프 압축
MotifZip은 역할, 자원, I/O 형태가 호환되는 반복 subgraph를 찾은 뒤 boundary signature, dependency closure, verifier reachability가 유지될 때만 ported macro로 치환합니다. 매크로는 이름만 남기는 요약이 아니라 포트, 실행 계약, 검증 hook, occurrence mapping, 원본 확장 규칙을 저장합니다. 따라서 압축과 source-level expansion이 서로 역변환으로 연결됩니다.
예산 기반 실행 문맥 구성
PathHydrate는 질의를 goal, output, capability, input, subgoal로 바꾸고 section·skill 수준 검색을 결합해 실행 단서를 모읍니다. 이후 anchor coverage, dependency closure, verifier reachability, token budget을 만족하는 연결 subgraph를 찾고 매크로를 name, contract, outline, full source 중 가장 낮은 충분한 수준으로 렌더링합니다. 필요한 입력이나 검증 조건이 노출되지 않으면 해당 매크로만 확장해 불필요한 절차 텍스트를 피합니다.
실행 증거를 이용한 증분 유지보수
ReZip은 새 skill을 기존 매크로와 typed port 및 계약으로 대조하고, 호환되지 않은 잔여 subgraph가 반복되며 압축 이득과 계약 검증을 만족할 때 새 매크로로 승격합니다. 실행 trace에서 확장 빈도, verifier failure, downstream repair cost를 수집해 위험한 매크로의 hydration 수준을 높입니다. 위험이 지속되면 더 좁은 규칙으로 분할하거나 원본 section으로 되돌립니다.
핵심 아이디어 이해하기
일반적인 LLM agent는 외부 skill package에서 작업 절차를 읽고 도구를 호출합니다. 기존 방식은 package 전체를 검색 단위로 취급하므로 Clean CSV와 Pivot Table처럼 일부 loading routine을 공유하는 skill이 함께 선택될 때 실제 작업과 무관한 downstream operation까지 문맥에 들어갑니다. 또한 텍스트를 짧게 만드는 것만으로는 precondition, dependency, verifier 같은 실행 조건이 남아 있는지 알기 어렵습니다.
SkillZip은 skill을 하나의 긴 텍스트가 아니라 실행 역할을 가진 section node와 typed dependency edge의 그래프로 바꿉니다. Sec2Graph가 원본의 Intent, Input, Operation, Verifier, Output을 노드로 만들고, 각 노드에 입력·출력·자원·guard·원본 위치를 붙입니다. 그러면 검색 결과가 whole package가 아니라 query에 필요한 실행 완료 subgraph가 되며, 공통 routine은 여러 skill occurrence 사이에서 연결할 수 있습니다.
반복 subgraph를 그대로 하나의 요약 문장으로 줄이면 외부 입력이나 검증 경로가 끊길 수 있습니다. MotifZip은 먼저 같은 role signature와 I/O·resource 형태를 가진 후보를 찾고, 외부 포트가 안정적이며 내부 의존성이 닫히고 모든 상태 변경 연산에서 verifier로 가는 경로가 남을 때만 macro로 치환합니다. macro에는 원본 section과 연결되는 expansion rule이 있으므로 문맥이 부족하면 압축 노드를 다시 세부 절차로 펼칠 수 있습니다.
PathHydrate는 현재 질의를 graph anchor로 바꾼 뒤 필요한 연결 subgraph만 선택하고, 매크로를 name에서 full source까지 최소 수준으로 렌더링합니다. ReZip은 새 skill과 execution trace를 입력으로 받아 반복되는 잔여 절차를 추가하고, 확장이나 검증 실패가 잦은 macro를 더 자세히 노출하거나 분할합니다. 결과적으로 검색, 압축, 실행 그래프가 서로 다른 단위를 다루던 구조가 계약을 가진 section subgraph 중심으로 통합됩니다.
방법론
Sec2Graph는 각 skill package를 headings, lists, code blocks, warnings, argument descriptions, tool references, tests 같은 경계 단서로 나누고 각 조각에 실행 역할을 부여합니다. 모델 보조 parser가 불완전한 경계를 다듬을 때에도 source pointer를 유지하며, typed I/O와 resources는 interface에, guards와 verifier conditions는 execution·verification 정보에 기록합니다. 이후 weak-order, dependency, resource, verifier, repair edge를 연결해 intent 또는 trigger에서 verified output까지 이어지는 source-grounded procedural subgraph를 만듭니다.
MotifZip은 전체 그래프에서 임의의 텍스트 유사도를 비교하지 않고 role signature, resource family, I/O shape가 맞는 bucket에서 후보를 성장시킵니다. 후보 occurrence를 원본 그래프에 다시 대응시키고 내부 노드가 겹치거나 외부 port 연결이 충돌하는 경우를 제외한 뒤, interface 안정성·execution closure·verifier reachability를 검사합니다. 통과한 motif는 typed port와 expansion mapping을 가진 macro production rule이 되며, 압축 이득에서 reuse benefit을 더하고 boundary cut과 risk를 빼는 점수로 선택됩니다.
PathHydrate는 질의와 subgoal을 embedding으로 section에 매칭하고, skill description ranking과 best-section ranking을 reciprocal-rank fusion으로 결합합니다. 선택된 seed에서 anchor coverage, dependency closure, verifier reachability를 만족하는 연결 subgraph를 탐색하며, 부족한 Input·Precondition·Resource는 뒤로 거슬러 복원하고 Failure·Verifier·Output은 앞으로 따라가며 채웁니다. 이후 token budget 안에서 macro를 name, contract, outline, full source 중 최저 충분 수준으로 렌더링하고 hydration log에 선택 노드, 확장, 비용, 검증 범위를 남깁니다.
ReZip은 새 skill을 Sec2Graph로 변환한 뒤 기존 macro와 typed port 및 세 가지 계약 측면으로 대조합니다. 일치하는 영역은 occurrence-specific source map과 함께 재사용하고, 잔여 motif가 여러 source skill에서 반복되며 compression gain과 계약 검사를 통과하면 macro dictionary에 추가합니다. 실행 trace에서 macro 사용·확장 횟수, verifier failure, repair cost를 계산해 위험이 커진 매크로의 hydration을 높이고, 지속적인 문제에는 분할 또는 폐기를 적용합니다.
관련 Figure

상단 Sec2Graph는 skill package를 section grounding과 contract extraction을 거쳐 procedural subgraph와 unified graph로 변환합니다. 중단 MotifZip은 motif mining과 contract validation 뒤 macro dictionary를 만들고, 하단 PathHydrate는 query task에서 budgeted executable context를 구성하며, 오른쪽 ReZip은 새 skill과 execution trace를 받아 기존 macro를 재사용하거나 maintenance를 갱신합니다.
Sec2Graph, MotifZip, PathHydrate, ReZip이 section graph를 만들고 압축 문맥과 증분 유지보수로 연결되는 전체 처리 구조입니다.
주요 결과
SkillsBench와 ALFWorld에서 SkillZip은 MiniMax-M2.7과 gpt-5.2-codex 모두에서 비교 가능한 방법 중 가장 높은 결과를 기록했습니다. MiniMax-M2.7에서는 SkillsBench reward 33.3으로 SkillDAG보다 6.0 points 높았고, ALFWorld episode success rate는 79.3으로 12.2 points 높았습니다. gpt-5.2-codex에서는 SkillsBench 43.0과 ALFWorld 96.4를 기록해 SkillDAG보다 각각 6.2와 2.8 points 높았습니다.
검색 품질에서도 section-level retrieval의 효과가 확인됩니다. MiniMax-M2.7 SkillsBench에서 Ret@1은 SkillDAG의 66.7에서 73.6으로, Ret@5는 78.2에서 92.0으로 상승했고 MRR은 10.0 points 높아졌습니다. ALFWorld Ret@1 개선 폭은 MiniMax-M2.7에서 27.8, gpt-5.2-codex에서 30.3이었으며, library 규모가 200에서 100K skills로 늘어날 때 SkillDAG 대비 Ret@1 격차도 6.2에서 23.3으로 커졌습니다.
압축 실험에서 SkillZip은 3.46 × compression ratio, 1,941 average rendered tokens, DPR 99.2, VR 98.7을 기록했습니다. 같은 압축률의 text compression은 DPR 65.0, VR 60.0, recovery 45.0%였지만 SkillZip의 recovery는 14.8%였고 reward는 33.3으로 text compression보다 7.8 높았습니다. SkillZip은 raw section graph의 reward 31.0보다 높은 결과를 유지하면서 dependency와 verifier 구조를 거의 보존했습니다.
구성요소 제거 실험에서는 section-level node를 없앨 때 Ret@1이 73.6에서 66.7로, reward가 33.3에서 27.9로 하락하고 context가 3,103 tokens로 늘었습니다. dependency closure를 제거하면 DPR이 82.3으로, verifier constraint를 제거하면 VR이 76.4로 낮아져 검색 정확도만으로 실행 안전성을 확보할 수 없음을 확인했습니다. adaptive hydration을 끄면 DPR과 VR은 유지되지만 token 사용량이 2,587로 늘었고, 전체적으로 PathHydrate는 top-5 whole-skill loading보다 task당 context를 72.1% 줄였습니다.
기술 상세
SkillZip의 기본 그래프는 occurrence-specific section node와 canonical prototype를 함께 가지며, 전체 edge는 dependency, skill membership, resource, equivalence 관계로 구성됩니다. section node는 실행 역할 τ, content c, input·output signature X와 Y, resource R, guard·verifier 조건 G, source pointer를 저장하고, dependency edge는 Requires, Binds, UsesResource, Verifies, Repairs 같은 typed relation을 가집니다. skill subgraph는 intent 또는 trigger root에서 verified output까지 필요한 역할을 연결하며, macro는 경계 입력 I와 출력 O를 가진 형태의 reversible rewrite로 저장됩니다.
MotifZip의 후보는 role signature·resource family·I/O shape가 맞는 영역에서 dependency와 weak-order edge를 따라 성장합니다. 후보 motif 의 선택 점수는 반복 빈도에 따른 description-length gain에 Reuse(g)를 더하고 Cut(g)과 Risk(g)를 빼는 구조이며, freq(g)는 충돌하지 않는 occurrence 수를 뜻합니다. 매크로를 적용할 때 내부 노드만 제거하고 외부 edge는 typed port map으로 다시 연결하므로, 원본 expansion에서 dependency와 operation-to-verifier path를 복원할 수 있습니다.
PathHydrate는 질의에서 goal, expected output, required capability, visible input, executor profile, ordered subgoal을 추출합니다. section node v와 subgoal dᵢ 및 raw query q의 점수는 두 embedding cosine similarity 중 큰 값인 로 계산하며, subgoal view는 capability·output matching을, raw-query view는 이름·resource·entity 보존을 담당합니다. 선택 과정은 budget 안에서 anchor coverage, dependency closure, verifier reachability를 만족하는 연결 subgraph를 찾고, 필요할 때 backward와 forward scaffold repair를 수행하는 순서입니다.
ReZip은 새 skill을 기존 macro와 대조해 호환 영역을 즉시 재사용하고, 잔여 motif가 최소 cross-skill support m 이상이며 compression gain이 양수이고 Validχ(r)=1일 때만 새 매크로로 승격합니다. 실행 중 macro M의 risk는 expansion 비율, verifier failure 비율, repair cost를 가중합한 ρₜ(M)으로 계산하며, 위험 threshold를 넘으면 먼저 hydration detail을 높입니다. 문제가 계속되면 macro를 더 좁은 계약 단위로 나누거나 source section으로 되돌려 압축 구조와 실행 증거를 연결합니다.
한계점
논문은 macro의 구조적 lifting이 기록된 interface, dependency, verifier path, source provenance를 복원한다는 점을 보장하지만, 기록되지 않은 동작의 의미적 동등성이나 verifier 자체의 정확성까지 보장하지는 않습니다. 계약 추출 품질에도 의존하며, 별도 평가에서 contract extraction은 macro-F1 91.6과 exact match 84.6을 기록했습니다. 또한 MotifZip의 충돌 인식 greedy rewriting은 대규모 library에서 tractable하게 동작하지만 겹치는 모든 motif에 대한 전역 최적성을 주장하지 않습니다.
실무 활용
SkillZip은 지시문, 도구, 검증 규칙이 여러 skill package에 반복되는 LLM agent library에서 실행 문맥을 줄이는 procedural-memory layer로 사용할 수 있습니다. 원본 section과 verifier 경로를 유지한 그래프를 미리 만들고 질의 시 필요한 subgraph만 hydrate하므로 장기 작업에서 중복 문맥과 유사 skill 간 혼동을 함께 줄이는 구성이 가능합니다.
- 스프레드시트 정리처럼 공통 입력·검증 절차와 skill별 후속 작업이 섞인 agent workflow
- 기술 작업과 embodied agent benchmark에서 여러 skill package를 선택해야 하는 task-time retrieval
- 새 skill과 실행 trace가 계속 추가되는 절차적 skill library의 macro dictionary 유지보수
코드 공개 여부: 미확인
키워드
용어 해설
- 절차적 메모리(Procedural Memory)
- — 에이전트가 사실 정보가 아니라 작업 절차와 실행 순서를 외부에 저장하고 필요할 때 불러오는 구조입니다. SkillZip에서는 지시문, 도구, 검증 규칙을 재사용 가능한 section-level graph로 표현해 추론 시 실행 가능한 문맥을 구성하는 기반으로 사용합니다.
- 절차적 계약(Procedural Contract)
- — 절차가 어떤 입력과 출력을 사용하고, 어떤 전제조건과 의존성을 거쳐 실행되며, 어떤 검증기로 결과를 확인하는지 나타내는 명세입니다. SkillZip은 interface, execution, verification의 세 측면을 압축 전후에 유지해 안전한 재사용을 보장합니다.
- 의존성 폐쇄(Dependency Closure)
- — 선택한 작업을 실행하는 데 필요한 입력, 전제조건, 자원, 연산이 누락되지 않도록 관련 의존성을 함께 포함하는 조건입니다. PathHydrate는 압축 그래프에서 필요한 연결부를 복원해 독립적으로 실행 가능한 문맥을 구성합니다.
- 검증기 도달성(Verifier Reachability)
- — 상태를 바꾸는 모든 연산에서 적어도 하나의 검증기까지 유향 경로가 이어지는지를 나타내는 조건입니다. 이 경로가 유지되어야 압축된 매크로나 section subgraph가 실행 뒤 결과 확인 절차를 잃지 않습니다.
- 포트 매크로(Ported Macro)
- — 반복되는 section-level subgraph를 외부 입력·출력 포트와 함께 하나의 노드로 치환한 구조입니다. 내부 의존성과 검증 경로, 원본 section으로 돌아가는 expansion rule을 보존하므로 필요한 순간 전체 절차를 다시 펼칠 수 있습니다.
- 섹션 수준 그래프(Section-Level Graph)
- — 하나의 skill package를 Intent, Input, Operation, Verifier, Output 같은 실행 역할별 노드로 나누고 의존성·자원·검증 관계를 연결한 그래프입니다. whole-skill retrieval보다 작은 실행 완료 단위를 선택할 수 있어 겹치는 스킬 사이의 중복 문맥을 줄입니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.