TL;DR
사람이 도구 사용법을 배우는 주요 수단인 튜토리얼 영상에는 시간순 조작, 시각적 변화, 실행 관습 같은 절차적 신호가 포함되어 있어 텍스트만으로는 포착하기 어렵다. Resource2Skill은 이러한 멀티모달 자원을 구조화된 실행 가능한 스킬로 변환해 에이전트가 필요할 때 재사용 가능한 절차적 지식을 빠르게 조회하고 조합하도록 한다. 그 결과, 여러 상용 저작 도메인에서 스킬 접근이 없는 에이전트 대비 평균 11.9포인트의 품질 개선으로 실무적 효용을 확보했다.
왜 중요한가
사람이 도구 사용법을 배우는 주요 수단인 튜토리얼 영상에는 시간순 조작, 시각적 변화, 실행 관습 같은 절차적 신호가 포함되어 있어 텍스트만으로는 포착하기 어렵다. Resource2Skill은 이러한 멀티모달 자원을 구조화된 실행 가능한 스킬로 변환해 에이전트가 필요할 때 재사용 가능한 절차적 지식을 빠르게 조회하고 조합하도록 한다. 그 결과, 여러 상용 저작 도메인에서 스킬 접근이 없는 에이전트 대비 평균 11.9포인트의 품질 개선으로 실무적 효용을 확보했다.
핵심 기여
멀티모달 리소스에서 실행 가능한 스킬을 정형화한 리소스-투-스킬 파이프라인
튜토리얼 영상, 코드 저장소, 기사, 참조 아티팩트를 입력으로 받아 핵심 프레임, 코드 시그니처, 적용 문구를 추출하는 연산자를 도입했다. 추출된 증거를 구조화된 위키 스키마(텍스트·시각·코드·메타데이터)로 정규화하고 도메인별 검증 기준으로 완전성·실행성·출처 추적성을 확보했다. 동일 연산자는 오프라인 구축뿐 아니라 테스트 시점의 온라인 스킬 채집에도 재사용되어 라이브러리의 유지·확장 비용을 낮춘다.
계층형 멀티모달 Skill Wiki 인터페이스 설계
스킬을 도메인별 분류 경로에 따라 계층화해 BM25 기반의 전처리 단계에서 관련 하위트리를 빠르게 좁힌 뒤, 언어 모델이 노출된 텍스트·시각·코드 뷰를 읽고 구성할 스킬 집합을 선택하도록 구성했다. 계층 구조는 주제별 탐색 범위를 제한하고 LM 선별은 상호보완성·실행 가능성을 판단함으로써 단순 평면 검색보다 더 적합한 조합을 산출했다. 실험에서 이 계층-후-LM 선택 전략은 다양한 도메인에서 다른 검색 방식보다 안정적인 우위를 보였다.
오프라인 구축과 온라인 갭-필링을 통합한 단일 파이프라인
같은 construction 연산자와 검증 조건을 오프라인 라이브러리 구축과 테스트 시점의 온라인 검색·증류에 모두 적용했다. 온라인 채집은 오프라인 풀이 부족한 능력 영역에 대해서만 목표 지향적 후보를 생성해 임시 풀로 노출하므로 테스트 시 컨텍스트 확장이 통제된다. 이 설계로 표준 벤치마크에서는 오프라인만으로 충분한 반면, 신규 기능 스트레스 테스트에서는 온라인 채집이 평균 21.6포인트의 대규모 향상을 가져왔다.
광범위한 도메인별 실험과 상세한 소거 연구
슬라이드(PPT), 웹, 스프레드시트(Excel), Blender, UE5, Reaper, CAD 등 7개 도메인과 네 가지 에이전트 백엔드를 대상으로 평가를 수행했다. 스킬 유무, 위키 대 평면 텍스트, 소스 믹스(동영상 포함 여부), 표현 모달리티(텍스트·시각·코드) 및 선택 전략 등 다중 소거 실험을 통해 각 설계 요소의 기여도를 분리했다. 실험 결과는 스킬 접근이 모든 모델·도메인 셀에서 성능을 높였고, 동영상 소스와 멀티모달 포맷이 특히 큰 기여를 했음을 보여주었다.
핵심 아이디어 이해하기
에이전트가 복잡한 소프트웨어 저작 작업을 성공적으로 수행하려면 단순한 사실 기반 지식보다 절차적 노하우가 핵심이다. 절차적 노하우는 작업을 분해하는 방법, 어떤 도구 호출 패턴을 사용할지, 중간 상태를 점검하는 지점, 실패 시 회복 절차 같은 실행 지침을 포함하며 이러한 정보는 모델 가중치만으로 일관되게 얻기 어렵다. 따라서 사람 제작 자원에서 절차적 신호를 추출해 재사용 가능한 단위로 보존하는 것이 필요하다.
방법론
Resource2Skill은 네 단계 파이프라인(구성, 위키 조직, 선택, 실행)으로 작동하며 구성 연산자 fθ는 도메인별 자원 풀에서 후보를 검색해 핵심 프레임, 코드 영역, 설명문을 추출한다. 추출물은 (경로, 텍스트 뷰, 시각 뷰, 코드 뷰, 메타데이터) 스키마로 정규화되고 도메인별 판정기 A𝒟가 완전성·출처 추적·중복 제거·모달리티 일관성·코드 실행 가능성을 검증해 최종 스킬 풀 Σ𝒟에 편입한다. 실행 시에는 MetaBrowse가 먼저 BM25 기반으로 계층형 토폴로지에서 후보 집합을 좁히고 언어 모델 πφ가 후보의 텍스트·시각·코드를 읽어 조합할 스킬 집합을 선택하며 선택된 코드가 있을 경우 MCP를 통해 도메인 백엔드에서 직접 실행된다.
관련 Figure

이 다이어그램은 구성 연산자 fθ와 판정기 A𝒟가 오프라인 빌드와 온라인 채집에 동일하게 사용되며 위키가 텍스트·시각·코드 뷰를 보관하는 구조적 설계를 시각화한다. 또한 MetaBrowse의 두 단계(계층형 BM25 예비선별과 LM 기반 최종선택), MCP를 통한 실행 경로, 도메인 어댑터로의 변환 흐름을 명확히 노출해 설계된 동작 흐름이 어떻게 검색·선택·적용으로 이어지는지 연결성을 제공한다. 이 그림은 방법론의 전체 구성과 각 단계에서 교체 가능한 구성 요소들을 이해하는 데 직접적인 기반을 제공한다.
Resource2Skill의 전체 파이프라인을 단계별로 정리한 다이어그램으로서 소스, 파싱·증류, 품질 게이트, 위키 구성, 에이전트 선택·실행, 도메인 어댑터와 렌더링 결과 흐름을 보여준다.
주요 결과
주요 비교에서 스킬 라이브러리를 가진 조건(w Skills)은 모든 28개의 모델-도메인 셀에서 스킬 없는 조건보다 우위였고 평균 전체 점수는 56.8% 대 45.0%로 11.9포인트의 향상이 관찰되었다. 소거 연구에서 동영상을 제외하면 평균 점수가 68.9%에서 59.4%로 크게 하락하여 영상 소스가 비대체적 기여를 했음이 확인되었다. 스킬 풀 규모를 늘릴 때 성능은 대체로 증가하며 200개 수준에서 포화에 가깝고, 오프라인 풀에 온라인 채집을 100개 추가했을 때 표준 벤치마크에서는 약 +0.7pp의 미미한 변화에 그쳤지만 신규 역량을 겨냥한 스트레스 테스트에서는 +21.6pp의 큰 개선이 관찰되었다.
관련 Figure

피규어 왼쪽은 도메인별로 Resource2Skill가 생성한 대표 아티팩트를 시각적으로 제시해 스킬이 출력 품질과 스타일 신호를 저장·재현함을 시사한다. 오른쪽 레이더 차트는 스킬 보유(w Skills), 평문 라이브러리(Flat), 스킬 미사용(w/o Skills)의 전체 점수 차이를 도메인별로 비교해 스킬의 전반적 성능 향상을 정량적으로 전달한다. 이 도표는 특히 Web과 Reaper에서의 고점수와 Blender에서의 낮은 점수 분포가 존재함을 한 눈에 드러낸다.
다양한 도메인(웹, Excel, Blender, PPT, UE5, Reaper)에서의 대표 출력 예시와 레이더형 벤치마크 점수를 함께 보여주는 피규어이다.

그래프는 0개에서 Full(전체)까지 스킬 수를 증가시킬 때 Web, Excel, Reaper, PPT, Blender 등 각 도메인의 성과가 어떻게 상승하는지를 보여주며 대부분 도메인에서 성능이 지속 상승하다가 약 200개 부근에서 포화하는 경향을 보인다. 특히 Web, Reaper, Excel 등은 비교적 높은 성능을 빨리 달성하는 반면 Blender는 낮은 초기점과 완만한 상승을 보여 도메인별로 스킬 밀도의 민감도가 다름을 시사한다. 이 결과는 스킬 풀의 규모를 실험 변수로 취급했을 때 초기 몇백 개의 스킬이 가장 큰 마진을 제공함을 정량적으로 뒷받침한다.
스킬 풀 크기에 따른 도메인별 전체 점수 변화(스킬 스케일링 그래프)를 선 그래프로 제시한 그림이다.

막대그래프는 각 도메인에서 Full 위키 구성이 가장 높은 전체 점수를 기록했음을 시각적으로 확인시켜 주며 Flat 텍스트가 w/o Skills보다 중간 성능을 제공함을 보여준다. 이 도표는 멀티모달(시각·코드) 필드의 추가가 순수 텍스트보다 평균 몇 포인트의 이득을 발생시키는지를 한 눈에 드러내어 표현 모달리티의 중요성을 보강한다. 또한 도메인별 격차는 계층 구조와 코드·시각적 그라운딩이 특히 필요한 도메인에서 더 크게 나타남을 암시한다.
위키(Full), 평문(Flat), 스킬 미사용(w/o Skills) 세 설정을 도메인별 막대그래프로 비교한 그림이다.
기술 상세
아키텍처 관점에서 스킬 항목은 계층 경로 p, 텍스트 x_text, 시각 x_visual, 코드 x_code, 메타데이터 m으로 구성된 튜플 s=(p,x_text,x_visual,x_code,m)으로 형식화되며 도메인별 분류체계 𝒯𝒟가 스킬의 토폴로지를 규정한다. 구성 연산자 fθ는 도메인별 검색 질의로 자원을 수집하고 영상에서 키 프레임, 저장소에서 코드 영역과 시그니처, 문서에서 적용 문단을 추출해 시각-텍스트-코드 증거로 매핑한 뒤 정규화 루틴으로 일관된 필드에 채운다. 검증 판정기 A𝒟는 다섯 가지 검사(완전성, 출처 추적성, 중복 제거, 모달리티 일관성, 코드 실행 가능성)를 수행해 실행 가능한 스킬만 위키에 편입하도록 하며 이 검증은 각 도메인의 실행 규약과 테스트 벤치에 맞춰 구성된다.
한계점
논문은 오프라인에 충분히 대표적인 스킬이 축적되면 온라인 채집의 평균 기여가 작아진다고 보고해 범용성의 한계를 인정했다. 오프라인 풀이 부족한 영역에서는 온라인 증류가 큰 개선을 제공하지만 이 과정은 추가 검색 비용과 임시 후보 검증 부담을 수반한다. 또한 실험에서 성능 포화는 약 200개의 균형 잡힌 스킬 수준에서 관찰되어 매우 드문 케이스를 포괄하려면 더 큰 수집·검증 비용이 필요하다는 한계가 남았다.
실무 활용
Resource2Skill의 구현 코드는 공개 저장소에 있어 실무 적용이 가능하다. 계층형 위키와 MCP 기반 실행 인터페이스로 도메인 특화 백엔드에 스킬을 직접 바인딩할 수 있어 자동화된 저작과 툴 사용 보조에 활용할 수 있다. 다만 표준 작업 범위를 넘어서는 신규 요구에 대해서는 온라인 채집을 통해 갭을 메워야 안정적인 결과를 얻을 수 있다.
- 기업 내부 교육용 튜토리얼과 영상에서 자주 쓰이는 편집·렌더링 루틴을 증류해 콘텐츠 제작 에이전트의 표준 운영 절차로 적용할 수 있다.
- 데이터 분석팀의 스프레드시트·시각화 규칙을 스킬로 구조화해 자동화된 리포트 생성 파이프라인에 연결할 수 있다.
- 게임 개발 파이프라인에서 UE5나 Blender의 반복적 장면 구성 절차를 위키화해 에이전트가 초기 씬을 신속히 생성하고 후처리를 수행하게 할 수 있다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Skill Wiki
- — 에이전트가 재사용 가능한 절차적 지식을 조회하고 조합하도록 설계된 계층형 멀티모달 데이터베이스이다. 각 항목은 구조화된 텍스트, 실행 가능한 코드, 시각적 예시, 메타데이터와 출처 정보를 포함하여 서로 다른 자원에서 보존된 절차·표현 신호를 유지한다. 검색과 LM 기반 선별을 결합해 특정 도메인 작업에 맞는 스킬을 좁혀 제공하는 것이 핵심이다.
- Resource-to-Skill
- — 튜토리얼 영상, 코드 저장소, 기사, 참조 아티팩트를 입력으로 받아 절차적 조작 단위를 추출·정규화해 스킬 항목으로 변환하는 변환 연산자이다. 시각 프레임, 코드 영역, 설명문을 분리하여 각 모달리티별로 증류하고 도메인별 검증 조건으로 완전성과 실행 가능성을 확인한다. 오프라인 구축과 필요한 경우 테스트 시점의 온라인 채집에 동일한 연산자를 재사용하도록 설계되어 확장성과 유지보수성을 확보한다.
- Multimodal Distillation
- — 긴 영상과 긴 문서를 단순 요약이 아니라 절차 신호(순서, 시각적 변화, 파라미터)를 보존하는 형식으로 압축하는 과정이다. 핵심 프레임, 코드 시그니처, 관련 설명을 추출한 뒤 구조화된 스킬 항목으로 정규화한다. 이렇게 하면 시청각·코드 정보를 동시에 활용하는 에이전트 실행이 가능해진다.
- Hierarchy-then-LM
- — 우선 도메인별 분류 경로를 이용해 후보 집합을 BM25로 좁힌 뒤, 언어 모델이 텍스트·시각·코드 뷰를 읽고 최종으로 조합할 스킬 집합을 선택하는 2단계 선택 전략이다. 계층 구조가 토픽 관련성을 유도하고 LM이 상호보완성·실행 가능성을 판단함으로써 단순 검색만으로는 놓치기 쉬운 상보적 조합을 확보한다. 실험에서 이 전략은 단일 단계의 lexical/dense 검색보다 일관된 성능 우위를 보였다.
- MCP
- — 에이전트와 도메인 어댑터가 공유하는 도구 추상화 계층으로서 브라우징·선택·적용 액션을 단일 인터페이스로 노출한다. 선택된 스킬의 코드가 있을 경우 MCP를 통해 직접 실행되며, 도메인별 적용 결과는 구조화된 응답으로 반환된다. 이 설계로 스킬 선택과 실행 사이의 언어모델 중간 번역을 제거하여 실행 신뢰도를 높인다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


