microsoft/SkillOpt
Python5 / 0
스킬 문서를 편집 가능한 학습 상태로 취급해 검증 기반 편집 루프와 학습률 예산으로 재사용 가능한 best_skill.md를 생성하는 프레임워크이다.
TL;DR
에이전트 스킬을 문서 형식의 학습 가능한 상태로 간주해 편집 제안과 검증 게이트로 반복 최적화하는 도구이다. 별도 optimizer 모델이 롤아웃 점수를 기반으로 add/delete/replace 편집을 생성하고 검증 집합에서 성능이 엄격히 개선될 때만 후보를 수용하는 구조로 안정적인 업데이트를 보장한다. 이 방식은 배포 시 추가 추론 호출을 요구하지 않는 경량의 best_skill.md 아티팩트를 산출하며 README에 따르면 여러 벤치마크와 실행 허니스에서 평균 수십 포인트 단위의 성능 향상이 보고되었다. 단점으로는 백엔드별 API 설정과 검증 집합 구성 등 실험 인프라가 필요해 초기 도입 비용이 존재한다, 그러나 멀티백엔드 플러그인과 WebUI가 제공되어 확장과 실험 재현이 용이하다.
핵심 포인트
- 모델 가중치를 변경하지 않고 텍스트 편집만으로 스킬을 훈련하는 점이 핵심 차별화 요소이다. 이 접근은 배포 시 별도 추론 호출이나 모델 변경을 요구하지 않아 운영 리스크를 낮춘다. 따라서 여러 실행 허니스와 모델 스케일로의 전이가 용이하다.
- 편집 수용에 엄격한 검증 게이트와 거부 버퍼를 결합해 안정적인 성능 향상을 보장하는 학습 프로세스를 사용한다. 이 구조는 무분별한 자동 수정으로 인한 성능 저하를 방지하며 에폭 단위로 보수적 업데이트를 수행할 수 있게 한다. 그 결과 실험 간 재현성과 안전성이 향상된다.
- 멀티 백엔드 플러그인 구조로 다양한 채팅 및 실행 대상(OpenAI, Claude, Qwen, Codex 등)에 연결할 수 있도록 설계되어 확장성이 높다. README의 백엔드 추가 가이드를 통해 새로운 실행 대상을 모듈로 추가할 수 있으며 이는 생태계 통합을 촉진한다. 또한 WebUI와 벤치마크 통합을 통해 실험을 손쉽게 모니터링할 수 있다.
- 스킬 문서를 rollouts의 점수에 따라 add/delete/replace 편집으로 변환해 반복적으로 최적화할 수 있다. 이 과정은 별도 최적화 모델이 편집을 제안하고 검증 게이트가 엄격히 개선을 확인한 경우에만 수용하는 구조를 따른다. 배포 시에는 추가 추론 호출이 필요하지 않아 운영 비용을 증가시키지 않는다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| GPT-5.5 direct chat average lift | accuracy points | +23.5 | vs no-skill baseline |
| GPT-5.5 inside Codex agentic loop average lift | accuracy points | +24.8 | vs no-skill baseline |
| GPT-5.5 inside Claude Code average lift | accuracy points | +19.1 | vs no-skill baseline |
14.5k
STARS
1.3k
FORKS
+212
TRENDING
5
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.