본문으로 건너뛰기

SkillOpt-Lite: 파일 중심 최소 파이프라인으로 달성한 에이전트 자기진화

SkillOpt-Lite는 롤아웃을 독립 파일로 저장해 파일 시스템 탐색·컨센서스 채굴·독립 검증 게이팅을 수행함으로써 SkillOpt보다 빠르게 수렴하고 여러 벤치에서 성능을 향상시켰다.

용어 해설

제로스 오더 최적화(Zeroth-Order Optimization)
모델의 파라미터를 직접 미분할 수 없는 상황에서 입력에 소량의 섭동을 가해 출력 변화로 유사 기울기 정보를 얻는 기법이다. 본문에서는 텍스트 편집과 실행 궤적을 수치적 섭동 대신 관찰 가능한 롤아웃 로그로 대체하여 편집 방향을 추정하는 방식으로 적용된다. 이 접근은 비연속적 텍스트 공간에서 편집 연산을 ZO 연산자(1점 추정, 중앙차분, 좌표 탐색 등)에 대응시켜 이론적 근거를 제공한다.
컨센서스 채굴(Consensus Mining)
여러 실행 궤적에서 공통으로 나타나는 실패 원인이나 패턴을 추출하여 단일 사례의 잡음성 영향력을 줄이는 절차이다. 본문에서는 배치 평균화 대신 로그 파일 단위로 실패를 집계하고 교차-태스크 불변 속성을 찾아 최소 수정 패치를 생성하는 데 핵심 역할을 한다. 이 과정은 알고리즘의 안정성 계수 β_exp를 낮춰 일반화 성능을 확보하는 데 중요하다.
독립 검증 게이팅(Validation Gating)
훈련으로 생성한 후보 스킬 편집이 통계적으로 유의미한 성능 향상을 보이는지를 독립 검증집합에서 확인한 후에만 실제 스킬에 반영하는 절차이다. 논문은 검증집합이 훈련 데이터와 엄격히 분리되어야 β_exp 항이 모델 선택 경계에서 제거된다고 수식적으로 정리한다. 이 메커니즘은 검증 편향을 방지하고 수렴 시 과적합을 억제하는 안전판 역할을 한다.
궤적 탐색(Trajectory Exploration)
에이전트가 생성한 실행 로그와 중간 계획 이유를 파일 단위로 저장한 뒤 파일 시스템 명령어로 고수준 실패 패턴을 탐색하는 절차이다. SkillOpt-Lite는 컨텍스트 윈도우에 모든 로그를 로드하는 대신 디스크 네비게이션과 선택적 파일 열람으로 고효율 진단을 수행한다. 이 방식은 대규모 모델이 빠르게 초기 탐색 단계에서 유의미한 수정을 찾아내도록 돕는다.
하니스 최적화(Harness Optimization)
스킬 문서뿐 아니라 실행을 담당하는 스크립트·도구·인터페이스 등 환경 구동 로직을 코드 수준에서 변경하여 전체 에이전트 성능을 개선하는 접근법이다. 본문에서는 파일 중심 설계로 하니스 코드도 동일한 파일 편집 루프에 포함시켜 작은 모델이 더 큰 모델을 능가하도록 만드는 사례를 제시한다. 이 절차는 안전한 샌드박스 검증과 롤백 메커니즘을 전제로 한다.

코드 예제

bash
/skillopt-loop rounds=10 batchsize=40 target=gpt5.4-nano [custom_requirements]

IDE 확장에서 SkillOpt-Lite 전체 최적화 루프를 한 줄로 실행하는 예시 명령이다. rounds와 batchsize로 반복 횟수와 배치 크기를 지정하고 대상 모델을 인자로 전달한다.

bash
/harnessopt-loop rounds=2 batchsize=40 target=gpt5.4-nano skill=best_skill_nano.md [custom_requirements]

하니스 최적화 자동화를 트리거하는 슬래시 명령 예시이며, 대상 스킬 파일과 반복 설정을 함께 전달한다. 본문 구현은 이 명령을 통해 파일 권한 완화와 샌드박스 검증을 연계한다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 03.수집 2026. 07. 09.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.