본문으로 건너뛰기

SKILL0: 스킬 내재화를 위한 인컨텍스트 에이전트 강화학습

LLM 에이전트가 외부 검색 없이도 스킬을 매개변수에 내재화하여 제로샷으로 동작하게 만드는 SKILL0 프레임워크가 제안됐다.

섹션별 상세

01
추론 시점의 스킬 증강 방식은 검색 노이즈로 인한 무관한 가이드 유입과 과도한 토큰 소모라는 근본적인 한계를 지닌다. 모델이 지식을 실제로 습득하지 못하고 단순히 따르기만 하는 구조적 문제를 해결하기 위해 스킬 내재화 개념이 도입됐다.
02
SKILL0는 학습 시점에 전체 스킬 컨텍스트를 제공한 뒤 이를 점진적으로 철회하는 훈련 커리큘럼을 제안한다. 오프라인에서 카테고리별로 그룹화된 스킬과 상호작용 이력을 압축된 시각적 컨텍스트로 변환하여 모델에게 도구 사용법을 교육한다.
03
동적 커리큘럼은 각 스킬 파일의 온폴리시 도움 정도를 평가하여 유효한 스킬만 선별적으로 유지한다. 선형적으로 감소하는 예산 범위 내에서 모델이 외부 도움 없이도 스스로 판단하고 행동할 수 있는 제로샷 환경에 도달하도록 설계됐다.
04
ALFWorld와 Search-QA 벤치마크에서 기존 강화학습 베이스라인 대비 각각 9.7%와 6.6%의 유의미한 성능 향상을 달성했다. 특히 추론 시 단계당 토큰 사용량을 500개 미만으로 획기적으로 줄여 운영 효율성을 극대화했다.

용어 해설

스킬 내재화(Skill Internalization)
외부 지식을 모델의 매개변수에 직접 학습시켜 저장하는 기술이다. 추론 시 별도의 검색 없이도 모델이 특정 도구나 절차를 즉시 실행할 수 있게 하여 지연 시간과 비용을 획기적으로 줄이는 데 기여하며, 모델이 지식을 단순히 따르는 것이 아니라 완전히 습득하게 한다.
인컨텍스트 강화학습(In-Context Reinforcement Learning)
모델의 컨텍스트 윈도우 내에 제공된 정보와 보상을 바탕으로 에이전트의 행동을 최적화하는 기법이다. 실시간 피드백을 통해 모델이 환경에 적응하고 더 나은 의사결정을 내리도록 돕는 과정에서 모델의 추론 능력을 강화하는 중요한 역할을 한다.
커리큘럼 학습(Curriculum Learning)
학습 데이터를 난이도나 복잡도에 따라 순차적으로 배치하여 학습 효율을 높이는 전략이다. 기초적인 개념부터 복잡한 스킬까지 단계적으로 학습시켜 모델의 수렴 속도를 높이고 최종적인 일반화 성능을 개선하는 데 핵심적인 방법론으로 활용된다.
제로샷 행동(Zero-Shot Behavior)
모델이 이전에 본 적 없는 작업이나 상황에 대해 추가적인 학습이나 예시 없이 즉각적으로 올바른 반응을 보이는 능력이다. 이는 모델의 내재된 지식 수준을 나타내는 척도로 활용되며, 실제 서비스 적용 시 다양한 사용자 요청에 유연하게 대응할 수 있는 기반이 된다.
토큰 오버헤드(Token Overhead)
LLM 입력 시 필수 정보 외에 추가로 소모되는 토큰 양을 의미한다. 긴 컨텍스트나 반복적인 검색 결과 주입은 API 비용 상승과 처리 속도 저하를 유발하는 주요 원인이 되므로, 이를 최소화하는 것이 프로덕션 환경에서의 효율성 확보에 필수적이다.

기술

  • SKILL0
  • Reinforcement Learning
  • ALFWorld
  • Search-QA

활용 사례

  • 자율 AI 에이전트
  • 실시간 도구 호출 시스템
  • 저지연 챗봇 서비스
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 02.수집 2026. 04. 04.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.