본문으로 건너뛰기

ALTK-Evolve: AI 에이전트를 위한 온더잡 러닝 시스템

ALTK-Evolve는 AI 에이전트의 실행 로그를 분석해 범용적인 가이드라인을 추출하고 이를 장기 기억으로 활용하여 복잡한 작업의 성공률을 높이는 시스템이다.

섹션별 상세

AI 에이전트가 과거의 경험으로부터 일반화된 원칙을 배우지 못하고 단순 반복에 그치는 문제를 해결하고자 한다. 에이전트가 단순히 어제의 로그를 다시 읽는 것이 아니라, '산도가 지방의 맛을 잡아준다'와 같은 추상화된 전략을 습득하도록 설계됐다.
에이전트가 자산 로그를 진단하고 유지보수하는 과정을 시각화한 이미지
Infographic에이전트가 실제 산업 현장에서 진단, 유지보수, 업데이트 등의 작업을 수행하며 학습하는 시나리오를 묘사합니다. 이는 ALTK-Evolve가 단순 텍스트 처리를 넘어 실질적인 업무 환경에 적용될 수 있음을 시각적으로 전달합니다.
상호작용 레이어에서 궤적을 캡처하고 추출기가 구조적 패턴을 발굴하여 후보 엔티티로 저장하는 하향식 흐름을 가진다. Langfuse나 Arize Phoenix와 같은 OpenTelemetry 기반 도구를 활용하여 에이전트의 생각과 도구 호출 결과를 정밀하게 추적한다.
ALTK-Evolve의 4계층 아키텍처 다이어그램
Diagram애플리케이션, 상호작용, 처리, 영속성 레이어로 구성된 시스템 구조를 보여줍니다. 에이전트의 로그가 추출 및 정제 과정을 거쳐 엔티티 DB에 저장되고, 다시 MCP 서버를 통해 에이전트에게 주입되는 데이터 흐름을 상세히 설명합니다.
배경 작업으로 중복된 규칙을 병합하고 약한 규칙을 제거하며 검증된 전략을 강화하는 정제 과정을 거친다. 이를 통해 가이드라인, 정책, 표준 운영 절차(SOP)로 구성된 고품질 엔티티 라이브러리가 지속적으로 진화한다.
bash
claude plugin marketplace add AgentToolkit/altk-evolve
claude plugin install evolve@evolve-marketplace

Claude Code에 ALTK-Evolve 플러그인을 설치하여 에이전트 학습 기능을 추가하는 명령어

AppWorld 벤치마크의 어려운(Hard) 작업군에서 기준 모델 대비 성공률이 19.1%에서 33.3%로 14.2%p 상승했다. 이는 가이드라인이 복잡한 제어 흐름을 탐색하는 데 결정적인 도움을 주었음을 시사하며, 전체적인 일관성 지표인 SGC도 8.9%p 개선됐다.
근거
  • 어려운(Hard) 작업에서 성공률이 19.1%에서 33.3%로 14.2% 향상됐다. Results: better reliability 섹션의 결과 표
  • SGC(Scenario Goal Completion) 지표가 전체적으로 8.9% 개선됐다. Results: better reliability 섹션의 결과 표 Aggregate 행
Claude Code와 같은 도구에 플러그인 형태로 즉시 설치하거나 ReAct 에이전트에 코드 한 줄로 통합할 수 있는 유연성을 제공한다. MCP(Model Context Protocol)를 통해 도구 호출 전후로 가이드라인을 조회하고 실행 결과를 저장하는 긴밀한 학습 루프를 구현했다.

용어 해설

에이전트 궤적(Agent Trajectories)
AI 에이전트가 작업을 수행하는 동안 발생한 사용자 발화, 사고 과정, 도구 호출 및 결과의 전체 기록이다. 단순 로그를 넘어 에이전트의 의사결정 맥락을 파악하는 핵심 데이터로 활용된다.
일화적 메모리(Episodic Memory)
에이전트가 과거에 경험한 특정 사건이나 상호작용의 세부 사항을 저장하고 회상하는 장기 기억 시스템이다. 이를 통해 에이전트는 과거의 실수를 반복하지 않고 유사한 상황에서 더 나은 판단을 내릴 수 있다.
모델 컨텍스트 프로토콜(Model Context Protocol)
AI 모델이 외부 도구나 데이터 소스와 표준화된 방식으로 통신할 수 있게 해주는 프로토콜이다. 에이전트가 필요한 가이드라인을 적시에 조회하거나 실행 결과를 저장하는 통로 역할을 한다.
시나리오 목표 완료율(Scenario Goal Completion)
다양한 변형 시나리오 전체에서 에이전트가 일관되게 성공했는지를 측정하는 엄격한 성능 지표이다. 단순 성공률보다 에이전트의 신뢰성과 견고함을 더 정확하게 평가할 수 있다.

기술

  • Claude Code
  • Langfuse
  • Arize Phoenix
  • LiteLLM
  • OpenAI
  • Hugging Face agents
  • MCP

활용 사례

  • 엔터프라이즈 API 오케스트레이션
  • 자율 코딩 에이전트의 환경 적응
  • 복잡한 표준 운영 절차(SOP) 준수 자동화
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 08.수집 2026. 04. 08.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.