Claude 에이전트 실전 워크숍: 모델 선택·메모리·평가 파이프라인
Anthropic의 Code with Claude 워크숍 실습 모음으로 Claude Code SKILL·Managed Agents·MCP 기반 에이전트 설계와 평가 파이프라인 예제가 포함됨.
TL;DR
이 레포지토리는 Anthropic이 진행한 'Code with Claude' 워크숍의 실습 자료 모음이다. 여러 개의 워크숍 디렉터리가 각기 다른 실습 주제(모델 선택, 에이전트 분해, 메모리 도입, 평가 기반 개발, 프로덕션용 에이전트 등)를 포함하며 코드·과제·평가 파이프라인을 함께 제공한다. 워크숍별로 Claude Code SKILL을 이용한 평가 수트 감사와 모델·추론 파라미터 스윕, skills·code execution·callable_agents를 활용한 에이전트 분해와 재구성, Streamlit 기반 데모와 SRE 에이전트 구현 등 실습 중심의 절차가 포함된다. 평가 방식은 프로그래밍적 메트릭(.pptx XML)과 LLM-as-judge의 이중 구조로 프롬프트·에이전트 변형을 수치화하는 점이 특징이다. 따라서 Claude 생태계(Claude Code, Managed Agents, MCP)에 특화된 실무 연습·교육 자료로 가치는 크다. 다만 레포는 'Not maintained'로 기재되어 있고 외부 기여를 받지 않으므로 최신 API 접근권·사내 서비스 의존성(예: Managed Agents 환경, Dreaming Service)에 따라 바로 실행하기 어렵고 유지보수는 사용자가 책임져야 한다.
주요 기능
- Claude Code SKILL으로 LLM 평가 수트 감사를 실행하고 모델·추론 파라미터를 스윕
- 에이전트 코드를 분해해 skills·code execution·callable_agents로 재구성
- Streamlit 기반 SRE 대시보드와 오프라인 에이전트 패널을 구현해 로컬 로그·툴 연동 테스트
- 메모리 스토어와 Dreaming Service를 차례로 도입해 세션 지속성 향상
- 프로그래밍적 지표(.pptx XML)와 LLM-as-judge를 결합해 평가 기반 반복 개선
어떻게 동작하는가
각 워크숍 디렉터리에 실습용 코드와 단계별 과제가 포함되어 있다. Claude Code SKILL을 사용해 평가 수트를 모델·추론 파라미터 전반에 걸쳐 스윕하고, skills·callable_agents·MCP 서버를 연결해 Managed Agent를 구성하며 평가는 프로그램적 메트릭과 LLM 기반 채점기로 이중으로 수행한다.
해결 문제
Claude 에코시스템(Claude Code SKILL, Managed Agents, MCP)을 이용한 에이전트 설계·분해·평가 실습 과정과 샘플 코드를 제공해 실무·교육용 핸즈온 경험을 전달한다.
차별점
- Claude 고유 컴포넌트(Claude Code SKILL, Managed Agents, MCP)를 직접 활용하는 실습 예제가 모아져 있음 — 일반적인 범용 가이드가 아님
- 평가 주도로 프롬프트·에이전트 변형을 수치화하는 워크플로(프로그램적 .pptx 지표 + LLM-as-judge)를 포함
- 에이전트 분해·재구성(400줄 프롬프트 → skills + callable_agents + 코드 실행) 같은 실습형 리팩터링 사례를 제공
사용 사례
- 여러 모델·추론 설정을 비교해 비용 대비 품질 최적 구성을 찾는 실험
- 복잡한 프롬프트 기반 에이전트를 skills와 callable_agents로 분해해 유지보수 가능한 아키텍처로 전환하는 연습
- 메모리·Dreaming Service를 도입해 세션 지속성을 확보하는 기능 시연
- SRE 대시보드와 연동된 로컬·오프라인 에이전트 프로토타입을 빠르게 구현해 검증
1.7k
Stars
495
Forks
+212
Trending
1
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.