TL;DR
AI 에이전트용 NVIDIA Verified Skills가 실제 task 성능을 높이는지 확인하기 위해 NVIDIA가 오픈소스 도구인 NVIDIA SkillEvaluator를 만들었습니다. 이 도구는 schema·보안 정적 검사, embedding 기반 중복성 검사, Harbor sandbox에서의 skill 설치 전후 실시간 비교를 거쳐 Skill Lift를 계산합니다. 300개가 넘는 skill과 30개가 넘는 NVIDIA 제품의 benchmark에서 Correctness는 46점에서 87점으로, Effectiveness는 39점에서 78점으로 상승했고 전체 평균 Skill Lift는 +31점이었습니다. 다만 제품별 효과는 약 +2점에서 +46점까지 달랐고 token과 실행 시간은 skill에 따라 줄거나 늘어, 평가 dataset과 제품별 최적화가 중요하다는 결과가 나왔습니다.
빠른 이해
새로운 점
skill 설치 전후를 동일한 sandbox 조건에서 비교하고 정적 안전성·중복성·실시간 task 성능을 하나의 공개 평가 계층으로 연결한 점입니다.
핵심 메커니즘
평가 case와 expected output을 데이터셋으로 만들고, SkillEvaluator가 이를 Harbor task bundle로 변환해 같은 prompt, model, task input, grading criteria를 유지한 채 skill 설치 전후의 agent 실행을 각각 격리된 sandbox에서 수행합니다. 각 실행의 Correctness, Discoverability, Effectiveness, Efficiency, Security 점수를 계산한 뒤 with-skill 점수에서 without-skill 점수를 빼 Skill Lift를 산출하며, token과 execution time은 별도 지표로 기록합니다.
핵심 수치
- Correctness 평균 점수: without-skill 46 -> with-skill 87, Skill Lift +41- 100점 만점, Codex와 Claude Code의 macro-average
- Discoverability 평균 점수: without-skill 42 -> with-skill 82, Skill Lift +40- 관련 skill을 올바르게 불러오고 무관한 경우에는 로드하지 않는 정도
- Effectiveness 평균 점수: without-skill 39 -> with-skill 78, Skill Lift +39- 사용자 목표와 기대 workflow 달성 정도
- Efficiency 평균 점수: without-skill 43 -> with-skill 78, Skill Lift +35- 불필요한 단계와 중복 tool call을 줄이는 정도
- 전체 평균 Skill Lift: 모든 차원 +31점, Security 제외 +39점- Skill Lift는 percent change가 아닌 점수 차이
- 제품별 Skill Lift 범위: 대략 +2점 -> +46점- harness 간 평균 차이는 약 5점
섹션별 상세
SkillEvaluator의 목적과 검증 대상
세 단계로 구성한 skill 평가
Harbor 기반의 통제된 실시간 비교
skillevaluator create-eval-dataset ./my-skill --fullskill에 대한 평가 데이터셋을 생성하고 evals/evals.json에 ID, prompt, expected output, 선택적 assertion을 저장합니다.
skillevaluator tier3 evaluate ./my-skill \
--agents codex \
--env-mode dockerCodex agent를 Docker 격리 환경에서 skill 설치 전후로 실행해 점수와 Skill Lift를 계산합니다.
Skill이 없는 상태의 기준선
Verified Skill의 평균 성능 향상
Harness보다 제품과 평가 설계의 영향
토큰과 실행 시간은 skill마다 달라짐
생태계 통합과 활용 경로
용어 해설
- Skill Lift
- — AI 에이전트가 특정 skill을 설치한 상태와 설치하지 않은 상태에서 얻은 점수 차이입니다. 동일한 prompt, 모델, 입력, 채점 기준을 유지한 채 두 번 실행한 뒤 with-skill 점수에서 without-skill 점수를 빼므로, 해당 skill이 성능에 기여한 정도를 점수 단위로 나타냅니다.
- 에이전트 하네스(Agent Harness)
- — AI 에이전트를 실제 작업에 투입하기 위한 실행 환경과 도구 호출 구조입니다. 이 글에서는 Claude Code와 OpenAI Codex가 서로 다른 harness로 사용되며, 같은 skill을 적용해도 system prompt, context 처리, tool-calling 구현에 따라 Skill Lift가 달라질 수 있습니다.
- Embedding 유사도(Embedding Similarity)
- — 문장이나 문서의 의미를 벡터로 바꾼 뒤 벡터 간 거리를 비교하는 방식입니다. SkillEvaluator는 이를 Tier 2에서 사용해 하나의 skill 안에 반복된 guidance가 있는지, catalog의 여러 skill이 같은 내용을 중복 제공하는지 확인합니다.
- Prompt Injection
- — 에이전트가 따라야 할 지침을 외부 입력이 덮어쓰도록 유도하는 공격입니다. SkillEvaluator의 Tier 1은 skill 파일과 스크립트를 정적으로 검사하면서 prompt injection, 데이터 반출, secret 및 PII 노출 가능성을 확인해 배포 전 위험을 줄입니다.
- Macro 평균(Macro Average)
- — 각 skill과 agent harness 조합에 동일한 가중치를 부여해 점수를 평균내는 집계 방식입니다. SkillEvaluator의 benchmark snapshot은 특정 skill이나 harness가 결과를 과도하게 좌우하지 않도록 published skill–harness pair를 동등하게 취급합니다.
기술
- NVIDIA SkillEvaluator
- NVIDIA Verified Skills
- Harbor
- Claude Code
- OpenAI Codex
- Cursor
- Skills.sh
- ClawHub
- Hermes Hub
- SkillSpector
- Docker
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
