본문으로 건너뛰기

NVIDIA SkillEvaluator로 AI 에이전트 Skill 성능 측정

NVIDIA SkillEvaluator가 verified skill의 에이전트 성능 기여도를 설치 전후 비교로 측정했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

AI 에이전트용 NVIDIA Verified Skills가 실제 task 성능을 높이는지 확인하기 위해 NVIDIA가 오픈소스 도구인 NVIDIA SkillEvaluator를 만들었습니다. 이 도구는 schema·보안 정적 검사, embedding 기반 중복성 검사, Harbor sandbox에서의 skill 설치 전후 실시간 비교를 거쳐 Skill Lift를 계산합니다. 300개가 넘는 skill과 30개가 넘는 NVIDIA 제품의 benchmark에서 Correctness는 46점에서 87점으로, Effectiveness는 39점에서 78점으로 상승했고 전체 평균 Skill Lift는 +31점이었습니다. 다만 제품별 효과는 약 +2점에서 +46점까지 달랐고 token과 실행 시간은 skill에 따라 줄거나 늘어, 평가 dataset과 제품별 최적화가 중요하다는 결과가 나왔습니다.

빠른 이해

새로운 점

skill 설치 전후를 동일한 sandbox 조건에서 비교하고 정적 안전성·중복성·실시간 task 성능을 하나의 공개 평가 계층으로 연결한 점입니다.

핵심 메커니즘

평가 case와 expected output을 데이터셋으로 만들고, SkillEvaluator가 이를 Harbor task bundle로 변환해 같은 prompt, model, task input, grading criteria를 유지한 채 skill 설치 전후의 agent 실행을 각각 격리된 sandbox에서 수행합니다. 각 실행의 Correctness, Discoverability, Effectiveness, Efficiency, Security 점수를 계산한 뒤 with-skill 점수에서 without-skill 점수를 빼 Skill Lift를 산출하며, token과 execution time은 별도 지표로 기록합니다.

핵심 수치

  • Correctness 평균 점수: without-skill 46 -> with-skill 87, Skill Lift +41- 100점 만점, Codex와 Claude Code의 macro-average
  • Discoverability 평균 점수: without-skill 42 -> with-skill 82, Skill Lift +40- 관련 skill을 올바르게 불러오고 무관한 경우에는 로드하지 않는 정도
  • Effectiveness 평균 점수: without-skill 39 -> with-skill 78, Skill Lift +39- 사용자 목표와 기대 workflow 달성 정도
  • Efficiency 평균 점수: without-skill 43 -> with-skill 78, Skill Lift +35- 불필요한 단계와 중복 tool call을 줄이는 정도
  • 전체 평균 Skill Lift: 모든 차원 +31점, Security 제외 +39점- Skill Lift는 percent change가 아닌 점수 차이
  • 제품별 Skill Lift 범위: 대략 +2점 -> +46점- harness 간 평균 차이는 약 5점

섹션별 상세

01

SkillEvaluator의 목적과 검증 대상

AI 에이전트는 모델과 NVIDIA library가 충분히 강력해도 적절한 tool을 찾느라 불필요한 단계를 거치거나 전문 작업에서 막힐 수 있습니다. NVIDIA Verified Skills는 제품의 기능, 호출 시점, 호출 방법을 instructions, examples, tool guidance로 묶은 capability descriptor이며, SkillEvaluator는 이 skill이 에이전트의 작업 경로와 최종 결과를 실제로 개선하는지 측정합니다. NVIDIA는 30개가 넘는 제품에 걸친 300개 이상의 verified skill을 두 개의 독립적인 agent harness에서 평가했고, skill을 설치한 실행과 설치하지 않은 실행의 점수 차이를 Skill Lift로 산출했습니다. 이 구조는 skill의 존재 자체가 아니라 동일한 조건에서 추가된 guidance가 만든 성능 변화를 비교 대상으로 삼습니다.
02

세 단계로 구성한 skill 평가

배포 전 skill은 서로 다른 위험과 성능 질문에 답하는 세 개의 평가 계층을 통과합니다. Tier 1은 schema와 frontmatter, 품질 점수, prompt injection 및 data exfiltration, secret과 PII, license, script lint를 정적으로 검사하고, Tier 2는 embedding similarity로 한 skill 안의 중복 guidance와 catalog 간 겹치는 내용을 찾습니다. Tier 3은 생성된 task를 격리된 환경에서 agent에 실행해 skill 설치 전후 결과를 비교하므로, 파일 구조의 안전성부터 내용의 고유성, 실제 작업 성능까지 독립적으로 확인하는 흐름을 만듭니다.
03

Harbor 기반의 통제된 실시간 비교

Tier 3은 open-source evaluation framework인 Harbor를 사용해 반복 가능하고 격리된 실행 환경을 구성합니다. SkillEvaluator가 평가 case를 Harbor task bundle로 바꾸고 각 case를 같은 prompt, model, task input, grading criteria로 두 번 실행하며, 한 번은 verified skill을 설치하고 다른 한 번은 설치하지 않습니다. 두 실행의 점수 차이가 skill의 기여도인 Skill Lift가 되므로, harness 내부에서 skill 설치 여부만 실험 변수로 남깁니다. 사용자는 `skillevaluator create-eval-dataset ./my-skill --full`로 명시적·암묵적·맥락적·부정적 case를 만든 뒤 Docker 환경의 Tier 3 실행을 시작할 수 있습니다.
bash
skillevaluator create-eval-dataset ./my-skill --full

skill에 대한 평가 데이터셋을 생성하고 evals/evals.json에 ID, prompt, expected output, 선택적 assertion을 저장합니다.

bash
skillevaluator tier3 evaluate ./my-skill \
 --agents codex \
 --env-mode docker

Codex agent를 Docker 격리 환경에서 skill 설치 전후로 실행해 점수와 Skill Lift를 계산합니다.

04

Skill이 없는 상태의 기준선

2026년 8월 12일 기준 benchmark snapshot에서 Correctness, Discoverability, Effectiveness, Efficiency의 without-skill 평균 점수는 각각 46, 42, 39, 43점으로 100점 만점에 머물렀습니다. Security 기준선은 97점으로 높았으며, 이 차원에서는 skill 설치가 안전성 저하를 만들지 않는지가 주요 확인 대상이었습니다. Discoverability와 Efficiency는 skill이 없을 때도 관련 없는 skill을 로드하지 않거나 생산적인 tool 사용을 하면 일부 점수를 얻을 수 있어 기준선이 0점이 되지 않습니다. 다만 대부분의 skill은 task당 한 번만 실행됐고, 결과가 공개된 skill 중 85%가 1회, 15%가 2회 시도였으며 confidence interval은 보고되지 않았습니다.
05

Verified Skill의 평균 성능 향상

Verified Skill을 설치하면 Correctness 평균이 46점에서 87점으로 올라 Skill Lift가 +41점이 되었고, Effectiveness는 39점에서 78점으로 올라 +39점을 기록했습니다. Discoverability는 42점에서 82점으로 +40점, Efficiency는 43점에서 78점으로 +35점이었으며 Security는 이미 높은 97점에서 98점으로 +1점 증가했습니다. 모든 차원의 평균 Skill Lift는 +31점이고 Security를 제외하면 +39점으로 집계됐습니다. Correctness와 Effectiveness의 수치는 합격 확률이 아니라 평가된 전문 task에서의 평균 점수이며, Discoverability와 Efficiency는 skill이 설치됐을 때 관련 skill을 찾고 올바르게 사용하는 정도를 나타내는 지표입니다.
06

Harness보다 제품과 평가 설계의 영향

Claude Code의 Skill Lift는 모든 차원에서 +34점, Security 제외 시 +42점이었고 OpenAI Codex는 각각 +29점과 +36점이었습니다. 두 harness의 평균 차이는 약 5점이지만 제품별 Skill Lift 범위는 대략 +2점에서 +46점까지 벌어져, agent harness보다 제품 domain, task 성격, evaluation dataset 설계가 더 큰 변수가 되었습니다. 중요한 task, 기대 output, 범위를 벗어난 request를 평가 set에 명확히 넣을수록 skill이 맡은 업무를 더 정밀하게 측정할 수 있습니다. 따라서 동일한 skill을 여러 harness에서 비교하는 것만으로는 충분하지 않고, 제품별 작업과 채점 기준을 함께 조정해야 합니다.
07

토큰과 실행 시간은 skill마다 달라짐

SkillEvaluator는 Efficiency 점수와 별도로 token 사용량과 실행 시간을 기록해 skill이 실제 자원을 절약하는지도 확인합니다. `jetson-optimize-memory` 사례에서는 token이 617,306에서 142,540으로 76.9% 줄고 실행 시간이 474.9초에서 220.0초로 53.7% 감소했습니다. 반대로 `cuopt-install`은 token이 25,227에서 55,582로 120.3% 늘었고 실행 시간도 34.0초에서 41.1초로 20.8% 증가했습니다. 이 결과는 skill이 항상 짧은 경로를 만드는 것은 아니며, 정확도 향상과 자원 절약을 별도 목표로 측정하면서 추가 최적화 대상을 찾아야 함을 뜻합니다.
08

생태계 통합과 활용 경로

NVIDIA는 Claude Code, Codex, Cursor용 plugin을 제공하고 같은 skill을 Skills.sh, ClawHub, Hermes Hub에서도 사용할 수 있게 했습니다. OpenClaw는 ClawHub의 공식 조직을 대상으로 SkillEvaluator의 Tier 3 결과를 Evals 탭에 표시하는 pilot을 진행하고 있으며, 개발자는 skill을 찾고 설치하는 화면에서 with-skill과 without-skill 결과를 함께 확인할 수 있습니다. Nous Research는 Hermes Agent의 설치 과정에 SkillSpector 선택 검사를 연결해 PII, Unicode smuggling, script linting, license, security 문제와 파일 행별 발견 내용을 표시했고, 29개 passing test와 skill당 약 1.4~1.5초의 scan 시간을 기록했습니다. 이러한 통합은 skill을 배포한 뒤 별도 도구로 확인하는 대신 발견·설치 단계에서 품질과 실행 성능을 함께 판단하도록 만듭니다.

용어 해설

Skill Lift
AI 에이전트가 특정 skill을 설치한 상태와 설치하지 않은 상태에서 얻은 점수 차이입니다. 동일한 prompt, 모델, 입력, 채점 기준을 유지한 채 두 번 실행한 뒤 with-skill 점수에서 without-skill 점수를 빼므로, 해당 skill이 성능에 기여한 정도를 점수 단위로 나타냅니다.
에이전트 하네스(Agent Harness)
AI 에이전트를 실제 작업에 투입하기 위한 실행 환경과 도구 호출 구조입니다. 이 글에서는 Claude Code와 OpenAI Codex가 서로 다른 harness로 사용되며, 같은 skill을 적용해도 system prompt, context 처리, tool-calling 구현에 따라 Skill Lift가 달라질 수 있습니다.
Embedding 유사도(Embedding Similarity)
문장이나 문서의 의미를 벡터로 바꾼 뒤 벡터 간 거리를 비교하는 방식입니다. SkillEvaluator는 이를 Tier 2에서 사용해 하나의 skill 안에 반복된 guidance가 있는지, catalog의 여러 skill이 같은 내용을 중복 제공하는지 확인합니다.
Prompt Injection
에이전트가 따라야 할 지침을 외부 입력이 덮어쓰도록 유도하는 공격입니다. SkillEvaluator의 Tier 1은 skill 파일과 스크립트를 정적으로 검사하면서 prompt injection, 데이터 반출, secret 및 PII 노출 가능성을 확인해 배포 전 위험을 줄입니다.
Macro 평균(Macro Average)
각 skill과 agent harness 조합에 동일한 가중치를 부여해 점수를 평균내는 집계 방식입니다. SkillEvaluator의 benchmark snapshot은 특정 skill이나 harness가 결과를 과도하게 좌우하지 않도록 published skill–harness pair를 동등하게 취급합니다.

기술

  • NVIDIA SkillEvaluator
  • NVIDIA Verified Skills
  • Harbor
  • Claude Code
  • OpenAI Codex
  • Cursor
  • Skills.sh
  • ClawHub
  • Hermes Hub
  • SkillSpector
  • Docker

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 08. 20.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.