본문으로 건너뛰기

DeepSeek Harness용 LLM 검증 플러그인

DeepSeek Harness에서 여러 에이전트 결과를 LLM으로 채점해 최선의 후보를 고르는 플러그인입니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

dsh-plugin-llm-verifier는 DeepSeek Harness에서 여러 서브에이전트가 만든 결과를 LLM으로 반복 채점하고 최선의 후보를 고르는 플러그인입니다. verify_rollout은 작업을 기본 3개 세션에 병렬 배분한 뒤, 각 결과를 1부터 20까지의 점수와 여러 기준으로 평가해 승자를 선택합니다. 후보 비교에는 위치 편향을 줄이는 링 비교와 피벗 토너먼트를 사용하며, 기본 설정에서는 3개 시도에 최대 36회의 채점 호출이 추가되어 실행 시간이 분 단위로 늘어날 수 있습니다. DeepSeek Harness가 logprobs를 제공하지 않아 여러 번의 샘플링 평균으로 점수를 추정하고, 웹에서는 점수 막대와 시도별 궤적을 Verifier 탭에서 확인할 수 있습니다.

섹션별 상세

01
dsh-plugin-llm-verifier는 DeepSeek Harness에 LLM 기반 결과 검증을 추가해 후보 해답을 0과 1 사이 점수로 평가하는 플러그인입니다. 핵심 함수인 verify_rollout은 하나의 작업을 여러 독립 에이전트 세션에 병렬로 보내고, 각 결과를 채점한 뒤 가장 높은 결과를 반환합니다. 기본 시도 횟수는 3회이며 2회에서 8회까지 조정할 수 있어 문구 작성이나 랜딩 페이지처럼 여러 초안을 비교할 작업에 맞습니다.
bash
cd ~/.dsh/profiles/web # or ~/.dsh/profiles/headless, etc.
npm install github:uson1x/dsh-plugin-llm-verifier

실제로 사용하는 DeepSeek Harness 프로필 디렉터리에 플러그인을 설치합니다.

yaml
- insert:
    - id: llm-verifier
      name: dsh-plugin-llm-verifier
      config:
        provider: deepseek-official
        model: deepseek-v4-pro

프로필의 cordis.patch.yml에 채점용 provider와 model을 등록합니다.

근거
  • verify_rollout은 여러 독립 에이전트 시도를 병렬로 실행하고 채점 결과가 가장 높은 시도를 반환한다. README 소개 문단과 verify_rollout 도구 표의 설명 출처
02
플러그인은 verify_select, verify_compare, verify_track, verify_rollout 네 가지 도구를 제공합니다. 이미 후보가 있으면 verify_select가 여러 후보 중 최선의 결과를 고르고, 두 결과만 비교할 때는 verify_compare를 사용하며, 단계별 작업의 진행 정도는 verify_track이 평가합니다. 다른 플러그인은 ctx.verifier를 통해 select, compare, track, score 함수를 직접 호출할 수 있습니다.
03
설치는 Node 20 이상과 DeepSeek Harness 프로필이 필요하며, dsh web과 CLI가 실제로 읽는 프로필 경로가 다를 수 있습니다. npm으로 저장소를 설치한 뒤 cordis.patch.yml에 채점용 provider와 model을 등록하고 dsh를 재시작해야 플러그인이 로드됩니다. 웹 앱에서는 브라우저 탭을 한 번 새로 고쳐야 Verifier UI가 나타나며, verify_rollout을 호출하는 문장으로 기본 동작을 확인할 수 있습니다.
근거
  • 후보 채점은 1부터 20까지의 점수를 여러 기준과 반복 횟수로 산출한 뒤 0과 1 사이 값으로 평균낸다. How grading works 절의 1–20 점수, 기본 repetitions 4, 기본 criteria 3 설명 출처
  • 후보 선택은 무작위 링 비교와 상위 2개 피벗 비교를 결합한 Probabilistic Pivot Tournament를 사용한다. 후보 N개 선택 과정과 피벗 토너먼트 설명 출처
  • 기본 verify_rollout은 3개 시도를 평가하기 위해 36회의 채점 호출을 추가로 사용할 수 있다. Cost 문단의 criteria × repetitions 12회, 3개 시도에서 3개 pair와 36 grading calls 계산 출처

용어 해설

LLM 검증기(LLM-as-a-Verifier)
LLM이 다른 모델의 출력이나 에이전트 작업 결과를 평가자로 채점하는 방식입니다. 후보 결과를 기준과 비교해 점수나 순위를 산출하며, 여러 시도의 품질을 자동으로 가르는 데 쓰입니다. 이 플러그인은 해당 방식을 DeepSeek Harness의 에이전트 실행 흐름에 연결합니다.
확률적 피벗 토너먼트(Probabilistic Pivot Tournament)
여러 후보를 모든 조합으로 비교하지 않고 인접 후보와 피벗 후보를 단계적으로 겨루게 하는 선택 알고리즘입니다. 후보별 승리 점수를 누적해 최종 승자를 고르므로 비교 횟수를 줄이면서 순위 편향을 완화합니다. 플러그인은 무작위 링과 상위 피벗을 활용합니다.
로그 확률(logprobs)
모델이 각 토큰에 부여한 확률의 로그 값으로, 출력에 대한 모델의 확신도를 계산할 때 활용됩니다. 원 논문은 logprobs를 이용해 한 번의 호출에서 기대 점수를 계산하지만, DeepSeek Harness는 이를 노출하지 않습니다. 플러그인은 여러 번의 샘플링과 평균으로 대체합니다.
서브에이전트(subagent)
상위 에이전트의 작업을 별도 세션에서 수행하는 실행 단위입니다. verify_rollout에서는 하나의 요청을 여러 독립 세션으로 나눠 동시에 실행하고, 각 세션의 궤적과 결과를 검증기에 전달합니다. 기본 실행 백엔드는 spawn으로 설정됩니다.
에이전트 궤적(trajectory)
에이전트가 작업을 수행하는 동안 남긴 단계별 메시지, 도구 호출, 도구 결과의 흐름입니다. 검증기는 기본적으로 각 시도의 전체 궤적을 읽고 최종 결과뿐 아니라 작업 과정까지 평가합니다. traceMaxChars로 평가 입력의 문자 예산을 제한할 수 있습니다.

기술

  • DeepSeek Harness
  • Node 20
  • npm
  • dsh-plugin-llm-verifier
  • cordis.patch.yml
  • ctx.llm
  • spawn

활용 사례

  • 여러 에이전트 초안 중 최선의 결과 선택
  • 랜딩 페이지 tagline 작성
  • haiku 작성
  • 이미 생성된 후보 두 개 비교
  • 단계별 에이전트 작업의 진행 정도 평가
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 20.수집 2026. 08. 20.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.