본문으로 건너뛰기

WMTrace, LLM 워터마크 포렌식 도구

WMTrace가 LLM 워터마크와 숨은 payload를 등급별 통계 증거로 분석한다

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

WMTrace는 LLM 텍스트가 특정 워터마크 방식과 키, 설정에 부합하는지 통계적 증거로 평가하는 scheme-aware forensic workbench입니다. detector별로 E0부터 E5까지 등급을 부여하고 exact binomial, z statistic, Holm-adjusted p-value, 토큰별 green heatmap을 제공해 결과의 근거와 적용 범위를 함께 기록합니다. 현재 kgw-toy, unigram-toy, zero-width, lexical-codebook, Unicode inspector를 지원하며, 화면 예시의 kgw-toy는 150개 token 중 123개가 green이고 z=16.122, Holm 보정 p=3.49e−48을 기록했습니다. 다만 음성 결과는 인간 작성의 증거가 아니고 payload 복원은 삽입 주체나 provider를 증명하지 않으므로, 결과를 처벌이나 저자 판정의 단독 근거로 사용할 수 없습니다.

섹션별 상세

01
WMTrace는 LLM 텍스트의 워터마크, provenance signal, hidden-payload channel을 조사하는 scheme-aware forensic workbench입니다. 하나의 AI 판정 점수 대신 선언된 워터마크 방식과 키, 설정에 텍스트가 통계적으로 부합하는지를 좁은 질문으로 분리해 처리합니다. 워터마크 음성 결과는 인간 작성의 증거가 아니며, payload 복원도 삽입 주체나 provider를 증명하지 않는다는 범위를 모든 결과에 함께 남깁니다.
bash
pip install -e ".[dev]" # from a clone; Python 3.10+
wmtrace serve # polished web UI at http://127.0.0.1:8177

Python 3.10 이상 환경에서 WMTrace를 설치하고 로컬 웹 UI 서버를 시작합니다.

02
검출 대상은 watermark detection, generic AI-text detection, model attribution, provenance verification이라는 네 개의 네임스페이스로 분리됩니다. 각 detector는 manifest, capabilities, score, calibrate, explain의 다섯 메서드 계약을 따르고, 공통 통계 계층이 exact binomial, z statistic, Holm-adjusted p-value를 계산해 detector별 구현의 중복을 막습니다. 짧거나 엔트로피가 낮거나 호환되지 않는 입력에는 추측 대신 E0 Unsupported 또는 E1 Insufficient를 반환합니다.
03
현재 구현에는 KGW 스타일 contextual green-list인 kgw-toy와 keyed unigram green-list, zero-width Unicode payload, synonym-pair 기반 lexical-codebook, Unicode·formatting inspector가 포함됩니다. kgw-toy는 γ=0.25와 2-word context, published demo key를 사용해 E3 scheme evidence까지 도달하며, 화면 예시에서는 150개 usable token 중 123개가 green token이고 z=16.122, Holm 보정 p=3.49e−48이 산출됩니다. E2는 비키드 또는 보정되지 않은 indicator 수준의 heuristic이고, E4와 E5는 각각 신뢰할 수 있는 키 provenance와 암호학적 검증을 위한 등급으로 현재 빌드에는 구현되어 있지 않습니다.
WMTrace의 Analyze 탭에서 detector별 증거 카드와 토큰 단위 green heatmap을 표시한 화면입니다.
Screenshot화면 상단에는 kgw-toy의 E3 Scheme evidence와 lexical-codebook의 E2 Payload candidate 등 detector별 등급이 나뉘어 표시됩니다. 중앙 evidence card는 usable token 150개, green token 123개, green fraction 0.82, z statistic 16.122, Holm 보정 p 3.49e−48을 보여주며, 본문 토큰에는 green으로 분류된 위치가 색으로 표시됩니다. 이는 README가 설명한 통계값과 per-token green heatmap을 웹 UI에서 함께 제공한다는 점을 뒷받침합니다.
04
웹 UI의 Analyze 탭은 detector별 grade badge, decision, N·green count·z·exact binomial p·Holm-adjusted p, 토큰별 green heatmap, Unicode findings, 결과의 적용 범위를 함께 표시합니다. Embed 탭에서는 demo key로 green-biased 텍스트를 만들거나 zero-width·lexical payload를 숨긴 뒤 한 번의 동작으로 analyzer에 되돌려 넣을 수 있습니다. CLI와 JSON evidence bundle, 41개 테스트의 golden example·calibration·round-trip·API 검증은 연구 문서의 예시와 실제 코드가 어긋나지 않도록 연결합니다.
bash
# Run all detectors (Holm-corrected across the run)
wmtrace scan document.txt
wmtrace scan document.txt --json # full evidence bundles
# One declared scheme
wmtrace detect --scheme kgw-toy document.txt
# Unicode and formatting inspection only
wmtrace inspect document.txt
# Demo embedding: generate a watermarked sample, reproducibly
wmtrace embed --scheme kgw-toy --length 150 --seed 11 > marked.txt
wmtrace detect --scheme kgw-toy marked.txt
# Hide an ASCII payload in invisible Unicode
echo "Meet at the usual place." | wmtrace embed --scheme zero-width --payload Hi --ascii

WMTrace의 전체 검출, 선언된 워터마크 방식 검출, Unicode 검사, 데모 워터마크 생성과 zero-width payload 삽입을 CLI에서 실행합니다.

05
WMTrace는 anthropic이나 openai detector를 제공하지 않으며, 공식 verification API나 재현 가능한 공개 사양과 신뢰할 수 있는 키가 없으면 provider attribution을 수행하지 않습니다. 저장소의 모든 키는 공개 연구용 키이고, 데모 결과는 특정 provider에 귀속되지 않습니다. 따라서 이 도구의 결과는 선언된 scheme과 configuration에 호환되는 증거로 보고해야 하며, 처벌이나 비난의 단독 근거로 사용할 수 없습니다.

용어 해설

LLM 워터마킹(LLM Watermarking)
LLM이 생성하는 토큰 선택이나 텍스트 표현에 특정 패턴을 삽입해 나중에 검출할 수 있도록 하는 기술입니다. WMTrace는 선언된 워터마크 방식과 키, 설정에 맞는 통계적 증거를 계산하지만, 워터마크가 없다는 결과를 인간 작성의 증거로 간주하지 않습니다.
증거 등급(Evidence Grade)
검출 결과가 어떤 수준의 근거를 제공하는지 나타내는 범주형 체계입니다. WMTrace는 지원 불가 E0부터 미래의 암호학적 검증 E5까지 등급을 부여하며, 이를 저자일 가능성을 나타내는 확률이나 단일 AI 점수로 해석하지 않습니다.
Holm 보정(Holm Correction)
여러 통계 검정을 동시에 수행할 때 다중 비교로 인해 유의한 결과가 우연히 나타날 가능성을 조정하는 방법입니다. WMTrace의 공유 통계 계층은 여러 detector를 함께 실행할 때 Holm 보정 p-value를 계산해 검정 결과를 일관되게 처리합니다.
제로 폭 유니코드(Zero-width Unicode)
화면에 거의 드러나지 않는 유니코드 문자를 이용해 텍스트 안에 비트나 신호를 숨기는 방식입니다. WMTrace는 U+200B와 U+200C를 이용한 zero-width payload를 삽입하고 복원하며, Unicode·양방향 문자·비정상 공백·혼합 스크립트도 별도 검사합니다.

기술

  • Python
  • FastAPI
  • wmtrace
  • kgw-toy
  • unigram-toy
  • zero-width
  • lexical-codebook
  • unicode-inspector
  • Holm correction
  • JSON

활용 사례

  • 선언된 LLM 워터마크 방식의 텍스트 호환성 검증
  • zero-width와 lexical payload가 포함된 텍스트 검사
  • Unicode·양방향 문자·비정상 공백·혼합 스크립트 점검
  • 워터마크 검출 결과를 JSON evidence bundle과 웹 UI로 기록
  • 연구 사양의 golden example과 detector round-trip 테스트

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 15.수집 2026. 08. 15.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.