본문으로 건너뛰기

NullOrigin AI 워터마크 무력화 프록시

로컬 SLM 패러프레이징으로 KGW 워터마크를 약화하는 연구용 API 프록시 NullOrigin이 공개됐습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

NullOrigin은 OpenAI·Anthropic·Gemini API 앞단에서 SSE 응답을 가로채 로컬 SLM으로 범위 제약 패러프레이징을 수행하는 FastAPI 기반 연구용 프록시입니다. 패러프레이징 과정에서 n-gram 전이를 재시드해 Kirchenbauer의 KGW 통계적 워터마크를 약화시키며, 이미지의 C2PA 매니페스트 제거와 CVE-2021-42574 관련 Trojan Source 검사도 지원합니다. 통계적 워터마크 처리는 Ollama나 vLLM 같은 로컬 모델 실행 환경이 필요하고, 짧은 텍스트에서는 z-score가 낮아져도 미검출 기준을 넘지 못할 수 있습니다. SynthID는 Google의 탐지기가 폐쇄형이라 제거 여부를 실험적으로 보증할 수 없습니다.

실용적 조언

  • 통계적 워터마크 제거를 시험하려면 먼저 Ollama 또는 vLLM에서 로컬 SLM을 실행해야 합니다. 로컬 모델이 스트림 텍스트의 범위 제약 패러프레이징을 수행하므로 실행 환경이 없으면 프록시의 핵심 처리가 작동하지 않습니다. 짧은 텍스트에서는 미검출 기준을 통과하지 못할 수 있으므로 긴 입력과 짧은 입력을 나눠 벤치마크해야 합니다.
  • SynthID 결과는 폐쇄형 탐지기 때문에 통계적 수치만으로 제거를 확정하기 어렵습니다. KGW 계열 워터마크와 SynthID를 동일한 성공 기준으로 묶지 말고 각각 별도의 평가 항목으로 기록해야 합니다. 이미지 출처 정보가 필요한 워크플로에서는 C2PA 매니페스트 제거가 provenance 손실로 이어질 수 있으므로 처리 전후 상태를 따로 보존해야 합니다.

섹션별 상세

01
NullOrigin은 FastAPI 기반의 Apache-2.0 라이선스 연구용 프록시로, 애플리케이션과 OpenAI·Anthropic·Gemini API 사이에 배치됩니다. 프록시는 SSE 스트림을 가로채 텍스트를 Ollama에서 실행하는 Llama 3.2 같은 로컬 SLM으로 보내고, 범위 제약 패러프레이징을 거친 결과를 다시 전달합니다. 이 과정에서 n-gram 전이를 재시드해 Kirchenbauer의 KGW 통계적 워터마크 패턴을 약화시키며, 해당 공격 방식은 Krishna et al. (2023)의 연구와 연결됩니다.
02
NullOrigin의 기능은 통계적 워터마크 처리에만 머물지 않고 이미지의 C2PA 매니페스트 제거와 코드의 Trojan Source 패턴 검사까지 포함합니다. 다만 Ollama나 vLLM 같은 로컬 모델 실행 환경이 없으면 통계적 워터마크를 제거할 수 없고, 짧은 텍스트에서는 z-score가 낮아져도 미검출 기준을 넘지 못할 수 있습니다. SynthID는 폐쇄형 탐지기 때문에 perturbation을 적용하더라도 제거 여부를 실험적으로 보증할 수 없다는 한계가 명시됐습니다.

이미지 분석

GitHub 저장소 rakib-nyc/nullorigin의 카드로, AI 워터마크와 provenance 견고성을 다루는 연구용 로컬 reverse proxy 및 CLI 도구임을 나타냅니다.
Screenshot

이미지에는 NullOrigin이 OpenAI·Anthropic·Gemini용 로컬 reverse proxy와 C2PA·EXIF·XMP·zero-width·homoglyph Unicode 처리 기능을 제공한다는 요약이 표시돼 있습니다. 저장소의 Contributor 1명, Issues 0개, Stars 0개, Forks 0개라는 상태도 함께 보이며, 프로젝트의 기술 범위와 초기 공개 규모를 파악하는 데 직접 연결됩니다.

GitHub 저장소 rakib-nyc/nullorigin의 카드로, AI 워터마크와 provenance 견고성을 다루는 연구용 로컬 reverse proxy 및 CLI 도구임을 나타냅니다.

용어 해설

통계적 워터마크(Statistical Watermark)
LLM이 토큰을 선택하는 확률 분포에 특정 통계적 패턴을 심어 생성 텍스트를 식별하는 방식입니다. NullOrigin은 문장 재구성으로 n-gram 전이를 바꿔 이 패턴을 약화시킵니다.
SSE 스트림(SSE Stream)
서버가 생성 결과를 완성된 응답 하나가 아니라 작은 텍스트 조각으로 실시간 전송하는 방식입니다. NullOrigin은 이 스트림을 가로채 각 조각을 처리한 뒤 상위 API로 전달합니다.
범위 제약 패러프레이징(Span-Constrained Paraphrasing)
입력 텍스트의 특정 범위만 유지하거나 재작성하도록 제한하는 패러프레이징 방식입니다. 로컬 SLM이 스트림의 텍스트를 재구성하면서 원래 의미를 보존하고 토큰 전이 패턴을 바꿉니다.
C2PA 콘텐츠 출처 표준(C2PA)
이미지와 같은 디지털 콘텐츠에 출처와 편집 이력을 담는 매니페스트 표준입니다. NullOrigin은 이미지에서 C2PA 매니페스트를 제거하는 기능을 함께 제공합니다.
Trojan Source 공격(Trojan Source)
Unicode 제어 문자나 유사 문자를 이용해 코드의 표시 내용과 실제 해석을 다르게 만드는 공격입니다. NullOrigin은 CVE-2021-42574와 관련된 패턴을 코드에서 검사합니다.

언급된 도구

FastAPI중립

OpenAI·Anthropic·Gemini API 사이에서 SSE 스트림을 처리하는 연구용 프록시 구현

Ollama중립

워터마크 약화를 위한 로컬 SLM 실행

vLLM중립

워터마크 처리에 사용할 수 있는 로컬 모델 실행 환경

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 16.수집 2026. 08. 16.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.