본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

guillaumemeyer/watermarks-remover

Python1 / 0

텍스트와 문서·이미지의 AI provenance 흔적을 형식별로 검사하고 제거하는 Python CLI 및 agent skill입니다.

TL;DR

이 레포지토리는 독립형 Python CLI 도구이자 Grok Build용 agent skill로, 사용자가 소유하거나 처리 권한을 가진 콘텐츠의 AI provenance 흔적을 정리합니다. 텍스트에서는 Unicode 기반 흔적을 결정적으로 제거하고 선택적 LLM 재작성으로 통계적 watermark를 완화하며, 파일에서는 C2PA와 EXIF, XMP, 문서 속성을 형식별로 삭제합니다. 픽셀 watermark 제거는 외부 CtrlRegen backend와 대규모 모델을 별도로 요구하고 결과 보증도 없으므로, 가벼운 텍스트·메타데이터 위생에는 적합하지만 원문 품질 보존과 공식 판정 회피가 모두 필요한 작업에는 신중한 검증이 필요합니다.

핵심 포인트

  • 이 레포지토리는 독립 실행형 Python CLI와 Grok Build용 agent skill을 함께 제공하는 도구입니다. `/remove-ai-marks` 호출이나 `inspect_file.py`, `clean_file.py` 같은 스크립트로 텍스트와 파일을 검사하고 정리합니다. Python 3.10 이상과 표준 라이브러리만으로 핵심 기능을 실행할 수 있어 별도 패키지 의존성이 적습니다.
  • Layer A는 ZWSP, bidi 문자, 태그 문자, 특수 공백처럼 텍스트에 삽입된 Unicode 흔적을 결정적으로 찾아 제거합니다. Layer B는 문장과 단어 선택을 다시 쓰는 방식으로 통계적 토큰 watermark를 완화하며 Ollama나 OpenAI 호환 backend를 선택적으로 연결합니다. Layer B는 원문 어조와 정밀도를 손상시킬 수 있고 공식 vendor detector의 통과 여부를 보증하지 않으므로 품질 보존이 우선인 문서에는 Layer A만 쓰는 편이 적합합니다.
  • `clean_file.py`는 PNG, JPEG, SVG, PDF, DOCX, ODT, HTML, Markdown을 형식별로 분기해 C2PA, EXIF, XMP, 문서 속성, HTML 메타데이터와 Markdown frontmatter를 정리합니다. PDF는 `exiftool`이 있을 때 처리가 더 완전하며 `c2patool`은 C2PA manifest 검사에 활용됩니다. 임시 파일과 원자적 이름 변경, 심볼릭 링크 대상 거부, 입력 크기 제한, redirect 및 원격 endpoint 제한을 적용해 파일 손상과 비밀키 유출 위험을 줄입니다.
  • 픽셀 watermark 제거는 기본 기능이 아니라 외부 `mertizci/noai-watermark` 기반 CtrlRegen backend를 별도로 설치해야 합니다. 512×512 Stable Diffusion 1.5 파이프라인을 사용하고 큰 이미지는 512픽셀 타일과 192픽셀 overlap으로 재생성하므로 약 10GB의 모델 다운로드와 GPU가 필요합니다. `reverse-SynthID` 점수는 탐지 보조 신호일 뿐이며 공식 Google SynthID 검사가 최종 판단이므로, 무손실 메타데이터 정리와 이미지 재생성을 같은 수준의 제거로 취급하면 안 됩니다.

5.2k

Stars

532

Forks

+277

Trending

1

조회수

5.2k watchers0 open issuesMIT License

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.