본문으로 건너뛰기

SynthID 텍스트 워터마크 재토큰화 실험

U+034F와 U+FE00 삽입 뒤 SynthID-text 탐지가 188/192에서 0/192로 떨어졌다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

게시자는 SynthID-text가 화면의 단어가 아니라 token n-grams에 워터마크를 삽입한다는 전제에서 Google의 30-key gpt-2 확인 설정을 시험했다. 수정하지 않은 텍스트는 192건 중 188건이 탐지됐지만, ASCII 문자 뒤에 U+034F 또는 U+FE00을 넣은 제약된 재토큰화 뒤에는 0/192건만 탐지됐다. 화면에 보이는 문자열은 192/192로 일치했으며, cf-strip과 NFKC는 워터마크를 복구하지 못하고 mn-strip만 복구했다. 결과는 영어 ASCII 텍스트와 URL·코드·경로 제외 조건에 한정된다.

실용적 조언

  • SynthID-text 탐지 동작을 재현하려면 Google의 30-key gpt-2 확인 설정과 192건의 입력 조건을 동일하게 맞춰야 한다. 원문 텍스트와 U+034F 또는 U+FE00을 삽입한 텍스트를 각각 검사해 탐지율과 시각적 일치율을 분리해서 기록해야 한다. URL·코드·경로를 제외했다는 실험 조건도 함께 보존해야 결과 비교가 가능하다.

섹션별 상세

01
게시자는 SynthID-text가 화면에 나타난 단어가 아니라 token n-grams에 워터마크를 기록한다는 전제에서 Google의 30-key gpt-2 확인 설정을 재현했다. 수정하지 않은 워터마크 텍스트 192건 가운데 188건이 탐지됐지만, ASCII 문자 뒤에 U+034F 또는 U+FE00을 삽입한 제약된 재토큰화 뒤에는 192건 모두 탐지를 피했다. 시각적 문자열 비교는 192건 모두 일치해 화면에 보이는 내용은 달라지지 않았다.
02
글에는 Zero Width Space가 아니라는 점과 Unicode 문자의 분류가 함께 기록됐다. U+034F와 U+FE00은 Mn 및 default-ignorable 문자로 처리되며, cf-strip과 NFKC는 워터마크를 복구하지 못했지만 mn-strip을 적용하면 복구됐다. 실험 조건은 영어 ASCII 텍스트, 192개 사이트 제한, URL·코드·경로 제외로 한정됐다.
03
게시자는 구현물과 근거 자료를 GitHub 저장소에 공개하고, 별도 사이트에서 실험 내용을 제공했다. 다만 글에서 직접 주장하는 수치는 SynthID 탐지 결과인 188/192와 0/192, 시각적 일치 결과인 192/192로 제한됐다. 다른 언어·문자 체계나 더 넓은 입력 유형에 대한 성능은 제시되지 않았다.

용어 해설

SynthID 텍스트 워터마크(SynthID-text)
SynthID-text는 생성된 텍스트에 사람이 읽는 단어를 바꾸지 않고 토큰 선택 패턴을 삽입하는 watermark 기술이다. 문장에 쓰인 단어 자체가 아니라 token n-grams의 통계적 배열을 기준으로 워터마크 존재 여부를 확인한다.
토큰 n-그램(Token n-grams)
Token n-grams는 텍스트를 토큰 단위로 나눈 뒤 연속된 n개 토큰의 배열을 묶어 보는 표현이다. SynthID-text는 화면에 보이는 단어보다 이런 토큰 배열의 선택 패턴에 워터마크 정보를 담으므로 재토큰화가 탐지 결과에 영향을 줄 수 있다.
기본 무시 문자(Default-Ignorable)
Default-Ignorable 문자는 일반적인 화면 표시나 텍스트 처리에서 무시하도록 지정된 Unicode 문자다. U+034F와 U+FE00은 화면에 보이는 문자열을 바꾸지 않으면서 토큰화 입력을 바꿀 수 있고, 일부 정규화·필터링 단계에서는 제거되지 않는다.
제약된 재토큰화(Constrained retokenize)
제약된 재토큰화는 텍스트의 시각적 투영을 유지하면서 특정 위치에 Unicode 문자를 삽입해 tokenizer가 다른 토큰 배열을 만들도록 하는 처리다. 이 실험에서는 ASCII 문자 뒤에 U+034F 또는 U+FE00을 넣고 URL·코드·경로는 제외했다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 28.수집 2026. 08. 28.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.