TL;DR
작성자는 Claude, OpenAI, Gemini 텍스트 워터마크를 생성하고 검출하는 도구를 만든 뒤 gpt-oss-20b와 Qwen 출력에 약 300회의 편집 공격을 적용했습니다. 대시 교체, Markdown 제거, 미국식·영국식 철자 변환은 검출 점수에 거의 영향을 주지 않았고, 단어의 40%를 삭제하는 공격만 임계값을 넘겼지만 텍스트가 크게 훼손됐습니다. 반면 Unicode Variation Selectors를 문자 약 30%에 삽입하자 워터마크 점수가 45에서 1 미만으로 떨어졌으며, 정규화 이후에도 codepoint가 유지됐습니다. 코드 출력은 다음 토큰의 불확실성이 낮아 워터마크 강도 자체가 약했고, 일부 샘플은 공격 없이도 사실상 검출되지 않았습니다.
섹션별 상세
용어 해설
- 토너먼트 샘플링(Tournament Sampling)
- — 모델의 다음 토큰 후보를 토너먼트 방식으로 선택해 텍스트에 통계적 패턴을 심는 샘플링 기법입니다. Gumbel-max sampling을 기반으로 하며, 생성 결과의 워터마크 검출에 활용됩니다.
- Gumbel-max 샘플링(Gumbel-max Sampling)
- — 각 토큰의 확률에 Gumbel 잡음을 더한 뒤 최댓값을 선택해 확률적 샘플링을 수행하는 방법입니다. Tournament Sampling의 기반이 되는 표준 기법으로 제시됐습니다.
- 유니코드 변형 선택자(Unicode Variation Selectors)
- — 문자나 이모지의 표시 형태를 지정하는 의미 있는 Unicode codepoint입니다. 실험에서는 텍스트 곳곳에 삽입해 정규화 이후에도 남고 워터마크 점수를 낮추는 공격 수단으로 사용됐습니다.
- 토큰 엔트로피(Token Entropy)
- — 모델이 다음 토큰을 얼마나 불확실하게 선택하는지를 나타내는 정보량입니다. 글의 워터마크 강도와 연결되며, 선택지가 적은 저엔트로피 코드에서는 워터마크가 약해지는 원인으로 제시됐습니다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
