본문으로 건너뛰기
r/artificial조회 3

Claude 텍스트 워터마크 우회 실험

Unicode Variation Selectors 삽입이 텍스트 워터마크 점수를 45에서 1 미만으로 낮췄습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 Claude, OpenAI, Gemini 텍스트 워터마크를 생성하고 검출하는 도구를 만든 뒤 gpt-oss-20b와 Qwen 출력에 약 300회의 편집 공격을 적용했습니다. 대시 교체, Markdown 제거, 미국식·영국식 철자 변환은 검출 점수에 거의 영향을 주지 않았고, 단어의 40%를 삭제하는 공격만 임계값을 넘겼지만 텍스트가 크게 훼손됐습니다. 반면 Unicode Variation Selectors를 문자 약 30%에 삽입하자 워터마크 점수가 45에서 1 미만으로 떨어졌으며, 정규화 이후에도 codepoint가 유지됐습니다. 코드 출력은 다음 토큰의 불확실성이 낮아 워터마크 강도 자체가 약했고, 일부 샘플은 공격 없이도 사실상 검출되지 않았습니다.

섹션별 상세

01
작성자는 Claude 텍스트 워터마크를 문장을 다시 쓰지 않고 일부 문자만 편집해 제거할 수 있는지 확인하기 위해 생성기와 검출기를 직접 만들었습니다. em dash를 하이픈으로 바꾸거나 Markdown을 제거하거나 AmE 철자를 BrE로 바꾸는 방식은 거의 효과가 없었고, 약 300회 테스트에서 검출 임계값을 넘긴 공격은 단어마다 40%를 삭제한 경우뿐이었습니다. 이 방법은 텍스트 자체를 심하게 훼손하므로 실용적인 우회책으로 보기 어렵습니다.
02
Unicode Variation Selectors를 텍스트 문자의 약 30%에 삽입한 공격은 다른 보이지 않는 문자 기법과 달리 정규화 뒤에도 유지됐습니다. 이 codepoint가 이모지와 CJK 렌더링에 실제 의미를 가지므로 정규화기가 안전하게 제거하기 어렵다는 점이 원인입니다. 실험에서 워터마크 점수는 45에서 1 미만으로 떨어졌고, 10회 중 10회 일관되게 검출을 회피했습니다.
03
워터마크 강도는 모델이 다음 토큰을 선택할 때의 불확실성과 함께 변하며, 코드처럼 다음 토큰의 선택지가 좁은 저엔트로피 출력에서는 처음부터 워터마크가 약했습니다. 따라서 일부 코드 샘플은 별도의 공격 없이도 사실상 워터마크가 없는 상태로 나왔습니다. 이 결과는 텍스트와 코드에 동일한 워터마크 검출 기준을 적용할 때 출력 유형별 검출 성능 차이를 별도로 측정해야 함을 뜻합니다.

용어 해설

토너먼트 샘플링(Tournament Sampling)
모델의 다음 토큰 후보를 토너먼트 방식으로 선택해 텍스트에 통계적 패턴을 심는 샘플링 기법입니다. Gumbel-max sampling을 기반으로 하며, 생성 결과의 워터마크 검출에 활용됩니다.
Gumbel-max 샘플링(Gumbel-max Sampling)
각 토큰의 확률에 Gumbel 잡음을 더한 뒤 최댓값을 선택해 확률적 샘플링을 수행하는 방법입니다. Tournament Sampling의 기반이 되는 표준 기법으로 제시됐습니다.
유니코드 변형 선택자(Unicode Variation Selectors)
문자나 이모지의 표시 형태를 지정하는 의미 있는 Unicode codepoint입니다. 실험에서는 텍스트 곳곳에 삽입해 정규화 이후에도 남고 워터마크 점수를 낮추는 공격 수단으로 사용됐습니다.
토큰 엔트로피(Token Entropy)
모델이 다음 토큰을 얼마나 불확실하게 선택하는지를 나타내는 정보량입니다. 글의 워터마크 강도와 연결되며, 선택지가 적은 저엔트로피 코드에서는 워터마크가 약해지는 원인으로 제시됐습니다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 17.수집 2026. 08. 17.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.