TL;DR
Anthropic의 Claude에 도입된 텍스트 워터마크 기술은 구글이 Nature에 발표한 통계적 편향 삽입 방식을 기반으로 한다. 이 기술은 텍스트 생성 시 특정 점수 함수(해시 함수) 값이 높은 단어를 의도적으로 선택하여 문장에 보이지 않는 흔적을 남긴다. 사후 검증 시 텍스트 전체의 점수 평균이 무작위 기댓값인 0.5보다 유의미하게 높으면 AI 생성물로 판정하며, 이는 단어 하나를 바꾸는 수정에도 견고하게 작동한다. 다만 최적의 확률을 가진 단어 대신 점수가 높은 단어를 선택해야 하므로 모델의 출력 품질이 다소 저하될 수 있는 트레이드오프가 존재한다.
챕터별 상세
텍스트 데이터의 특성과 워터마킹의 어려움
워터마크 삽입을 위한 핵심 도구인 점수 함수의 정의
서브워드(Subword)는 언어 모델이 텍스트를 처리하는 최소 단위로, 단어보다 작은 조각으로 나뉜 형태를 의미한다.
LLM의 단어 생성 및 샘플링 방식의 이해
점수 함수를 이용한 텍스트 워터마크 삽입 메커니즘
통계적 평균을 이용한 워터마크 유무 검증 방법
워터마크 적용에 따른 모델 성능 저하 문제
용어 해설
- 텍스트 워터마킹(Text Watermarking)
- — 생성형 AI가 만든 텍스트에 육안으로는 식별하기 어려운 통계적 패턴을 삽입하여 사후에 해당 텍스트의 AI 생성 여부를 판별할 수 있게 하는 기술이다.
- 점수 함수(Score Function)
- — 텍스트 조각(Subword)을 입력받아 0에서 1 사이의 값을 출력하는 함수로, 워터마크 삽입 시 단어 선택의 기준이 되는 일종의 해시 함수 역할을 수행한다.
- 서브워드 샘플링(Subword Sampling)
- — 언어 모델이 다음에 올 단어들의 확률 분포를 계산한 뒤, 그 확률에 기반하여 실제로 출력할 단어를 무작위적으로 선택하는 과정을 의미한다.
- 통계적 편향(Statistical Bias)
- — 데이터의 분포가 무작위적인 상태에서 벗어나 특정 방향으로 쏠리는 현상으로, 워터마크 검증 시 점수 평균이 기댓값보다 높게 나타나는 근거가 된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

