본문으로 건너뛰기

오픈소스 AI 탐지기의 실제 성능

오픈소스 AI 탐지기 6개를 같은 오탐률로 비교하자 패러프레이즈와 비원어민 글에서 체계적 한계가 드러났습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

오픈소스 AI 텍스트 탐지기 6개를 동일한 절차로 평가한 결과, 인간 문서 오탐률을 0.5%로 맞추면 여러 모델의 실제 탐지력이 크게 낮아졌습니다. 평가자는 6,930개의 인간 문서로 threshold를 맞춘 뒤 raw AI, humanizer로 패러프레이즈한 AI, GPT-5.x·Claude Opus 5·Gemini 3.x 문서의 recall을 비교했습니다. 최고 성능 모델인 tropa-mini도 humanized AI를 41.6%만 잡았고, 두 번째 모델은 4.0%에 그쳤으며, MAGE는 인간 웹 문서의 26%에 0.9999 초과 점수를 부여해 목표 오탐률 자체에 도달하지 못했습니다. 모든 모델이 비원어민 TOEFL 에세이를 기준 비율보다 더 자주 AI로 판정해, 문제가 단일 모델의 결함이 아니라 AI 탐지 범주 전반의 체계적 실패일 가능성을 드러냈습니다.

섹션별 상세

01
평가는 Jabarian & Imas 2025 NBER 자료, Liang 2023 TOEFL 에세이, GPT-5.x·Claude Opus 5·Gemini 3.x 문서 1,060개, 2018년 FineWeb 인간 문서 5,000개를 묶어 진행됐습니다. 각 모델은 동일한 인간 문서 6,930개에서 threshold를 정해 False Positive Rate를 0.5%로 맞췄고, 그 뒤 문서 집단별 recall을 측정했습니다. 모델마다 threshold를 제각각 고르는 대신 같은 오탐 조건에서 비교했기 때문에 탐지율 수치를 직접 대조할 수 있습니다.
02
raw AI에서는 tropa-mini가 ROC-AUC 0.968과 recall 93.2%로 가장 높았고, desklib/ai-text-detector-v1.01은 83.9%를 기록했습니다. 반면 SuperAnnotate/ai-detector, Hello-SimpleAI/chatgpt-detector-roberta, roberta-large-openai-detector는 같은 0.5% FPR 조건에서 각각 0.5%, 0.8%, 0.0%의 raw AI recall에 머물렀습니다. 오래된 OpenAI RoBERTa detector의 ROC-AUC는 0.31로 현대 생성기에 대한 구분력이 동전 던지기보다 낮은 수준이었습니다.
03
Humanizer 패러프레이즈를 거치면 tropa-mini의 recall은 41.6%로 떨어지고 두 번째 모델은 4.0%에 그쳤으며, 최신 frontier model 문서에서는 각각 33.6%와 1.8%였습니다. yaful/MAGE는 어떤 threshold에서도 0.5% FPR을 달성하지 못했고, 인간 웹 텍스트의 26%에 0.9999 초과 점수를 부여했습니다. 모든 모델이 비원어민 TOEFL 에세이를 기준 비율보다 많이 AI로 분류했으므로, 문체 집단에 따른 체계적 오탐 문제가 특정 모델 하나의 오류로 한정되지 않습니다.
04
작성자는 6개 모델 중 하나가 자체 hosted detector에서 사용하던 모델이며 Apache-2.0 라이선스로 open weights를 공개했다고 밝혔습니다. 데이터셋과 평가 방법은 model card에 함께 담겼고, 제공된 Hugging Face 저장소에서 동일한 실험을 다시 실행할 수 있습니다. 다만 자체 모델이 포함된 비교인 만큼 tropa-mini의 수치는 외부 재현으로 별도 확인할 필요가 있습니다.

용어 해설

오탐률(False Positive Rate (FPR))
실제로 인간이 작성한 문서를 AI 생성물로 잘못 판정하는 비율입니다. 이 평가에서는 인간 문서 6,930개 중 오탐률을 0.5%로 맞추도록 각 탐지기의 threshold를 조정한 뒤 AI 문서 탐지 성능을 비교했습니다.
ROC-AUC
모델의 threshold를 바꿔가며 참양성률과 거짓양성률의 균형을 측정하는 지표입니다. 0.5는 무작위 추측과 같고 1에 가까울수록 AI와 인간 문서를 잘 구분하지만, 특정 오탐률에서의 실제 recall과는 별도로 해석해야 합니다.
재현율(Recall)
실제로 AI가 생성한 문서 가운데 탐지기가 AI로 올바르게 판정한 비율입니다. 원문 AI, humanizer로 바꾼 AI, 최신 frontier model 문서를 나누어 계산했기 때문에 문체 변형과 모델 세대에 따른 성능 차이를 확인할 수 있습니다.
Humanizer 패러프레이즈(Humanizer Paraphrase)
AI가 만든 문장을 별도의 변환 도구로 다시 바꾸어 인간이 쓴 것처럼 보이게 만든 텍스트입니다. 이 평가에서는 대부분의 탐지기 recall이 원문 AI보다 크게 낮아져, 문장 표면을 바꾸는 처리에 탐지기가 취약함을 드러냈습니다.
최신 프런티어 모델(Frontier Models)
평가 시점의 최상위권 생성 모델을 가리키는 표현입니다. 테스트 세트에는 GPT-5.x, Claude Opus 5, Gemini 3.x가 포함됐으며, 일부 탐지기는 이 문서군에서 raw AI보다 더 낮은 recall을 기록했습니다.

언급된 도구

HF중립링크

평가 데이터와 model card를 확인하고 공개된 모델 가중치와 방법론을 재현하는 데 사용됩니다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 02.수집 2026. 09. 02.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.