섹션별 상세
HN Bot Detector는 댓글 URL, ID 또는 원문 텍스트를 입력받아 즉각적인 봇 점수를 제공하며, 사용자별 최근 50개 댓글 분석 및 게시물 전체 스캔 기능을 갖추고 있다.
점수 산정 방식은 TF-IDF 벡터를 활용한 문구 탐지를 포함하며, 'additionally', 'furthermore'와 같은 전환어와 'leverage', 'seamless' 같은 AI 특유의 유행어(Buzzwords)를 식별한다.
문장 구조 분석에서는 축약어 미사용, 특정 단어 수(150-400단어), 3단락 구성 등 LLM 출력물에서 흔히 발견되는 전형적인 형태에 가산점을 부여한다.
키보드 입력 시 발생하는 직선 따옴표 대신 LLM이 주로 출력하는 유니코드 곡선 따옴표(Curly quotes)나 특수 대시(Em dash, En-dash)를 탐지하여 외부 복사-붙여넣기 흔적을 추적한다.
사용자 수준 분석에서는 24시간 내 5개 이상의 댓글 작성 빈도와 사용자 댓글 간의 시맨틱 유사도(Cosine similarity)를 계산하여 반복적인 패턴을 확인한다.
용어 해설
- 단어 빈도-역문서 빈도(TF-IDF)
- — 단어 빈도와 역문서 빈도를 사용하여 텍스트 내 단어의 중요도를 평가하고 벡터화하는 통계적 수치이다. 특정 문서에서 자주 등장하지만 전체 문서군에서는 드문 단어에 높은 가중치를 주어 핵심어를 추출하는 데 유용하며 봇 탐지 시 문체 특징 파악에 활용된다.
- 코사인 유사도(Cosine Similarity)
- — 두 벡터 간의 각도 코사인 값을 이용하여 유사도를 측정하는 방식으로, 텍스트의 의미적 유사성을 비교할 때 주로 사용된다. 0에서 1 사이의 값을 가지며, 1에 가까울수록 두 텍스트의 주제나 내용이 매우 유사함을 의미하여 동일 사용자의 반복적 패턴 탐지에 효과적이다.
- 엔그램(N-gram)
- — 텍스트에서 n개의 연속된 단어나 문자의 나열을 의미하며, 문맥 파악 및 패턴 탐지에 활용된다. 개별 단어뿐만 아니라 단어의 조합을 분석함으로써 LLM이 자주 사용하는 특정 문구의 흐름이나 구조적 특징을 더 정밀하게 식별할 수 있게 한다.
- 유니코드 신호(Unicode Signals)
- — 키보드로 직접 입력하기 어려운 특수 문자로, LLM이 생성한 텍스트를 다른 곳에 붙여넣을 때 발생하는 흔적을 의미한다. 곡선 따옴표나 특정 대시 기호 등은 일반적인 웹 인터페이스 입력 시와 다른 유니코드 값을 가지므로 외부 생성 콘텐츠임을 판단하는 강력한 증거가 된다.
코드 예제
bash
git clone https://github.com/umairnadeem/hn-bot-detector.git
cd hn-bot-detector
pnpm install
cp .env.example .env.local
pnpm dev로컬 환경에서 HN Bot Detector를 설치하고 실행하는 방법
기술
- Next.js 14
- TypeScript
- Tailwind CSS
- Anthropic API
- OpenAI API
활용 사례
- 커뮤니티 댓글 필터링
- 사용자 활동 분석
- AI 생성 텍스트 검증
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 03. 02.수집 2026. 03. 02.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.