본문으로 건너뛰기

LLM이 만든 유령 저자 이름의 상관관계

LLM별 가공의 이름 조합이 허위 학술 기록과 실제 DOI 메타데이터로 확산되는 경로를 추적했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이 연구는 Elena Vasquez와 Marcus Chen처럼 실재하지 않는 이름들이 AI가 만든 수백 개의 독립 문서에서 반복적으로 같은 인물 조합으로 등장하는 현상을 조사합니다. Claude, Gemini, GPT는 각기 다른 이름 쌍과 삼인조를 선호하며, 이런 조합은 우연보다 높은 동시 출현율과 모델 출시 시점에 따른 변화 흔적을 보입니다. 연구진은 Zenodo에서 존재하지 않는 저널과 조작된 출판일을 내세운 유령 저자 기록 1,655건을 찾았고, 그중 991건이 한 달에 등록됐으며 DataCite 서버 기록이 의도적인 날짜 소급을 뒷받침한다고 밝혔습니다. 실제 DOI를 가진 허위 기록은 학술 집계 서비스로 수집될 수 있고, ResearchGate의 가상 연구 그룹과 함께 모델 배포 시기를 추정하는 단서가 됩니다.

섹션별 상세

01
Elena Vasquez와 Marcus Chen은 화산 전문가, 우주비행사, 스릴러 주인공, 팟캐스트 진행자, 학술 공동 저자로 서로 다른 AI 생성 문서에 반복 등장하지만 실재하지 않는 이름입니다. 연구진은 LLM이 허구의 전문가를 만들 때 개별적으로 확률이 높은 이름 하나만 선택하지 않고, 함께 등장하는 인물 앙상블을 생성한다는 패턴을 관찰했습니다. 수백 개의 독립 생성물에서 특정 쌍과 삼인조의 동시 출현율이 우연히 기대되는 수준을 크게 웃돌아, 생성 결과가 공유된 이름 사전확률의 영향을 받는다는 의미를 갖습니다.
02
이름 조합은 모든 모델에서 같지 않고 모델 계열과 버전에 따라 달라집니다. Claude에서는 Elena Vasquez, Marcus Chen, Amara Okafor 조합이, Gemini에서는 Aris Thorne과 Lena Petrova 조합이 반복되며, GPT에서는 Elara Voss가 고정된 동반자 없이 등장합니다. 모델 출시 경계에서 이런 선호가 적극적으로 억제되기 때문에 생성 문서에 남은 이름 조합과 날짜를 함께 읽으면 특정 모델의 배포 시기를 추정할 수 있는 행동 지문이 됩니다.
03
연구진은 이러한 이름 사전확률이 웹과 학술 출판 기록으로 확산된 규모를 확인하기 위해 Zenodo를 조사했습니다. CERN이 운영하고 실제 DataCite DOI를 발급하는 저장소에서 존재하지 않는 저널과 조작된 출판일을 내세운 유령 저자 기록 1,655건을 찾았으며, 이 기록들은 실제 DOI 등록 과정에 편입돼 있었습니다. 문서에 적힌 날짜와 서버 측 DataCite 타임스탬프가 어긋나고 991건이 한 달에 등록된 사실은 단순한 생성 오류를 넘어 의도적인 날짜 소급 정황을 제공합니다.
04
실제 DOI를 가진 허위 기록은 DOI 메타데이터를 수집하는 학술 집계 서비스에 자동으로 들어갈 수 있습니다. ResearchGate에서도 유령 이름이 여러 모델 계열에서 나온 협력자들과 합성 연구 그룹을 이루며, 해당 기록의 출판일은 모델 배포 기간을 추정하는 시간적 대리 지표로 활용됩니다. 따라서 문제의 범위는 LLM이 가공의 인물을 만드는 데 그치지 않고, 서지 데이터베이스와 연구자 네트워크에 검증되지 않은 저자·저널·날짜를 주입하는 단계까지 이어집니다.

용어 해설

상관된 이름 사전확률(Correlated Name Priors)
언어 모델이 개별적으로 흔한 이름을 고르는 데 그치지 않고, 특정 이름들이 함께 등장할 가능성까지 학습한 경향입니다. 이 연구에서는 모델별로 반복 생성되는 가공의 인물 조합을 가리킵니다.
동시 출현율(Co-occurrence Rate)
두 개 이상의 이름이나 항목이 같은 문서 또는 생성 결과에 함께 나타나는 비율입니다. 연구진은 특정 이름 쌍의 동시 출현율이 우연히 기대되는 수준을 크게 웃도는지 비교해 상관관계를 확인했습니다.
모델 출시 경계(Model Release Boundary)
모델의 새 버전이나 배포 시점이 바뀌는 경계입니다. 이 연구에서는 이름 조합의 출현 여부가 출시 경계에서 억제되며, 생성 문서에 모델 버전을 추정할 수 있는 시간 흔적을 남긴다고 봅니다.
DataCite 타임스탬프(DataCite Timestamp)
DataCite가 DOI 등록 과정에서 기록하는 서버 측 시간 정보입니다. 문서에 적힌 출판일과 실제 등록 시점을 대조하면 허위 날짜를 과거로 조작했는지 판단하는 단서가 됩니다.
DOI 메타데이터(DOI Metadata)
DOI에 연결된 제목, 저자, 저널, 출판일 같은 서지 정보입니다. 학술 검색 서비스가 이 정보를 자동 수집하므로, 허위 기록도 실제 DOI를 얻으면 여러 집계 시스템으로 퍼질 수 있습니다.

기술

  • Claude
  • Gemini
  • GPT
  • Zenodo
  • DataCite
  • ResearchGate
  • DOI
  • arXiv

활용 사례

  • DOI 메타데이터를 수집하는 학술 검색·집계 서비스의 허위 기록 탐지
  • 생성 문서의 이름 조합과 출판일을 이용한 모델 배포 시기 추정
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 02.수집 2026. 09. 02.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.