yaojingang/geo-citation-lab
HTML1 / 0
이 레포지토리는 GEO 실증 연구와 CN-GEO 데이터셋을 통해 생성형 검색의 인용 선택과 흡수 과정을 계측한 데이터·보고서·문헌집을 포함한다.
TL;DR
이 저장소는 생성형 검색 엔진의 콘텐츠 노출과 인용이 어떻게 이루어지는지를 계측하기 위해 크로스플랫폼 실험 데이터와 CN-GEO 대규모 인용 기록을 함께 제공한다. 연구는 인용의 '선택' 단계와 '흡수' 단계를 분리해 플랫폼별로 인용 목록에 드는 소스 수와 그 소스가 실제 답변 내용에 미치는 영향력을 각각 측정했으며, 602개 통제 프롬프트와 21,143개의 검색층 인용 기록 등 구체적 계측값을 공개했다. Parquet와 DuckDB 형태의 정제 데이터, 수집·정제 스크립트, 최종 리포트와 관련 논문 링크를 함께 배포해 연구 재현과 추가 분석을 지원하나 저장소 전체에 대한 단일 통합 라이선스는 제공되지 않아 재사용 전 하위 디렉토리별 라이선스 확인이 필요하다.
핵심 포인트
- 선택(selection)과 흡수(absorption)를 분리한 측정 프레임워크를 사용한다. 기존 연구들이 주로 인용 빈도나 단일 노출 지표에만 의존하던 점과 달리 본 연구는 인용이 단순 노출인지 실제 답변 내용에 통합되는지까지 추적해 플랫폼 간 차이를 밝힌다. 이 접근은 인용의 질과 흡수의 심도를 동시에 비교할 수 있게 해 플랫폼 최적화 연구에 직접적인 분석 근거를 제공한다.
- CN-GEO는 대규모 원자료와 정제 테이블을 함께 배포한다. 214,119개의 원시 인용 기록과 Parquet·DuckDB 형태의 정제본을 포함해 사용자가 바로 쿼리·합성·재현할 수 있도록 구성되어 있으며 데이터 품질 리포트와 분할별 설명 자료를 동봉한다. 이러한 구성은 연구 재현성과 데이터 재사용성을 높여 후속 분석과 방법 검증을 용이하게 한다.
- 실험 파이프라인과 리포트가 함께 제공되어 결과 추적이 가능하다. 크로스플랫폼 실험의 데이터 수집·처리 파이프라인과 최종 보고서가 동일 저장소에 배치되어 있어 원자료에서 최종 결과까지의 처리 흐름을 따라갈 수 있다. 이 배치는 연구자나 실무자가 실험을 재실행하거나 파생 분석을 수행할 때 필요한 모든 구성 요소를 한곳에서 확보하게 한다.
- 크로스플랫폼 실험 데이터를 제공한다. 실험은 602개 통제된 프롬프트와 21,143개의 검색층 인용 기록을 포함하며, 18,151개의 성공적으로 크롤된 페이지에서 72차원 특성을 추출해 플랫폼별 인용 선택과 흡수 차이를 계측하도록 구성되었다. 제공 데이터는 분석 재현을 위해 파이프라인과 Markdown/HTML 리포트, 원자료 링크를 함께 포함한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| cross-platform prompts | count | 602 | — |
| search-layer citations recorded | count | 21,143 | — |
| citation-level feature records | count | 23,745 | — |
| successfully crawled pages | count | 18,151 | — |
| CN-GEO raw citation records | count | 214,119 | — |
| CN-GEO canonical pages | count | 107,659 | — |
| CN-GEO canonical sources | count | 9,878 | — |
| CN-GEO JSONL shards | count | 64 | — |
531
STARS
106
FORKS
+206
TRENDING
1
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.