TL;DR
작성자는 같은 LinkedIn 프로필 URL에 User-Agent만 바꿔 여섯 차례 요청해 GPTBot, ClaudeBot, ChatGPT-User, Googlebot은 HTTP 999로 차단되고 OAI-SearchBot과 Claude-SearchBot은 HTTP 200을 받는 결과를 재현했습니다. 접근이 허용된 페이지에는 일반적인 직장인의 이름, 위치, 회사명, 학교명과 공개 게시물은 남지만 직무명, 경력 기간, 소개, 기술, 자격증 같은 핵심 직업 정보는 빠져 있었습니다. JSON-LD에서도 Person 노드가 없고 WebPage와 네 개의 DiscussionForumPosting 노드만 확인됐으며, 공개 인물 계정조차 직무명은 빈 문자열로 전달되고 소개가 중간에 잘렸습니다. 따라서 검색 증강을 사용하는 모델이 사람의 현재 직업을 답할 때 실제 프로필보다 회사명과 오래된 게시물을 근거로 삼고 나머지를 추정할 위험이 있지만, 빈 직무명이 정책인지 페이지 조립 방식의 부산물인지와 새로 크롤링 가능한 자료가 오래된 출처를 대체하는지는 확인되지 않았습니다.
섹션별 상세
용어 해설
- JSON-LD
- — 웹페이지 안에 구조화된 데이터를 표현하는 JSON 기반 형식입니다. 이 글에서는 LinkedIn 페이지가 WebPage, Person, DiscussionForumPosting 같은 노드로 어떤 정보를 외부에 제공하는지 확인하는 데 사용됐습니다.
- User-Agent
- — 웹 요청을 보낸 클라이언트의 종류를 서버에 알리는 문자열입니다. LinkedIn은 요청마다 User-Agent를 다르게 제시했을 때 크롤러별로 HTTP 999 또는 HTTP 200을 반환했습니다.
- 모델이 답변을 만들 때 외부 문서나 웹페이지에서 관련 정보를 찾아오는 과정입니다. 글에서는 LinkedIn의 불완전한 프로필 정보와 오래된 게시물이 사람에 대한 답변의 근거가 될 수 있다고 지적합니다.(Retrieval)
- — 모델이 답변을 만들 때 외부 문서나 웹페이지에서 관련 정보를 찾아오는 과정입니다. 글에서는 LinkedIn의 불완전한 프로필 정보와 오래된 게시물이 사람에 대한 답변의 근거가 될 수 있다고 지적합니다.
- IP 주소를 도메인 이름으로 되돌려 확인하는 방식입니다. 글에서는 LinkedIn이 Googlebot 요청을 실제 Google 크롤러인지 판별하기 위해 reverse DNS 검증을 사용하는 것으로 추정하지만, 이를 직접 입증하지는 못했습니다.(reverse DNS)
- — IP 주소를 도메인 이름으로 되돌려 확인하는 방식입니다. 글에서는 LinkedIn이 Googlebot 요청을 실제 Google 크롤러인지 판별하기 위해 reverse DNS 검증을 사용하는 것으로 추정하지만, 이를 직접 입증하지는 못했습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.