섹션별 상세
AI2는 2025년 2월부터 8월까지 수집된 258,935개의 쿼리와 432,059개의 클릭스트림 상호작용을 포함하는 Asta Interaction Dataset(AID)을 공개했다. 이는 연구용 AI 도구 사용에 관한 역대 최대 규모의 공개 데이터셋으로, 쿼리 텍스트뿐만 아니라 섹션 확장, 링크 클릭, 인용 확인 등 상세한 행동 로그를 포함한다.
연구자들의 AI 쿼리는 기존 학술 검색 엔진(Semantic Scholar)보다 평균 7배 더 길며(약 37단어), 더 많은 개체(Entity)와 관계(Relation), 제약 조건을 포함한다. 특히 사용자들이 자신의 초안에서 문단을 통째로 복사해 붙여넣는 등 매우 복잡한 컨텍스트를 제공하는 '헤비 테일' 분포가 관찰되었다.
사용자들은 일반 목적의 LLM(ChatGPT 등)에서 배운 프롬프트 엔지니어링 기법을 과학 도구에도 그대로 적용하고 있다. 페르소나 할당("교수처럼 생각하라"), 마크다운 강조, 표 템플릿 채우기 요청 등 도구가 공식적으로 지원하지 않는 기능까지 시도하며 AI를 '데이터 입력 어시스턴트'나 '공동 저자'로 활용한다.
AI가 생성한 리포트는 일회성 검색 결과가 아닌 '지속적인 자산'으로 취급된다. ScholarQA 사용자의 50% 이상이 생성된 리포트를 나중에 다시 방문하며, 이는 사용자들이 AI 결과를 북마크하고 연구 워크플로우의 일부로 참조하고 있음을 보여준다. 단순 쿼리 재전송 비율(15~19%)보다 재방문율이 훨씬 높다는 점이 특징이다.
연구자들은 AI 리포트를 처음부터 끝까지 순차적으로 읽지 않고 필요한 섹션만 골라 읽는 '비선형적 읽기' 패턴을 보인다. 분석 결과 서론을 건너뛰는 비율이 43%에 달하며, 섹션 간 이동이 매우 빈번하고 불규칙하게 발생한다. 이는 접이식 섹션과 요약 기능이 정보 취득 효율성에 기여하고 있음을 입증한다.
용어 해설
- 검색 증강 생성(RAG)
- — 외부 지식 베이스에서 관련 정보를 검색하여 대형 언어 모델의 답변 생성에 활용하는 기술이다. 모델의 내부 지식에만 의존하지 않고 최신 논문이나 특정 문서를 참조하여 답변의 정확도와 신뢰성을 높이는 데 핵심적인 역할을 한다.
- 클릭스트림(Clickstream)
- — 사용자가 웹사이트나 앱 내에서 수행한 모든 클릭 활동의 순차적인 기록이다. 어떤 버튼을 누르고 어떤 섹션을 확장했는지 등의 데이터를 통해 사용자의 정보 탐색 경로와 의도를 정밀하게 분석할 수 있다.
- 헤비 테일 분포(Heavy-tailed Distribution)
- — 분포의 끝부분(꼬리)이 일반적인 정규 분포보다 훨씬 두껍게 나타나는 통계적 특성이다. 본문에서는 소수의 사용자가 수백 단어에 달하는 매우 길고 복잡한 쿼리를 제출하여 전체 평균에 큰 영향을 미치는 현상을 의미한다.
- 분류 체계(Taxonomy)
- — 데이터나 개념을 체계적으로 분류하기 위한 구조적 틀이다. 이 연구에서는 연구자들의 질문 의도, 표현 방식, 검색 기준 등을 체계적으로 구분하여 AI 도구 활용 패턴을 정량화하는 데 사용되었다.
기술
- Asta
- Semantic Scholar
- LLM
- RAG
- Parquet
활용 사례
- 학술 문헌 자동 요약
- 복잡한 과학적 질문 답변
- 논문 인용 자동화 보조
- 데이터 추출 및 템플릿 작성
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 02. 27.수집 2026. 03. 01.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.