본문으로 건너뛰기

FutureSim: 세계 이벤트의 재생으로 적응형 에이전트를 평가하는 연구

FutureSim은 모델의 지식 컷오프 이후 세계가 어떻게 전개되는지에 대한 예측 능력을 평가한다. 실제 뉴스 데이터를 시간 순으로 재생하고 ground-truth 피드백을 제공받아 예측을 업데이트하도록 요구하므로, 장기간의 테스트-타임 적응과 불확실성 추론을 체계적으로 비교할 수 있다. 기존 벤치마크가 제한된 시나리오를 다루는 반면, FutureSim은 현실 세계의 연속 이벤트를 기반으로 한 평가를 가능하게 한다.

용어 해설

CCNews
Common Crawl News의 날짜별 스냅샷 기사 모음으로 FutureSim의 외부 맥락 정보를 제공하는 데이터셋이며, 뉴스 기사 텍스트, 출처, 게시일 등을 포함한다.
브라이어 스킬 점수(Brier Skill Score)
예측 분포의 정확성과 보정을 함께 평가하는 점수로, 1은 완벽한 예측, 0은 미예측, −1은 잘못된 예측에 대한 큰 페널티를 의미한다.
LanceDB
뉴스 코퍼스의 하이브리드 검색(semantic + keyword) 엔진으로, 기사 조각을 512토큰 단위로 임베딩하고 색인한다.
Qwen3 Embedding 8B
512토큰 단위의 텍스트 조각에 대해 8B 규모의 임베딩을 생성하고 검색 정확도를 높이는 임베딩 모델이다.
CCNews 컨텍스트(CCNews Context)
FutureSim에서 사용할 날짜 기반 기사 컨텍스트로, 오늘 날짜까지의 기사만 읽도록 제한된 외부 맥락 저장소이다.
샌드박싱(Sandboxing)
LLM 실행을 격리된 샌드박스에서 수행하게 하여 미래 정보 누설을 방지하는 보안 기법이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 14.수집 2026. 05. 16.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.