본문으로 건너뛰기

언어 모델을 활용한 세계 사건 예측 (OpenForecaster 프로젝트)

언어 모델의 세계 사건 예측 능력을 평가하고, 뉴스 데이터를 활용한 사후 학습과 보정 평가 기법을 통해 예측 정확도를 높이는 연구를 다룬다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이 영상은 언어 모델을 활용한 세계 사건 예측 프로젝트인 'OpenForecaster'를 소개하며, 모델의 예측 능력을 평가하고 개선하는 방법론을 다룬다. 기존 예측 모델 평가의 주요 문제인 데이터 누수와 평가 지표의 한계를 지적하고, 일간 뉴스 데이터를 활용한 사후 학습(post-training)과 브라이어 스킬 점수(Brier Skill Score) 기반의 보정 평가 방식을 제안한다. 또한, 과거 사건을 재현하는 'FutureSim' 환경을 통해 모델의 지속적인 학습 및 적응 능력을 측정하고, 다중 에이전트 환경에서의 예측 성능 향상 가능성을 탐구하며 인공지능이 인간의 의사결정을 돕는 도구로서 나아갈 방향을 제시한다.

챕터별 상세

00:00

소개 및 프로젝트 개요

Shashwat Goel이 OpenForecaster 프로젝트를 소개한다. 언어 모델을 활용하여 세계 사건을 예측하고, 모델의 예측 능력을 평가하며 지속적으로 학습하는 방법을 연구한다.
02:26

예측의 정의

예측을 미래의 사건이나 추세를 예측하는 것으로 정의한다. 전통적인 머신러닝의 시계열 예측과는 달리, 언어 모델을 활용해 자연어 질문에 대한 자유 형식의 예측을 수행한다.
04:37

예측의 중요성

예측은 지능의 중요한 척도이며, 세상이 어떻게 변할지 추론하는 세계 모델링의 일환이다. 언어 모델이 미래 사건을 예측함으로써 인간의 의사결정을 돕는 도구로 활용될 수 있다.
10:12

평가의 함정

언어 모델 예측 평가 시 발생하는 데이터 누수와 평가 지표의 문제를 설명한다. 모델이 미래 정보를 미리 학습하거나, 질문 자체가 답을 암시하는 경우 성능이 왜곡된다.
16:15

데이터 누수 없는 검색

데이터 누수를 방지하기 위해 일간 뉴스 데이터를 오프라인 코퍼스로 구축한다. Qwen3-8B 임베딩 모델을 사용하여 질문과 관련된 뉴스 청크를 검색하고, 이를 프롬프트에 주입하여 예측을 수행한다.
17:14

개방형 질문

예/아니오 형태의 이진 질문 대신 개방형 질문을 활용한다. 모델이 스스로 답을 생성하게 함으로써 더 많은 학습 신호를 얻고, 모델의 추론 능력을 평가한다.
21:20

학습 데이터 파이프라인

뉴스 기사로부터 질문을 생성하고, 유효성을 검사하며, 데이터 누수를 제거하는 파이프라인을 구축한다. 이를 통해 약 6만 개의 고품질 예측 학습 데이터를 확보한다.
25:20

RL 학습 결과

GRPO 기법을 사용하여 Qwen3 모델을 강화학습한다. 브라이어 스킬 점수와 정확도를 보상으로 사용하여 모델의 예측 성능을 향상시킨다.
27:42

FutureSim 개요

과거의 뉴스 데이터를 사용하여 미래를 시뮬레이션하는 FutureSim 환경을 소개한다. 모델이 새로운 정보에 따라 예측을 지속적으로 업데이트하는 능력을 측정한다.
32:07

프론티어 모델 벤치마크

GPT-5.5, DeepSeek V4 Pro 등 다양한 모델의 예측 성능을 비교한다. 모델의 크기뿐만 아니라 추론 노력(tool calls)이 예측 성능에 미치는 영향을 분석한다.
33:32

적응형 메모리 검색

모델이 새로운 정보에 따라 예측을 업데이트하는 과정을 분석한다. 메모리 접근 권한이 있는 모델이 그렇지 않은 모델보다 예측 성능이 우수함을 확인한다.
36:51

다중 에이전트 효과

다중 에이전트 환경에서 모델들이 서로의 예측을 참고하여 예측을 업데이트하는 효과를 실험한다. 에이전트들이 서로 다른 예측을 내놓으며 수렴하는 과정을 관찰한다.
38:14

지속 학습의 비전

지속 학습(Continual Learning)을 인공지능의 다음 과제로 제시한다. 지식 업데이트, 능동적 학습, 경험을 통한 학습을 통해 모델이 현실 세계에 적응해야 한다고 강조한다.
41:12

결론 및 질의응답

발표 내용을 요약하고 질의응답을 진행한다. AI가 인간의 의사결정을 돕는 도구로서의 비전을 다시 한번 강조한다.

용어 해설

브라이어 스킬 점수(Brier Skill Score)
확률 예측의 정확도를 평가하는 지표로, 예측 확률과 실제 결과 간의 차이를 제곱하여 계산한다. 예측 모델이 무작위 추측보다 얼마나 더 나은 성능을 보이는지 측정하며, 모델의 보정(calibration) 능력을 평가하는 데 사용된다.
보정(Calibration)
모델이 출력하는 예측 확률이 실제 사건 발생 확률과 일치하는 정도를 의미한다. 예를 들어, 모델이 70% 확률로 예측한 사건이 실제로 70%의 빈도로 발생해야 보정이 잘 된 모델로 간주한다.
데이터 누수(Leakage)
학습 데이터나 평가 데이터에 미래의 정보가 포함되어 모델이 이를 미리 학습하는 현상이다. 예측 모델 평가 시 미래 정보를 미리 알게 되면 성능이 과대평가되므로, 이를 방지하기 위한 엄격한 시간 기준 설정이 필수적이다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 18.수집 2026. 07. 18.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.