본문으로 건너뛰기
All About AI조회 1

OpenAI와 Anthropic의 AI 예측 대결 2주차 진행 상황

OpenAI와 Anthropic 모델을 활용해 Polymarket의 예측 시장에서 실제 베팅을 진행하는 AI 에이전트 대결 2주차 과정이다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

OpenAI의 GPT-5.6과 Anthropic의 Claude Opus 5를 활용한 Polymarket 예측 대결 2주차 과정이다. 모델들은 아리아나 그란데의 앨범 판매량, 미국 실업률, 런던의 최고 기온을 예측했다. 코딩 에이전트를 통해 벤치마크 지침을 자동으로 실행하고, 도출된 확률값에 따라 실제 베팅을 진행했다. 두 모델은 대부분의 지표에서 유사한 예측을 내놓았으며, 최종 결과는 실제 시장 데이터 발표 이후 결정된다.

챕터별 상세

00:00

AI 예측 대결 2주차 개요

AI 모델의 예측 능력을 검증하는 Polymarket 배틀 2주차가 시작되었다. OpenAI의 GPT-5.6과 Anthropic의 Claude Opus 5가 경쟁 모델로 참여했다. 이번 주에는 아리아나 그란데의 앨범 판매량, 미국 실업률, 런던의 최고 기온이라는 3가지 이벤트에 대해 모델들의 예측을 수행한다.
02:12

GPT-5.6 모델 예측 실행

코딩 에이전트를 사용하여 GPT-5.6 모델에 벤치마크 지침을 입력하고 예측을 수행했다. 모델은 3가지 이벤트에 대해 각각 확률 분포를 생성했다. 생성된 결과는 검증 스크립트를 통해 유효성을 확인받았으며, 앨범 판매량과 기온 예측에서 특정 구간을 선호하는 결과를 보였다.
04:07

Claude Opus 5 모델 예측 실행

이전 모델의 흔적을 제거한 후 Claude Opus 5 모델을 실행했다. 동일한 벤치마크 지침을 사용하여 예측을 수행하고 결과를 도출했다. Claude 모델 역시 앨범 판매량과 실업률 등에 대해 확률값을 산출했으며, GPT-5.6과 유사하거나 약간 다른 수치를 제시했다.
bash
read benchmark_run/INSTRUCTIONS.md and execute your predictions for this week

벤치마크 지침 파일을 읽고 이번 주 예측을 실행하는 명령어이다.

04:40

Polymarket 베팅 실행

모델들이 도출한 예측 결과를 바탕으로 Polymarket에서 실제 베팅을 진행했다. 런던 최고 기온 23도, 7월 실업률 4.2%, 아리아나 그란데 앨범 판매량 250k-300k 구간에 자금을 투입했다. 각 모델의 예측 확률이 높은 구간에 맞춰 주문을 생성하고 체결 여부를 확인했다.
python
python3 validate_submission.py

모델이 생성한 예측 결과가 유효한지 검증하는 스크립트이다.

05:37

결과 비교 및 마무리

두 모델의 예측 결과를 비교한 결과, 대부분의 이벤트에서 유사한 구간을 지목했다. 다만 아리아나 그란데 앨범 판매량 예측에서 미세한 차이가 발생했다. 모든 베팅이 완료되었으며, 이제 실제 시장 데이터가 발표될 때까지 결과를 기다리는 단계이다.

용어 해설

폴리마켓(Polymarket)
실제 사건의 결과를 두고 사용자들이 예측에 베팅하는 탈중앙화 예측 시장 플랫폼이다. AI 모델의 추론 능력을 검증하기 위한 벤치마크 데이터로 활용된다.
코딩 에이전트(Coding Agent)
사용자의 명령을 받아 코드를 작성, 수정, 실행하는 자율형 AI 시스템이다. 본 영상에서는 벤치마크 스크립트를 실행하고 예측 결과를 도출하는 데 사용되었다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 06.수집 2026. 08. 06.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.