본문으로 건너뛰기
Science Daily AI조회 7

과학자들이 개발한 역대 가장 어려운 AI 테스트 '인류의 마지막 시험' 결과 공개

전 세계 전문가 1,000명이 참여해 기존 AI 모델들이 거의 해결하지 못하는 2,500개의 고난도 전문 지식 문항으로 구성된 새로운 벤치마크 HLE를 공개했다.

섹션별 상세

01
전 세계 1,000여 명의 전문가가 협력하여 기존 MMLU 등의 벤치마크를 뛰어넘는 2,500개 문항 규모의 '인류의 마지막 시험(HLE)'을 구축했다.
02
시험 문항은 단순한 인터넷 검색으로 해결할 수 없도록 설계되었으며, 고대 비문 번역이나 조류의 미세 해부학적 구조 식별 등 고도의 전문성을 요구한다.
03
현재 가용한 최신 AI 모델이 정답을 맞힌 문항은 최종 시험지에서 삭제하는 엄격한 필터링 과정을 거쳐 AI의 한계 지점을 정확히 타격하도록 제작되었다.
04
성능 평가 결과, GPT-4o는 2.7%, Claude 3.5 Sonnet은 4.1%의 낮은 정답률을 보였으며, 가장 뛰어난 모델들도 40~50% 수준에 머물렀다.
05
연구진은 이 시험이 인간을 대체하기 위한 것이 아니라, AI의 강점과 약점을 파악하여 더 안전하고 신뢰할 수 있는 기술을 만들기 위한 도구임을 강조했다.

용어 해설

대규모 다중작업 언어 이해(MMLU)
57개 주제에 걸쳐 AI의 지적 능력을 측정하는 대표적인 벤치마크이다. 최근 최신 모델들이 이 시험에서 만점에 가까운 점수를 기록하면서 변별력이 낮아졌다는 평가를 받는다.
벤치마크(Benchmark)
AI 모델의 성능을 객관적으로 비교하고 평가하기 위해 설계된 표준화된 테스트 세트이다. 모델의 추론, 언어 이해, 수학적 능력 등을 수치화하여 기술적 진보를 측정하는 척도로 활용된다.
패턴 인식(Pattern Recognition)
데이터 내에 존재하는 반복적인 규칙이나 특징을 찾아내는 능력이다. 현재의 AI 모델들이 주로 사용하는 방식이지만, 깊은 논리적 추론이나 전문적인 문맥 이해와는 차이가 있다.

기술

  • GPT-4o
  • Claude 3.5 Sonnet
  • OpenAI o1
  • Gemini 3.1 Pro
  • Claude Opus 4.6

활용 사례

  • AI 모델의 전문 지식 추론 능력 평가
  • 차세대 LLM 학습 방향 설정
  • AI 성능 및 위험성 측정 도구
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 13.수집 2026. 03. 14.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.