본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
AI 안전성을 위한 능력 평가와 행동 평가의 차이
LLM 코딩 능력의 정체: 테스트 통과율과 실제 머지율의 괴리 분석
METR Joel Becker와 함께하는 AI 시간 지평 평가, 위협 모델 및 생산성의 한계
OpenAI Codex, 25시간 연속 가동으로 디자인 도구 전체 구축 성공
2025년 말 AI는 오픈소스 개발을 가속화하지만, 선택 편향으로 인해 후속 연구 결과의 신뢰성이 낮아짐
METR Time Horizons 벤치마크를 통해 본 모델별 지능 효율성 분석
METR 태스크 호라이즌 벤치마크 업데이트: Claude Opus의 ML 연구 과제 수행 능력 향상
← 피드로 돌아가기
METR
Companies (AI 기업)
약 8개 아티클
관련 태그:
Claude Opus 4.6
Anthropic
OpenAI
GPT-5
opus
Claude Opus 4.5
Claude Code
Codex
GPT-5.2
GPT-5.3 Codex