관련 기사 바로가기
AI 안전성을 위한 능력 평가와 행동 평가의 차이LLM 코딩 능력의 정체: 테스트 통과율과 실제 머지율의 괴리 분석METR Joel Becker와 함께하는 AI 시간 지평 평가, 위협 모델 및 생산성의 한계OpenAI Codex, 25시간 연속 가동으로 디자인 도구 전체 구축 성공2025년 말 AI는 오픈소스 개발을 가속화하지만, 선택 편향으로 인해 후속 연구 결과의 신뢰성이 낮아짐METR Time Horizons 벤치마크를 통해 본 모델별 지능 효율성 분석METR 태스크 호라이즌 벤치마크 업데이트: Claude Opus의 ML 연구 과제 수행 능력 향상