관련 기사 바로가기
17개 LLM을 동일한 28개 과제로 평가한 결과Epoch와 METR이 공개한 MirrorCode 벤치마크가 장기간 프로그래밍에서 AI 성능을 측정하다ChatGPT의 Health 기능이 미국 사용자에게 공개되어 Apple Health와 의료기록 연동을 지원함Anthropic 정렬팀이 공개한 사례 연구에서 드러난 네 가지 모델 실패 모드와 심사 인프라 취약점Mastermind: 전략 수준 학습으로 리포지토리 규모 취약점 재현을 개선한 연구Adirondack Land Research와 fable·GPT 5.5를 활용한 지형 데이터 리서치 파이프라인CEO-BENCH: 에이전트가 장기 전략 게임을 할 수 있는가?토큰 처리 속도와 단위 가격이 실제 작업 완료 시간과 비용을 예측하지 못한 사례 공유능동 관찰자를 위한 시험: ActiveVision 벤치마크동일한 시장 진입 브리프를 세 AI 모델에 적용해 비교한 결과모델 라우터: 절반 비용으로 프런티어급 코딩 에이전트GPT‑Live 공개와 ChatGPT 음성 모드의 모델 위임 업그레이드 체험에이전트 작업 실제 비용 v2 — 토큰 사용량을 반영한 비교 (~100K 입력 + 5K 출력, 측정된 발화량, 약 10단계)trl-token-reduction LLM API 토큰 절감 레이어LLM들이 자체적으로 UCI+NNUE 체스 엔진과 트레이너를 구현해 경쟁한 결과 보고EvoPolicyGym: 상호작용 환경에서 자율적 정책 진화를 평가하는 벤치마크테스트에 맞춰 구축하기: 코딩 에이전트는 요청한 것을 아니라 검사한 것을 전달한다SWE-Interact: 사용자 주도 다중 턴 소프트웨어 엔지니어링 평가환경OSWorld 2.0: 장기 실세계 작업을 위한 컴퓨터 사용 에이전트 벤치마크한 에이전트 작업의 실제 비용 비교 약 100K 입력 토큰과 5K 출력 토큰, 약 10스텝 기준
← 피드로 돌아가기
GPT-5.5
약 41개 아티클
관심 태그 추가
관련 태그:OpenAIClaude Opus 4.7Opus 4.8Claude Opus 4.8Claude Fable 5Claude CodeFableAnthropicDeepseek V4 FlashClaude
TIMEHEADLINE