본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
Anthropic 정렬팀이 공개한 사례 연구에서 드러난 네 가지 모델 실패 모드와 심사 인프라 취약점
GPT‑Live 공개와 ChatGPT 음성 모드의 모델 위임 업그레이드 체험
에이전트 작업 실제 비용 v2 — 토큰 사용량을 반영한 비교 (~100K 입력 + 5K 출력, 측정된 발화량, 약 10단계)
Mastermind: 전략 수준 학습으로 리포지토리 규모 취약점 재현을 개선한 연구
Adirondack Land Research와 fable·GPT 5.5를 활용한 지형 데이터 리서치 파이프라인
CEO-BENCH: 에이전트가 장기 전략 게임을 할 수 있는가?
Claude Code 활용: 마크다운보다 HTML 출력이 효과적인 이유
GPT-5.5 vs Opus 4.7: 실제 오픈소스 레포지토리 기반 코딩 에이전트 벤치마크 결과
ChatGPT 5.5 출시 임박? 오픈AI의 차세대 모델 루머와 하드웨어 전략
trl-token-reduction LLM API 토큰 절감 레이어
LLM들이 자체적으로 UCI+NNUE 체스 엔진과 트레이너를 구현해 경쟁한 결과 보고
EvoPolicyGym: 상호작용 환경에서 자율적 정책 진화를 평가하는 벤치마크
테스트에 맞춰 구축하기: 코딩 에이전트는 요청한 것을 아니라 검사한 것을 전달한다
SWE-Interact: 사용자 주도 다중 턴 소프트웨어 엔지니어링 평가환경
OSWorld 2.0: 장기 실세계 작업을 위한 컴퓨터 사용 에이전트 벤치마크
한 에이전트 작업의 실제 비용 비교 약 100K 입력 토큰과 5K 출력 토큰, 약 10스텝 기준
Opus 4.8 벤치마크 결과 공유: GPT-5.5와의 성능 비교
GPT-5.5의 에이전트 코딩 성능 논란: 벤치마크 결과가 마케팅과 상충
2026년 4월 3주차 AI 주요 뉴스 요약: GPT-5.5 출시 및 물리적 AI의 부상
OpenAI Romain Huet와 Ramp Will Koh의 GPT-5.5 대담
← 피드로 돌아가기
GPT-5.5
Language Models (대형 언어 모델)
약 35개 아티클
관련 태그:
OpenAI
Claude Opus 4.7
Claude Opus 4.8
Opus 4.8
DeepSeek V4 Flash
Claude Code
Fable
Anthropic
Claude Opus 4.5
Claude