GPT 5.6부터 Grok 4.5까지: 매주 쏟아지는 신규 모델과 벤치마크의 진화
GPT 5.6, Grok 4.5, Meta Muse Spark 1.1 등 신규 모델 출시와 함께 SimpleBench, ARC-AGI 3 등 새로운 평가 지표가 AI 성능 측정의 기준을 재정의하고 있다.
총 75건
GPT 5.6, Grok 4.5, Meta Muse Spark 1.1 등 신규 모델 출시와 함께 SimpleBench, ARC-AGI 3 등 새로운 평가 지표가 AI 성능 측정의 기준을 재정의하고 있다.
태양광·가정용 배터리를 보유한 고객 가정에 컴퓨트 노드를 배치해 기업 고객에게 분산형 AI 연산을 판매하는 파일럿이 시작되었다.
모바일 실시간 크로스플랫폼 포즈 추정 비교에서 MoveNet이 Pixel 5 브라우저에서 약 34FPS를 기록해 실시간 요건을 충족했고 BlazePose는 약 11–12FPS로 크게 떨어졌다.
Kogan.com은 Agentforce와 Agent Script를 활용해 전체 문의 중 약 60%를 차지하는 주문 조회를 우선 자동화하고, 인증 서브에이전트와 7단계 TV 반품 흐름으로 세션 상태를 보존해 대량 문의를 인력 추가 없이 처리하고 있다.
소규모 연구실은 시간당 $0.99인 5090 렌탈이 월 25–30시간 이용 기준으로 초기 구매비와 전기료를 고려하면 더 경제적이라고 결론지었다.
회귀 분석의 어원인 '평균으로의 회귀' 개념이 프랜시스 골턴의 유전학 연구에서 어떻게 시작되어 현대 통계학의 예측 도구로 발전했는지 다룬다.
VS Code 내에서 작동하는 AI 코딩 에이전트 Enia Code를 활용해 복잡한 물리 시뮬레이션을 구축하고 실시간으로 버그를 수정하는 과정을 시연한다.
SmolVLM2-2.2B는 2.2B 파라미터 규모로 단일 소비자 GPU에서 실행되며 실무에 유용한 비디오 요약을 생성할 수 있다.
Flask로 파일 업로드·청크화·임베딩·검색을 연결하고 Ollama와 ChromaDB를 로컬에서 운용해 PDF 내용만을 근거로 답하는 오프라인 QA 앱을 구현하고 테스트했다.
플랫폼별 대규모 시청시간과 조회수 압력으로 영상 제작 수요가 폭증하면서 Runway·PixVerse·Pika 같은 AI 영상 도구가 품질을 희생해도 대량 변형을 저비용으로 생산하는 경제적 대안으로 부상하고 있다.
22개 이미지 모델 비용 벤치마크에 Seedream과 Gemini 3.1 Flash Lite Image 및 GPT Image 1.5가 추가되었으며 최저 $0.0025와 최고 $0.25가 보고되었다.
RAG 파이프라인의 성능을 결정짓는 5가지 핵심 시스템과 컨텍스트 엔지니어링의 중요성을 분석한다.
AI 시대에 재편되는 소프트웨어 엔지니어링의 5가지 역할을 분석하고, 각 단계별 경력 설계 전략과 'vibe coder'의 함정을 다룬다.
jc-proxy는 OpenAI 호환 API 게이트웨이로 여러 LLM 제공자 사이에서 자동 페일오버와 YAML 기반 라우팅을 제공해 클라이언트 변경 없이 모델 교체를 가능하게 한다.
여러 LLM 변종을 DeepSWE 점수와 작업당 평균 비용으로 비교하여 성능 대비 비용 효율의 분포와 효율성 프런티어를 제시한다.
.NET 기반 네이티브 인퍼런스 엔진으로 GGUF 모델을 로컬에서 실행하며 CLI, 브라우저 채팅 서버와 OpenAI 및 Ollama 호환 API를 제공한다.
Claude의 추측으로 워밍업한 NLA가 추측 내용에 부분적으로 강건하지만, 불가능한 초기화에서도 동일한 재구성 성능을 내고 설명의 개연성이 대폭 낮아져 NLA의 유용성에 의문이 제기되었다.
GPT Live, Grok 4.5, Cognition SWE-1.7, GPT-5.6 등 4가지 신규 모델이 제시하는 업무 자동화와 AI 협업의 미래를 분석한다.
데스크톱의 떠다니는 풍선 인터페이스가 각각 독립적으로 Claude Code 기반 에이전트를 실행하고 로컬 whisper.cpp로 음성 전사를 수행하여 작업 결과를 카드 형태로 제공한다.
저자들은 모델 추론층에서 가격이 한계비용에 수렴해 이윤 확보가 어려워질 가능성이 크며 연구실들이 수직 통합과 임베디드 배포로 가치 포착을 시도하고 있어 고객 잠금과 경쟁 약화 위험이 커진다고 진단했다.
Splash는 사전학습 LLM의 중요 파라미터를 동결하고 중요도가 낮은 휴면 부분공간만 업데이트하여 촉각 정렬을 수행함으로써 소형 MLLM에서 촉각 추론을 획득하면서 시각-언어 능력을 보존했다.
동결된 MedSigLIP 백본에 심층 공유 프롬프트와 계층적 교차-뷰 fusion token을 결합한 방법으로 VinDr-Mammo에서 F1 50.40%와 AUC 0.8090을 달성했다.
Ollama가 GitHub에서 176,000개의 스타와 약 17,000개의 포크를 기록하며 개발자의 PC에서 로컬 AI 실행을 지원하고 있다.
SageMaker HyperPod은 엔드포인트부터 ALB와 모델 파드까지 다중 지점 데이터 캡처와 노드 로컬 NVMe 기반 가중치 로딩, 파드 수준 IAM 등을 통해 추론 가시성과 보안, 콜드 스타트 성능을 개선한다.
Aurora 1.5는 22개 추가 변수와 시간별 해상도 및 확률적 앙상블을 갖춘 오픈소스 지구 시스템 파운데이션 모델이다.
작성자는 단계 간 컨텍스트 유출이 에이전트 오류를 유발한다는 실험적 관찰을 공유하고, 엄격한 필드 전달과 입력 검증·롤백 전략을 권했다.
Muse Spark 1.1이 Spark 계열 최초로 API를 제공하며 agentic tool 호출과 컴퓨터 사용에서 개선을 목표로 공개되었다.
LLM을 화학 도구와 결합하고, 물리 시뮬레이션에서 자율적으로 오류를 수정하는 멀티 에이전트 프레임워크 연구를 소개한다.
Claude Code의 5가지 에이전트 루프 패턴을 통해 작업 효율을 높이고 비용을 최적화하는 실전 가이드.
Claude Code 에이전트의 메시지와 도구 호출을 LangSmith로 추적하여 디버깅 효율을 높이는 설정 방법을 정리한다.
ICML 발표 연구는 강화학습으로 훈련된 언어모델이 보상 신호의 허점을 찾아 악용하여 보상을 극대화할 수 있으며 그 과정에서 대가가 따른다고 밝혔다.
Telegram에서 컨텍스트 길이 조정, 채널 연동, 웹검색 기능 활성화와 Docker 무헤드리스 배포를 포함한 개인 연구 비서 구축 실무 안내.
RAG 시스템을 엔드투엔드 점수로만 평가해 실패 지점을 숨기는 문제를 지적하고 검색과 생성 평가를 분리해 LLM 저지 기반 벤치마크로 품질을 측정하는 가이드다.
OpenAI 도움말 문서에 따르면 웹과 모바일의 ChatGPT Work는 클라우드에서 실행되고 데스크톱 앱은 사용자의 허가로 로컬 파일과 연동되며 클라우드 대화는 데스크톱으로 자동 동기화되지 않는다.
Muse Spark 1.1과 Kimi K2.7-Code를 정면 비교한 기사로 한 모델이 언어 이해에, 다른 모델이 코드 생성에 초점을 둔 설계적 차이를 중심으로 다루고 있다.
FlowScript는 사람이 읽을 수 있는 SKILL.md를 유지하면서 FLOWSCRIPT.md의 fenced flow 블록으로 기계 검증 가능한 실행 흐름을 연결해 아티팩트 영속화와 분기 제한을 구현한 소규모 런타임 프로토타입이다.
대화 상태를 통계적 다양체의 위치 τ로 모델링하고 τ의 두 번째 도함수인 메타레이트 M(τ)를 이용해 임계점 접근을 사전 탐지하는 Arc Gate 프록시가 공개되었다.
OpenAI가 2026년 7월 9일 GPT-5.6 솔·테라·루나를 공개하고 Roboflow Playground에서 이미지 기반 제로샷 비교와 토큰별 과금 정보를 제공한다.
동일 입력으로 실시간 API 호출을 비교한 벤치에서 GLM-5.1이 생성과 임베딩에서 비용과 지연 면에서 유리한 결과를 보였으나 품질 평가는 별도 검증이 필요하다고 보고되었다.
RoboTALES는 LLM 기반 플래너로 단계적 서브골을 생성하고 VLM 비평가 보상을 통해 비디오 생성기의 잠재 표현을 작업 의도에 정렬하여 장기간 조작에서 성공률과 행동 일관성을 향상시켰다.
395회 통제 실험에서 프리트레인 손실은 다운스트림 성능을 잘 예측하지 못했고, 계산 예산은 프로젝트터가 아니라 인코더와 데이터에 집중하는 것이 가장 효율적이라는 규칙을 제시했다.
논문은 세계 모델이 동역학 대신 운동학적으로 상상하는 경향을 iKCE 진단과 마찰 교란 실험으로 입증했다.
Pharo 전용 데이터 선별과 계속적 사전학습 및 미세조정을 통해 저자원 프로그래밍 언어에서 소형 LLM으로 실시간 수준의 코드 완성 성능을 확보했다.
OmniTacTune은 사전학습된 시각 정책 위에 경량 촉각 잔류 정책을 온라인으로 학습하여 40–80분 내에 접촉 기반 작업의 성공률을 5–40%에서 85–100%로 끌어올렸다.
AgentLens는 인터랙티브 코드 에이전트의 전체 실행 경로를 형식적 검증과 LLM이 작성한 실행 리뷰로 평가해 가독성 있는 점수 근거를 제공하는 오픈소스 벤치마크이다.
WildCity는 6개 도시에서 수집한 18개 장거리 주행 로그(총 1507.1 km, 3.01M 키프레임)를 기반으로 도시 규모 재구성용 멀티모달 데이터셋과 3D Gaussian Splatting 기반 복원 파이프라인 및 클로즈드루프 시뮬레이터를 제공한다.
AgentCanvas라는 typed-graph 런타임과 KDLoop 검색 루프를 사용하여 시뮬레이터 롤아웃 기반으로 embodied Agent Architecture Search의 성능·한계·실전 제약을 평가했다.
Sparse Delta Memory(SDM)는 Gated DeltaNet의 밀집 상태 업데이트를 희소화하여 동일 FLOPs와 파라미터 예산에서 상태 용량을 대폭 확장하고 긴 문맥 리콜과 in‑context 학습 성능을 향상시켰다.
RoboDojo는 42개 시뮬레이션 과제와 18개 실세계 과제를 통해 일반화, 메모리, 정밀도, 장기수행, 개방형 지시 이해를 통합적으로 평가하는 벤치마크와 실험 인프라를 제공한다.
SAO는 그룹 기반 샘플링을 단일 롤아웃으로 대체하고 토큰 수준의 이중측 클리핑과 DIS를 도입해 비동기 LLM 강화학습의 불안정성과 오프폴리시 영향을 줄여 GRPO 계열보다 안정적이고 높은 성능을 달성했다.
인과적 사전학습과 MoBA attention, 일관성·분포 정합 증류를 결합하여 720p 60fps로 장시간 드리프트 없이 상호작용 가능한 무한 월드를 실시간으로 생성한다.
LingBot-Video는 DiT 백본과 Mixture-of-Experts 아키텍처, 로봇 지향 데이터 프로파일링 및 다차원 보상체계를 결합해 물리적 합리성과 작업 완수에 초점을 맞춘 공개형 비디오 파운데이션 모델이다.
LaMem-VLA는 과거 경험을 고정 길이의 잠재 메모리 토큰으로 재구성해 VLA 모델 내부 임베딩과 직접 결합함으로써 SimplerEnv에서 73.9%와 LIBERO에서 97.6%의 성공률을 달성했다.
SciReasoner는 좌표·토폴로지·주기적 연결성을 구조 토큰으로 이산화하여 단백질·분자·재료 분야에서 해석 가능한 추론을 수행하고 86개 벤치 중 67개에서 SOTA 성능을 보였다.
이 글은 2026년 7월 출시된 GPT-5.6 계열과 Fable 5·Mythos 5·Opus 4.8의 가격과 벤치마크 차이를 비교한 기술 분석이다.
브라우저 탱크 게임 Vibe Tanks를 Claude로 반복 개발하고 배포·현지화·홍보 작업을 자동화해 무비용으로 글로벌 트래픽을 확보한 사례 보고이다.
저자는 GPT-5.6 Sol이 ARC-AGI-3에서 7.8%를 기록해 높은 실용 능력과 낮은 벤치 점수 간 괴리가 확인되었다고 지적했다.
Anthropic는 Jacobian lens로 Claude Opus 4.6 내부의 J-space에서 미래 출력과 연관된 단어 신호를 포착해 모델 내부 상태를 새롭게 해석할 수 있음을 보였다.
Codex는 6주 단위의 빠른 모델 업데이트와 초당 750토큰의 추론 속도를 통해 10초 내에 Pull Request를 생성하며, 수동 오케스트레이션에서 에이전트 관리로 개발 패러다임을 전환한다.
스크린샷에는 식단 계획 Task DAG와 사용된 LLM 및 플래너 정보, 하이브리드 토폴로지 신뢰도와 4096MB VRAM으로 인한 직렬 실행 경고가 포함되어 있다.
OpenAI가 GPT-5.6을 Luna·Terra·Sol 세 가지로 일반 공개했고, Sol이 Agents’ Last Exam에서 53.6점을 기록하며 Claude Fable 5를 앞섰고 새 API는 도구 실행·다중 에이전트·프롬프트 캐시 제어 등 기능을 추가했다.
The AI Scientist는 파운데이션 모델들을 연계해 연구 아이디어 발굴부터 실험 실행, 원고 작성과 동료심사까지 자동화한 시스템이다.
Informatica의 Copilot은 자연어로 데이터 통합 파이프라인을 수 분 내 생성하며 출시 이후 약 10,000개 파이프라인과 25,000건의 식 생성 요청을 처리했다.
FloatForm은 21cm 정사각형 소형 로봇 보트들이 로컬 규칙과 자기 결합 장치를 이용해 스스로 플랫폼을 구성하고 해체하는 분산 로보틱스 시스템이다.
MCP 툴이 실패하는 주된 원인은 툴 설계이며, 컨텍스트 엔지니어링으로 bloat와 혼란을 균형 있게 완화해야 한다.
Bun의 Zig 코드베이스가 Rust로 재작성된 배경과 Kimi K2.7의 GitHub Copilot 통합, YouTube 댓글 기반 프롬프트 인젝션 사례가 기술적·운영적 의미와 위험을 제시했다.
Claude Fable 5를 사용하여 단일 프롬프트로 iPhone용 게임, 3D 도시 시뮬레이션 등 복잡한 애플리케이션을 구현한 11가지 사례를 소개한다.
이번 호는 미국에서 네 기의 마이크로 원자로가 임계에 도달한 소식과 중국이 주요 AI 기업에 NVIDIA H200 칩 구매를 제한적으로 허용하려는 계획, 그리고 나토의 센서·드론·위성·AI 통합 네트워크 구축 소식을 전한다.
VIRENA는 frozen CLIP을 특징 추출기로 사용하고 소형 헤드를 붙여 ManiSkill PickCube 환경에서 행동을 생성하며 Mac에서도 실행 가능한 최소형 Vision-Language-Action 구현체이다.
RNN과 LSTM의 순차적 처리 한계를 극복하고 병렬 연산과 어텐션 메커니즘을 도입한 트랜스포머의 구조적 탄생 배경을 설명한다.