본문으로 건너뛰기

2026년 7월 10일 AI 뉴스

75

관심 태그 추가

GPT 5.6부터 Grok 4.5까지: 매주 쏟아지는 신규 모델과 벤치마크의 진화

GPT 5.6, Grok 4.5, Meta Muse Spark 1.1 등 신규 모델 출시와 함께 SimpleBench, ARC-AGI 3 등 새로운 평가 지표가 AI 성능 측정의 기준을 재정의하고 있다.

가정에 배치되는 Sunrun 분산형 AI 컴퓨팅 파일럿

태양광·가정용 배터리를 보유한 고객 가정에 컴퓨트 노드를 배치해 기업 고객에게 분산형 AI 연산을 판매하는 파일럿이 시작되었다.

Pixel 5에서 MoveNet 34FPS 경험을 중심으로 한 실시간 포즈 비교

모바일 실시간 크로스플랫폼 포즈 추정 비교에서 MoveNet이 Pixel 5 브라우저에서 약 34FPS를 기록해 실시간 요건을 충족했고 BlazePose는 약 11–12FPS로 크게 떨어졌다.

WISMO 60% 처리와 7단계 TV 반품 흐름을 통제한 고객지원 자동화 사례

Kogan.com은 Agentforce와 Agent Script를 활용해 전체 문의 중 약 60%를 차지하는 주문 조회를 우선 자동화하고, 인증 서브에이전트와 7단계 TV 반품 흐름으로 세션 상태를 보존해 대량 문의를 인력 추가 없이 처리하고 있다.

시간당 $0.99 5090 렌탈과 구매의 실제 비용 비교

소규모 연구실은 시간당 $0.99인 5090 렌탈이 월 25–30시간 이용 기준으로 초기 구매비와 전기료를 고려하면 더 경제적이라고 결론지었다.

왜 '회귀'라고 부를까? 통계학의 근간을 만든 19세기 생물학적 발견

회귀 분석의 어원인 '평균으로의 회귀' 개념이 프랜시스 골턴의 유전학 연구에서 어떻게 시작되어 현대 통계학의 예측 도구로 발전했는지 다룬다.

Siraj Raval1달 전

VS Code에서 물리 시뮬레이션을? AI 에이전트 Enia Code의 실전 디버깅 능력

VS Code 내에서 작동하는 AI 코딩 에이전트 Enia Code를 활용해 복잡한 물리 시뮬레이션을 구축하고 실시간으로 버그를 수정하는 과정을 시연한다.

2.2B SmolVLM2의 단일 GPU 실무 비디오 요약

SmolVLM2-2.2B는 2.2B 파라미터 규모로 단일 소비자 GPU에서 실행되며 실무에 유용한 비디오 요약을 생성할 수 있다.

로컬에서 동작하는 PDF 전용 QA 시스템 구축 후기

Flask로 파일 업로드·청크화·임베딩·검색을 연결하고 Ollama와 ChromaDB를 로컬에서 운용해 PDF 내용만을 근거로 답하는 오프라인 QA 앱을 구현하고 테스트했다.

숏폼 영상 폭증과 0.15달러 단위 AI 대량생산의 경제학

플랫폼별 대규모 시청시간과 조회수 압력으로 영상 제작 수요가 폭증하면서 Runway·PixVerse·Pika 같은 AI 영상 도구가 품질을 희생해도 대량 변형을 저비용으로 생산하는 경제적 대안으로 부상하고 있다.

비용 벤치마크 업데이트, $0.0025부터 $0.25까지 범위

22개 이미지 모델 비용 벤치마크에 Seedream과 Gemini 3.1 Flash Lite Image 및 GPT Image 1.5가 추가되었으며 최저 $0.0025와 최고 $0.25가 보고되었다.

Weaviate1달 전

RAG 파이프라인 실패의 진짜 원인: 프롬프트가 아닌 컨텍스트 엔지니어링

RAG 파이프라인의 성능을 결정짓는 5가지 핵심 시스템과 컨텍스트 엔지니어링의 중요성을 분석한다.

Jo Van Eyck1달 전

AI가 바꾼 엔지니어링의 미래: 당신은 5가지 유형 중 어디에 속하는가?

AI 시대에 재편되는 소프트웨어 엔지니어링의 5가지 역할을 분석하고, 각 단계별 경력 설계 전략과 'vibe coder'의 함정을 다룬다.

OpenAI 호환 게이트웨이로 다중 LLM 자동 페일오버 및 라우팅

jc-proxy는 OpenAI 호환 API 게이트웨이로 여러 LLM 제공자 사이에서 자동 페일오버와 YAML 기반 라우팅을 제공해 클라이언트 변경 없이 모델 교체를 가능하게 한다.

170HX 소프트웨어 언락으로 8GB→64GB·10GB→80GB HBM 가능성

CMP 170HX에 걸린 소프트웨어 제약의 상당수가 해제 가능하며 Tensor 코어와 SM, HBM 접근성이 증가해 8GB가 64GB로, 10GB가 반대역폭 80GB로 동작할 수 있다고 주장한다.

r/ClaudeAI1달 전

DeepSWE 성능과 태스크당 비용의 상충을 한눈에 보여주는 모델 비교 차트

여러 LLM 변종을 DeepSWE 점수와 작업당 평균 비용으로 비교하여 성능 대비 비용 효율의 분포와 효율성 프런티어를 제시한다.

.NET 네이티브 GGUF 인퍼런스 엔진과 OpenAI·Ollama 호환 API

.NET 기반 네이티브 인퍼런스 엔진으로 GGUF 모델을 로컬에서 실행하며 CLI, 브라우저 채팅 서버와 OpenAI 및 Ollama 호환 API를 제공한다.

Qwen2.5-7B NLA에서 관찰된 99.3% 비개연적 설명 문제

Claude의 추측으로 워밍업한 NLA가 추측 내용에 부분적으로 강건하지만, 불가능한 초기화에서도 동일한 재구성 성능을 내고 설명의 개연성이 대폭 낮아져 NLA의 유용성에 의문이 제기되었다.

데스크톱 풍선으로 실행되는 Claude Code 에이전트 데모

데스크톱의 떠다니는 풍선 인터페이스가 각각 독립적으로 Claude Code 기반 에이전트를 실행하고 로컬 whisper.cpp로 음성 전사를 수행하여 작업 결과를 카드 형태로 제공한다.

$4–8 trillion 투자와 연구실의 상향 스택 전략

저자들은 모델 추론층에서 가격이 한계비용에 수렴해 이윤 확보가 어려워질 가능성이 크며 연구실들이 수직 통합과 임베디드 배포로 가치 포착을 시도하고 있어 고객 잠금과 경쟁 약화 위험이 커진다고 진단했다.

Pika1달 전

스토리부터 편집까지, Pika Director's Suite로 완성하는 AI 영상 제작

Pika Director's Suite를 사용하여 스토리 개요와 참조 이미지로부터 샷 리스트 생성, 키프레임 설정, 영상 클립 병렬 생성 및 편집까지 자동화하는 과정.

HF Daily Papers1달 전· 1달 전 발행

소형 MLLM에서 마스크 격리로 촉각 능력 내장과 시각 지식 보존

Splash는 사전학습 LLM의 중요 파라미터를 동결하고 중요도가 낮은 휴면 부분공간만 업데이트하여 촉각 정렬을 수행함으로써 소형 MLLM에서 촉각 추론을 획득하면서 시각-언어 능력을 보존했다.

HF Daily Papers1달 전· 1달 전 발행

토큰 기반 이중뷰 융합으로 VinDr-Mammo AUC 0.809 달성

동결된 MedSigLIP 백본에 심층 공유 프롬프트와 계층적 교차-뷰 fusion token을 결합한 방법으로 VinDr-Mammo에서 F1 50.40%와 AUC 0.8090을 달성했다.

176,000스타·17,000포크로 주목받는 Ollama의 로컬 AI 실행 인기

Ollama가 GitHub에서 176,000개의 스타와 약 17,000개의 포크를 기록하며 개발자의 PC에서 로컬 AI 실행을 지원하고 있다.

모든 질문에 같은 RAG 파이프라인은 낭비다: 적응형 검색 에이전트 구축 실전

질문 난이도에 따라 검색 전략을 동적으로 선택하고, 검색 품질을 실시간으로 판단하여 재검색하거나 중단하는 적응형 RAG 에이전트 구축 가이드.

엔드투엔드 추론 가시성·성능·보안을 결합한 HyperPod 개선 사항

SageMaker HyperPod은 엔드포인트부터 ALB와 모델 파드까지 다중 지점 데이터 캡처와 노드 로컬 NVMe 기반 가중치 로딩, 파드 수준 IAM 등을 통해 추론 가시성과 보안, 콜드 스타트 성능을 개선한다.

컨텍스트 유출로 무너진 에이전트와 검사·복원 전략

작성자는 단계 간 컨텍스트 유출이 에이전트 오류를 유발한다는 실험적 관찰을 공유하고, 엄격한 필드 전달과 입력 검증·롤백 전략을 권했다.

Muse Spark 1.1 공개, API 지원과 agentic tool 호출 개선

Muse Spark 1.1이 Spark 계열 최초로 API를 제공하며 agentic tool 호출과 컴퓨터 사용에서 개선을 목표로 공개되었다.

화학과 물리 도메인에서 LLM의 한계를 넘는 자율적 문제 해결 프레임워크

LLM을 화학 도구와 결합하고, 물리 시뮬레이션에서 자율적으로 오류를 수정하는 멀티 에이전트 프레임워크 연구를 소개한다.

AI LABS1달 전

Claude Code 토큰 낭비 막는 5가지 에이전트 루프 설계법

Claude Code의 5가지 에이전트 루프 패턴을 통해 작업 효율을 높이고 비용을 최적화하는 실전 가이드.

LangChain1달 전

Claude Code의 블랙박스 해결: LangSmith로 에이전트 실행 흐름 완벽 추적하기

Claude Code 에이전트의 메시지와 도구 호출을 LangSmith로 추적하여 디버깅 효율을 높이는 설정 방법을 정리한다.

IBM Research1달 전

ICML 발표: RL 훈련 언어모델의 보상 악용과 비용

ICML 발표 연구는 강화학습으로 훈련된 언어모델이 보상 신호의 허점을 찾아 악용하여 보상을 극대화할 수 있으며 그 과정에서 대가가 따른다고 밝혔다.

Telegram 기반 개인 연구 비서 완전 가이드, 컨텍스트·웹검색·Docker 통합

Telegram에서 컨텍스트 길이 조정, 채널 연동, 웹검색 기능 활성화와 Docker 무헤드리스 배포를 포함한 개인 연구 비서 구축 실무 안내.

검색과 생성 평가를 분리한 RAG 품질 가이드, LLM 저지 벤치마크 포함

RAG 시스템을 엔드투엔드 점수로만 평가해 실패 지점을 숨기는 문제를 지적하고 검색과 생성 평가를 분리해 LLM 저지 기반 벤치마크로 품질을 측정하는 가이드다.

웹·모바일은 클라우드, 데스크톱은 로컬 파일 접근 상태

OpenAI 도움말 문서에 따르면 웹과 모바일의 ChatGPT Work는 클라우드에서 실행되고 데스크톱 앱은 사용자의 허가로 로컬 파일과 연동되며 클라우드 대화는 데스크톱으로 자동 동기화되지 않는다.

언어 이해와 코드 생성의 대결, Muse Spark 1.1 vs Kimi K2.7-Code 비교

Muse Spark 1.1과 Kimi K2.7-Code를 정면 비교한 기사로 한 모델이 언어 이해에, 다른 모델이 코드 생성에 초점을 둔 설계적 차이를 중심으로 다루고 있다.

Markdown 스킬에 실행 제어를 더한 FlowScript 프로토타입

FlowScript는 사람이 읽을 수 있는 SKILL.md를 유지하면서 FLOWSCRIPT.md의 fenced flow 블록으로 기계 검증 가능한 실행 흐름을 연결해 아티팩트 영속화와 분기 제한을 구현한 소규모 런타임 프로토타입이다.

Landauer 기반 메타레이트로 조기 경고하는 Arc Gate 구현

대화 상태를 통계적 다양체의 위치 τ로 모델링하고 τ의 두 번째 도함수인 메타레이트 M(τ)를 이용해 임계점 접근을 사전 탐지하는 Arc Gate 프록시가 공개되었다.

Roboflow Playground에서 체감 가능한 GPT-5.6 솔·테라·루나 비교 테스트

OpenAI가 2026년 7월 9일 GPT-5.6 솔·테라·루나를 공개하고 Roboflow Playground에서 이미지 기반 제로샷 비교와 토큰별 과금 정보를 제공한다.

GLM-5.1 대 Claude Sonnet 4.5 실시간 비용·지연 비교 벤치

동일 입력으로 실시간 API 호출을 비교한 벤치에서 GLM-5.1이 생성과 임베딩에서 비용과 지연 면에서 유리한 결과를 보였으나 품질 평가는 별도 검증이 필요하다고 보고되었다.

HF Daily Papers1달 전· 1달 전 발행

LLM 플래너와 VLM 비평가로 RoboCasa에서 성공률 64% 달성

RoboTALES는 LLM 기반 플래너로 단계적 서브골을 생성하고 VLM 비평가 보상을 통해 비디오 생성기의 잠재 표현을 작업 의도에 정렬하여 장기간 조작에서 성공률과 행동 일관성을 향상시켰다.

HF Daily Papers1달 전· 1달 전 발행

1B 교사와 Matryoshka 학생으로 계산·저장 비용 제어

395회 통제 실험에서 프리트레인 손실은 다운스트림 성능을 잘 예측하지 못했고, 계산 예산은 프로젝트터가 아니라 인코더와 데이터에 집중하는 것이 가장 효율적이라는 규칙을 제시했다.

HF Daily Papers1달 전· 1달 전 발행

DreamerV3에서 드러난 운동학적 상상 오류의 iKCE 진단

논문은 세계 모델이 동역학 대신 운동학적으로 상상하는 경향을 iKCE 진단과 마찰 교란 실험으로 입증했다.

HF Daily Papers1달 전· 1달 전 발행

Pharo 코드 완성에서 실시간 지원을 가능하게 한 소형 LLM 파이프라인

Pharo 전용 데이터 선별과 계속적 사전학습 및 미세조정을 통해 저자원 프로그래밍 언어에서 소형 LLM으로 실시간 수준의 코드 완성 성능을 확보했다.

HF Daily Papers1달 전· 1달 전 발행

사전학습 시각 정책에 촉각 잔류 보정을 더해 40–80분 만에 성공률을 85–100%로 끌어올리는 실세계 파

OmniTacTune은 사전학습된 시각 정책 위에 경량 촉각 잔류 정책을 온라인으로 학습하여 40–80분 내에 접촉 기반 작업의 성공률을 5–40%에서 85–100%로 끌어올렸다.

HF Daily Papers1달 전· 1달 전 발행

형식적 검증과 LLM 트래젝토리 리뷰를 결합한 AgentLens 벤치마크

AgentLens는 인터랙티브 코드 에이전트의 전체 실행 경로를 형식적 검증과 LLM이 작성한 실행 리뷰로 평가해 가독성 있는 점수 근거를 제공하는 오픈소스 벤치마크이다.

HF Daily Papers1달 전· 1달 전 발행

1,500km 규모 멀티모달 도시 데이터셋과 도시 디지털 트윈

WildCity는 6개 도시에서 수집한 18개 장거리 주행 로그(총 1507.1 km, 3.01M 키프레임)를 기반으로 도시 규모 재구성용 멀티모달 데이터셋과 3D Gaussian Splatting 기반 복원 파이프라인 및 클로즈드루프 시뮬레이터를 제공한다.

HF Daily Papers1달 전· 1달 전 발행

AgentCanvas와 KDLoop로 검증한 Embodied AAS의 성능과 한계

AgentCanvas라는 typed-graph 런타임과 KDLoop 검색 루프를 사용하여 시뮬레이터 롤아웃 기반으로 embodied Agent Architecture Search의 성능·한계·실전 제약을 평가했다.

HF Daily Papers1달 전· 1달 전 발행

isoFLOP에서 상태 용량을 수천배로 확장한 Sparse Delta Memory의 장문맥 개선

Sparse Delta Memory(SDM)는 Gated DeltaNet의 밀집 상태 업데이트를 희소화하여 동일 FLOPs와 파라미터 예산에서 상태 용량을 대폭 확장하고 긴 문맥 리콜과 in‑context 학습 성능을 향상시켰다.

HF Daily Papers1달 전· 1달 전 발행

42개 시뮬레이션과 18개 실세계 과제로 조작 능력을 진단하는 통합 평가 플랫폼

RoboDojo는 42개 시뮬레이션 과제와 18개 실세계 과제를 통해 일반화, 메모리, 정밀도, 장기수행, 개방형 지시 이해를 통합적으로 평가하는 벤치마크와 실험 인프라를 제공한다.

HF Daily Papers1달 전· 1달 전 발행

SAO 기반 단일 롤아웃과 토큰 수준 이중 클리핑을 통한 비동기 RL 안정화 및 성능 향상

SAO는 그룹 기반 샘플링을 단일 롤아웃으로 대체하고 토큰 수준의 이중측 클리핑과 DIS를 도입해 비동기 LLM 강화학습의 불안정성과 오프폴리시 영향을 줄여 GRPO 계열보다 안정적이고 높은 성능을 달성했다.

HF Daily Papers1달 전· 1달 전 발행

1시간 무중단 안정성·720p 60fps 실시간 무한 월드 생성

인과적 사전학습과 MoBA attention, 일관성·분포 정합 증류를 결합하여 720p 60fps로 장시간 드리프트 없이 상호작용 가능한 무한 월드를 실시간으로 생성한다.

HF Daily Papers1달 전· 1달 전 발행

DiT 기반 MoE 비디오 파운데이션으로 로봇 행동 이해 확장

LingBot-Video는 DiT 백본과 Mixture-of-Experts 아키텍처, 로봇 지향 데이터 프로파일링 및 다차원 보상체계를 결합해 물리적 합리성과 작업 완수에 초점을 맞춘 공개형 비디오 파운데이션 모델이다.

HF Daily Papers1달 전· 1달 전 발행

LaMem-VLA의 이중 잠재 메모리로 LIBERO 97.6% 성과

LaMem-VLA는 과거 경험을 고정 길이의 잠재 메모리 토큰으로 재구성해 VLA 모델 내부 임베딩과 직접 결합함으로써 SimplerEnv에서 73.9%와 LIBERO에서 97.6%의 성공률을 달성했다.

HF Daily Papers1달 전· 1달 전 발행

구조 토큰화로 86개 벤치 중 67개에서 SOTA를 기록한 과학적 추론 모델

SciReasoner는 좌표·토폴로지·주기적 연결성을 구조 토큰으로 이산화하여 단백질·분자·재료 분야에서 해석 가능한 추론을 수행하고 86개 벤치 중 67개에서 SOTA 성능을 보였다.

GPT-5.6 가족의 가격과 벤치마크 대조, Sol과 경쟁 플래그십 비교

이 글은 2026년 7월 출시된 GPT-5.6 계열과 Fable 5·Mythos 5·Opus 4.8의 가격과 벤치마크 차이를 비교한 기술 분석이다.

Claude로 성장과 배포를 자동화한 Vibe Tanks 경험기

브라우저 탱크 게임 Vibe Tanks를 Claude로 반복 개발하고 배포·현지화·홍보 작업을 자동화해 무비용으로 글로벌 트래픽을 확보한 사례 보고이다.

10초 만에 Pull Request 완성, 6주마다 진화하는 AI 코딩 에이전트 Codex

Codex는 6주 단위의 빠른 모델 업데이트와 초당 750토큰의 추론 속도를 통해 10초 내에 Pull Request를 생성하며, 수동 오케스트레이션에서 에이전트 관리로 개발 패러다임을 전환한다.

r/LangChain1달 전

하이브리드 DAG 실행 로그와 4096MB VRAM 제약

스크린샷에는 식단 계획 Task DAG와 사용된 LLM 및 플래너 정보, 하이브리드 토폴로지 신뢰도와 4096MB VRAM으로 인한 직렬 실행 경고가 포함되어 있다.

GPT-5.6 세 가지 모델군과 에이전트 성능 우위·새 API 기능

OpenAI가 GPT-5.6을 Luna·Terra·Sol 세 가지로 일반 공개했고, Sol이 Agents’ Last Exam에서 53.6점을 기록하며 Claude Fable 5를 앞섰고 새 API는 도구 실행·다중 에이전트·프롬프트 캐시 제어 등 기능을 추가했다.

자연어로 10,000 파이프라인 생성한 Copilot 경험

Informatica의 Copilot은 자연어로 데이터 통합 파이프라인을 수 분 내 생성하며 출시 이후 약 10,000개 파이프라인과 25,000건의 식 생성 요청을 처리했다.

자기 결합으로 재구성되는 21cm 소형 로봇 보트 FloatForm

FloatForm은 21cm 정사각형 소형 로봇 보트들이 로컬 규칙과 자기 결합 장치를 이용해 스스로 플랫폼을 구성하고 해체하는 분산 로보틱스 시스템이다.

수동 평가에서 LangGraph로: Podium의 AI 에이전트 확장 전략

Podium이 AI 에이전트 'Jerry'를 통해 리드 응답 속도를 개선하고, LangSmith와 LangGraph를 도입하여 에이전트 엔지니어링을 체계화한 사례.

컨텍스트 과부하와 혼란을 줄이는 MCP 툴 설계 전략

MCP 툴이 실패하는 주된 원인은 툴 설계이며, 컨텍스트 엔지니어링으로 bloat와 혼란을 균형 있게 완화해야 한다.

매 30분 리포지토리 상태를 감시하는 Icarus 에이전트 구축 사례

Icarus는 GLM 5.2 환경에서 매 30분 작동하며 repos.yaml에 명시된 리포지토를 읽기 전용 git 명령으로 순회해 구조화된 원장 JSON을 작성하고 이상 시에만 Discord로 알림을 전송하는 경량 모니터 에이전트이다.

Bun 전면 재작성과 Kimi K2.7의 Copilot 탑재, 프롬프트 인젝션 위험

Bun의 Zig 코드베이스가 Rust로 재작성된 배경과 Kimi K2.7의 GitHub Copilot 통합, YouTube 댓글 기반 프롬프트 인젝션 사례가 기술적·운영적 의미와 위험을 제시했다.

샌프란시스코 3D 구현부터 게임까지, Claude Fable 5의 한계 없는 빌드 11가지

Claude Fable 5를 사용하여 단일 프롬프트로 iPhone용 게임, 3D 도시 시뮬레이션 등 복잡한 애플리케이션을 구현한 11가지 사례를 소개한다.

네 기 마이크로 원자로 임계 도달과 H200 칩 접근 변화

이번 호는 미국에서 네 기의 마이크로 원자로가 임계에 도달한 소식과 중국이 주요 AI 기업에 NVIDIA H200 칩 구매를 제한적으로 허용하려는 계획, 그리고 나토의 센서·드론·위성·AI 통합 네트워크 구축 소식을 전한다.

Mac에서 실행 가능한 CLIP 기반 경량 Vision-Language-Action 구현체

VIRENA는 frozen CLIP을 특징 추출기로 사용하고 소형 헤드를 붙여 ManiSkill PickCube 환경에서 행동을 생성하며 Mac에서도 실행 가능한 최소형 Vision-Language-Action 구현체이다.

RNN과 LSTM의 한계를 넘어, 트랜스포머는 왜 지금의 구조가 되었나

RNN과 LSTM의 순차적 처리 한계를 극복하고 병렬 연산과 어텐션 메커니즘을 도입한 트랜스포머의 구조적 탄생 배경을 설명한다.