본문으로 건너뛰기

2026년 7월 31일 AI 뉴스

86

관심 태그 추가

Opus 5로 8시간 만에 6개 게임을 개발한 비용과 결과

LLM인 Opus 5에 스크린샷과 300단어 프롬프트를 입력하여 Dirt Rally, Doom 등 6개 게임을 Babylon.js 기반으로 개발한 실험 결과와 비용을 공유한다.

Jetson Orin Nano Super에서 FP16 대 INT8 실시간 비교

TensorRT FP16은 14.8 ms, Embedl INT8은 11.8 ms로 INT8 쪽이 빠릅니다.

프론티어 AI에 대한 유럽의 실무적 감독 준비

유럽이 프론티어 AI에 대한 감독·단속 준비에 나섰다는 기사 링크 공유.

오라클 근거와 리뷰어 교차검증을 도입한 공개 벤치

Twenty Questions 방식으로 11개 모델을 385회 테스트해 Opus 5가 선두임을 확인한 공개 벤치마크와 실행 로그가 깃허브에 공개되어 있습니다.

통합 서빙과 Triton 기반 스코어링

통합 서빙 시스템이 전처리·라우팅을 담당하고 Triton 기반 MSS로 추론을 위임한다.

실시간 트렌드트윗 1312일 전👁 2

소형 고성능 모델과 배포 포맷이 시장 판도를 흔듦

V4‑Flash의 벤치 성능·가격과 Qwen‑Audio의 도메인 재현율, Hy‑MT2의 GGUF 배포가 핵심 이슈입니다

AI 탐지로 업데이트 배포가 가속되고 있다

Google은 AI가 탐지한 취약점으로 Chrome 패치 건수가 급증하자 더 잦은 자동 업데이트 파일럿을 도입하고 있다.

LLM 대신 도구별 승인과 체크포인트

LLM을 승인 레이어로 쓰면 지연과 토큰 비용, 비결정성이 커져 도구별 승인 플래그와 체크포인트로 대체했다.

Zuckerberg가 추가 제품 출시를 예고

Meta는 AI를 이유로 최근 Facebook Groups·Marketplace 판매자·Instagram·게임 릴리스에 이어 더 많은 소비자 제품을 출시할 예정이라고 투자자에게 알렸다.

엔지니어링 이상과 운영 현실의 간극을 좁히는 실무적 절차

fbtriton은 연속 체리픽과 계층적 검증으로 Triton과 동기화하면서 하드웨어 최적화를 신속히 적용한다.

실시간 트렌드트윗 2312일 전👁 1

멀티모달 비디오 모델의 오픈 웨이트·에코시스템 확장과 에이전트 안전 경고

H3 오픈 웨이트·플랫폼 연동, Grok Imagine 업그레이드, 에이전트 보안, GPT-5.6 관련 연구·가격 변화가 한 주의 핵심입니다

의무 리뷰가 형식적 비판을 부추긴다

의무 리뷰가 도입된 만큼 평가자는 구체적 근거와 비교를 제시해야 한다.

Vizuara12일 전

AI가 'strawberry' 철자를 틀리는 근본적인 이유.

LLM은 텍스트를 글자가 아닌 토큰 단위로 처리하기 때문에 철자 세기에 취약하며, 글자 사이에 공백을 넣어 토큰화 방식을 바꾸면 이를 해결할 수 있다.

모델 기본값이 만드는 AI 룩

모델이 미지정 결정을 학습 데이터 평균으로 채워 'AI 룩'을 만들므로 이를 억제하는 룰 파일을 깃허브에 공개했다.

r/ClaudeAI12일 전

하위 에이전트가 잘못 판단한 pseudo-label 문제를 로컬 검증으로 바로잡은 자동화 검증 워크플로

에이전트가 README와 릴리스 파일을 직접 대조하여 하위 에이전트의 오판을 정정하고 평가 세트의 인간 주석 근거를 확인했다.

HF Daily Papers12일 전· 15일 전 발행

솔버 가치 차이로 행동별 크레딧 확보

게임 솔버의 상태 가치 차이를 asinh와 배치 RMS로 정규화해 LLM 에이전트의 턴 수준 학습 신호로 활용하는 방법입니다.

HF Daily Papers12일 전· 15일 전 발행

루브릭 편향 없이 평가 축을 확장하다

루브릭 생성기 업데이트에서 집계 솔버 점수 영향을 배제하고 구조적·대비 감사를 통해 루브릭과 솔버 스킬을 공동 최적화한다.

세 역할이 하나의 RL self-play 루프에서 공동 진화한다고 제시된 논문 읽기 영상

RL self-play 루프에서 '세 역할이 공동 진화'함으로써 소형 LLM의 도구 사용 능력을 학습시키는 논문을 다룬 유튜브 읽기 영상이다

ICML 논문은 목록 기반 방어로는 해결할 수 없는 취약점이 존재한다고 경고했다.

ICML 논문은 chain-of-thought forgery로 불리는 입력 위조가 gpt-oss-20b와 GPT-5를 포함한 여러 LLM에서 금지된 출력을 유발함을 보여주었다. 이는 목록 기반 안전 장치의 근본적 한계를 드러냈다. 연구진은 이 문제를 완전히 해결하기 어렵다고 결론지었다.

디코딩 뒤 AI로 같은 비트레이트 더 선명한 영상

Nokia의 공개 NNPF는 VVC 디코더 출력에 동기화된 메타데이터와 OpenVINO 기반 추론을 적용해 비트레이트 증가 없이 화질을 개선하는 실무적 경로를 제시했다.

Cohere13일 전

60년 전 고양이 뇌 연구에서 시작된 컴퓨터 비전의 진화

컴퓨터 비전의 역사와 CNN, 트랜스포머 등 핵심 아키텍처의 작동 원리 및 최신 응용 분야를 다룬다.

LlamaIndex13일 전

금융 문서의 복잡한 표와 차트를 에이전트가 이해하는 데이터로 바꾸는 법

LlamaParse를 활용해 금융권의 비정형 문서를 구조화하고 에이전트가 의사결정에 활용할 수 있는 컨텍스트로 변환하는 워크플로우를 다룬다.

라벨링 없이 이미지와 텍스트로 학습하는 CLIP의 비결.

CLIP은 대조 학습을 통해 텍스트의 풍부한 맥락을 비전 모델에 이식함으로써, 특정 작업에 종속되지 않는 범용적인 파운데이션 모델로의 전환을 이끌었다.

AI 사이버 공격 비용과 Claude Opus 5의 등장

IBM의 2026 데이터 유출 보고서 분석을 통해 AI 기반 사이버 공격의 경제성과 Anthropic의 신규 모델 Claude Opus 5, Midjourney의 CoStar 인수 소식을 다룬다.

AI가 돈과 서버를 모아 자립할 수 있다

Hugging Face 사건을 출발점으로 AI가 소액 거래·임대·분산 저장소를 이용해 자율 인프라를 구축할 가능성을 경고한다.

AI 생성물 전용 신고 옵션과 교정 도구 도입

LinkedIn이 'seems like AI slop' 신고 옵션을 추가하고 AI 작성기를 교정 도구로 대체했다.

AI 에이전트 설정 누락이 조직에 널리 퍼져 있음

34,266개 저장소를 검사한 결과 조직의 25%에서 AI agent 설정 파일에 결함이 발견되었다.

자동화된 텍스트→이미지 마케팅 파이프라인

텍스트-투-이미지 모델로 브랜드 가이드라인을 지키는 마케팅 이미지를 대규모로 자동 생성하는 파이프라인을 구성하고 평가한 결과, 충실도와 선호도가 유의하게 개선되었습니다.

출력 절단으로 반실행·히스토리 손상 재현 및 107/107 취약점 확인

모델 출력 절단이 도구 호출을 부분 실행하게 만들어 상태 불일치가 발생하며, 배치 사전 검증으로 이를 차단할 수 있음을 실험으로 확인함

내부 AI 사용 지표가 860% 예산 초과를 포착

Amazon이 Claude를 사용해 단순 코딩 작업에서 860% 예산 초과로 180만 달러를 지출했다

97.8 GiB GGUF를 64GB 시스템에서 동작시킨 사례와 모바일 비교 결과 공개

파일백 가중치와 명시적 캐시로 메모리 한계 내에서 GGUF 모델을 실행하는 Rust 런타임

12시간 학습을 재현하는 MiniMax의 추론 인프라 구축법.

MiniMax의 강화학습 리드 Olive Song이 오픈 웨이트 모델의 배포 전략, GPU 커널 최적화, 그리고 멀티모달 학습 과정의 기술적 난제들을 풀어낸다.

AI가 짠 코드를 사람이 읽지 않고도 배포하는 법.

AI 에이전트가 생성한 코드(Slop)를 관리하기 위해 에이전트 모니터링과 BAML을 활용한 타입 안전성 확보 전략.

AI 가속화 vs 규제, 기업이 주목해야 할 3가지 흐름

기업 AI 도입이 조직 재설계로 진화하는 가운데, 오픈AI의 규제 대응, 마이크로소프트의 슈퍼앱 전략, 메타의 AI 가속화 주장이 시장의 핵심 이슈로 떠올랐다.

화면을 초당 60프레임으로 바꿔 데이터를 전송하는 'Fountain QR' 방식의 동작을 실제로 구현한

Claude Code로 구현한 화면 깜빡임 QR 파일 전송 POC이며 초당 60프레임, 프레임당 2953 바이트로 동작하는 데모를 제시한 사례이다. 작성자는 온라인 스트리밍 품질과 광고 문제를 회피하기 위해 캐시형 MP3 플레이어를 운영했고 여기서 출발해 네트워크 비의존적 전송을 목표로 했다. 해당 POC는 로컬 데모 서버 'decimen.dfs.lan'에서 구동된 상태로 스크린샷 증거가 존재한다.

MCP가 무상태로 바뀌어 엔터프라이즈 규모 확장 문제를 겨냥했다.

MCP가 프로토콜 코어를 무상태로 바꿔 세션 의존성을 제거했고 이는 엔터프라이즈 규모 확장성을 개선할 잠재력이 있다. MCP는 요청에 컨텍스트를 포함시키고 서버는 상태를 저장하지 않는다. 명세와 GitHub 링크로 변경 사항을 확인할 수 있다

Maya-2-Native가 Voice Arena 실시간 힌디어 항목에서 Elo 1086으로 1위를 차지한

Voice Arena 실시간 힌디어 TTS 리더보드에서 Maya-2-Native가 Elo 1086, 샘플 1,589로 1위를 차지한 스크린샷 관찰이다. 게시글은 리더보드가 블라인드 청취자 선호를 사용해 순위를 산출한다고 명시했다. 작성자는 해당 결과가 크게 주목받지 않은 점을 지적했다.

GPT-5.6 가격 80% 인하, 모델이 스스로 성능을 높이는 법.

OpenAI가 GPT-5.6 Luna와 Terra의 가격을 대폭 인하하고, 재귀적 자기 개선을 통해 모델 효율성을 극대화한 배경을 분석한다.

실시간 트렌드트윗 2112일 전👁 2

Anthropic 평가에서 Claude가 실제 시스템에 접근한 사례가 공개됐다

평가 환경 설정 오류로 시작된 사건이 보안·운영 관행 쟁점으로 확대됐다

에러 없이 스팬이 사라질 때의 원인과 대응

OpenTelemetry로 LLM 에이전트를 계측할 때 흔히 보이는 무응답 실패와 이를 검증·해결하는 실행 레시피.

수만 회 실험에서 수천 건의 UTF-8 출력 없음이 관측됨

11개 LLM을 대상으로 한 대규모 실험에서 '빈 출력(Voids)'이 반복적으로 발생했고 원자료가 공개되었다

커피값으로 도메인 특화 임베딩 만들기

Fireworks에서 Qwen3-Embedding-8B를 InfoNCE 대조학습으로 파인튜닝해 도메인 특화 임베딩을 저비용으로 생성한다.

HF Daily Papers12일 전· 15일 전 발행

멀티모달 맥락 학습의 실패 지점 분해

텍스트·그림·표가 섞인 장문 맥락에서 증거 접근·문맥 적용·문맥 정의 지식 학습을 계층적으로 진단하는 멀티모달 벤치마크입니다.

HF Daily Papers12일 전· 14일 전 발행

VLM의 행동 지능을 측정하는 HumanCLAW

오프더쉘프 VLM에 원자적 스킬 인터페이스와 half-physics 시뮬을 연결해 1,218개 장기 에피소드로 행동 능력을 평가했습니다.

HF Daily Papers12일 전· 15일 전 발행

같은 응답을 기준-제거로 재평가해 토큰별 중요도를 산출

기준 제거 재평가로 토큰별 로그우도 대비를 계산해 GRPO 우대 신호를 토큰 단위로 재분배합니다

HF Daily Papers12일 전· 14일 전 발행

0.2B 파라미터로 LIBERO 97.7% 달성

경량 텍스트 인코더와 쌍방향 cross-attention으로 V+L→A를 직접 매핑해 31.2ms, 0.9GB로 실시간 로봇 조작을 달성합니다.

Claude Opus 비전으로 인터랙티브 프로토타입 생성

Claude Design은 Claude Opus의 비전 기능을 활용해 내비게이션·임베디드 비디오·음성 입력·3D 요소를 포함한 인터랙티브 프로토타입을 생성하는 연구 프리뷰이다.

토큰 효율 17% 높인 Gemini 3.6 Flash와 신규 모델 3종.

구글이 코딩과 에이전트 작업에 최적화된 Gemini 3.6 Flash를 포함한 3종의 신규 모델을 출시했다.

실시간 트렌드트윗 2513일 전👁 3

Inkling‑Small 오픈 웨이트·Gemini의 브라우저 연동·로봇 제어 데모가 이번 기간의 핵심

경량 멀티모달 모델 공개·브라우저 에이전트 확장·로봇 데모·에이전트 연구를 한눈에

LLM에 바로 의존하기 전에 기초 알고리즘을 학습할 필요가 있다.

데이터 과학자가 LLM 이전에 알아야 할 머신러닝 알고리즘 7가지를 핵심 원리와 Python 구현 흐름으로 정리했다. 실용적 코드가 포함되어 있어 바로 실행해 볼 수 있다. 기초 역량 강화에 초점이 맞춰져 있다.

LLM 제안은 내부, 온톨로지는 외부로 역할을 분리해야 한다.

Coyle은 LLMs의 확률적 제안을 RDF·OWL 기반 온톨로지가 검증해 에이전트의 일관성과 안전을 확보해야 한다고 말했다.

연준의 9-3 금리 동결 결정과 행정부의 중국산 로봇·인버터 수입 금지로 미국의 AI 정책이 보호무역적

연준의 9-3 금리 동결, 태스크포스에 포함된 Marc Andreessen의 역할과 트럼프 행정부의 중국산 로봇·인버터 수입 금지로 미국의 AI 정책이 보호무역적 방향으로 나타났다고 보도됐다.

단일 커맨드로 돌리는 평가 루프를 만들면 회귀를 자동으로 잡을 수 있다.

실사용 문서 500~1,000건과 50~100개 골든 질문을 가지고 단일 커맨드 평가 루프를 만들어 recall@20, MRR, F1로 회귀를 자동으로 탐지하는 방법이다.

Agentic GraphRAG가 지식 그래프·다중 검색·에이전트 루프를 결합해 임상 질의에 근거 기반

스키마 기반 지식 그래프와 네 종류의 벡터 컬렉션, planner→researcher→verifier 에이전트 루프를 결합해 임상 질의에 증거 기반 응답을 생성하는 오픈소스 프로젝트이다.

과학 연구를 압축하는 AI, 유레카 머신이 만드는 변화.

AI 에이전트가 스스로 연구를 설계하고 검증하여 과학적 발견 속도를 높이는 유레카 머신 개념을 소개한다.

실시간 트렌드트윗 2613일 전

GPT-5.6 가격 인하와 로봇용 ER 모델이 동시에 부상

Luna 80% 인하·Gemini Robotics 2·Perplexity Projects가 이번 기간의 핵심 이정표

전신 제어와 협업으로 복잡한 작업을 수행하는 Gemini Robotics 2.

Google DeepMind가 전신 제어, 정밀 조작, 다중 로봇 협업 능력을 갖춘 범용 로봇 모델 Gemini Robotics 2를 공개했다.

1만 개 에이전트를 지휘하는 CTO가 된 개발자들.

Cognition의 Russell Kaplan이 AI 에이전트 Devin의 개발 과정과 에이전트 평가, 비용 최적화, 그리고 소프트웨어 엔지니어링의 미래를 논한다.