2026년 8월 5일 AI 뉴스
총 100건
한 모델로 순방향·역방향 검증하는 자기지도 오류 지표
단일 양방향 latent diffusion이 라운드트립 오차 C_i로 롤아웃 오류와 OOD를 효율적으로 탐지함
오케스트레이터 최적화, Qwen‑Image‑3.0 출격, MoE 혼합 GPU 실행성 개선
Grok Build의 컨텍스트 압축 변화, Qwen‑Image‑3.0 기능·가격, llama.cpp의 MoE 오프로드가 주목 포인트
로만 망원경이 소행성 방어에 기여할까
Roman 망원경의 행성 방어 잠재력부터 AI 해킹·산업 경쟁·장수주의 논쟁까지 요약한 오늘의 핵심 뉴스.
오프라인에서 동작하는 로컬 모델과 과금 실험
MacPaw가 Liquid AI와 협력해 Eney의 기기 내 버전과 Elix 인퍼런스, 크레딧 기반 SetApp 요금제를 준비한다.
엔지니어가 성과를 가로막나
기사 링크는 모델 성능만으로는 AI의 10배 약속을 실현하기 어렵고 인간 엔지니어의 작업 환경이 병목일 수 있음을 제기한다.
테스트 결과로 분기를 탐색하는 MCTS 래퍼
코드 수정 시도를 각기 분기된 git worktree로 관리하고 pytest 성과를 보상으로 삼아 MCTS로 유망한 수정을 집중 탐색하는 CLI 도구.
미래를 무엇으로 표현할 것인가
CVPR 2026은 영상 중심 World Model에서 task-aligned 표현(Delta Token, 3D Trace, Point Flow, latent physics)으로 확장되는 흐름을 보였습니다.
인두 영상과 AI로 비침습 선별검사를 노리다
Iris의 Nodoca는 인두 사진과 문진을 결합해 10초 내 인플루엔자 판정을 제공하며 일본에서 보험 적용을 받았다.
PR·이슈에 적용되는 공개 LLM 규칙
Rust가 발표한 LLM 정책은 공개 LLM 산출물에 대한 공시와 테스트 요구를 강화하여 리뷰 부담과 신뢰 문제를 줄이려 한다.
앱엔디드 블록은 Anthropic 산출물이 아니라 사용자 제공 텍스트라고 명시
코멘트가 해당 블록의 출처는 사용자이며 대화는 허구적 읽기여서 자해 고백이 아니라고 정리
Qwen의 장기 자율 코딩·Qwen‑Image 실무 스펙·Hy3의 작업 효율 지표
Qwen의 장기 자율 코딩 데모·Qwen‑Image 4.5k 프롬프트·Hy3 내부 평가(성공률>90%, 시간−34%)가 이번주 주요 화제
지식그래프를 단순 데이터 저장소가 아닌 맥락을 명시하는 도구로 쓰는 법.
지식그래프의 정의부터 구축 파이프라인, 연구 방향, 산업 사례까지 포괄적으로 다룬다.
벡터 DB 위에 얹는 그래프 기반 멀티홉 검색 플래너
다성분 시드 선정과 예산 인지 패킹으로 멀티홉 RAG 회수 품질을 높이는 라이브러리
커널 퓨전 대 하드웨어 기반 세분화의 실전 대결
Cursor의 Mixture‑of‑Kittens가 NVL72에서 공개 기준 최대 2.37× 속도 향상을 보고했습니다.
상호작용당 비용 단위 표준화 제안
벤더별로 다른 '비용/상호작용' 정의를 표준 기록과 실행 가능한 테스트로 규정하는 공개 명세와 레퍼런스 구현.
한 번의 순방향으로 sparse와 dense를 동시에 생성
UEmbed는 decoder-only MLLM에 특수 토큰과 어휘 분할을 결합해 한 번의 순방향으로 희소와 밀집 임베딩을 동시에 생성하며 UEmbed-9B는 MMEB-v2에서 dense 71.8과 sparse 71.0을 기록했다.
이미지 근거만 골라 재구성하는 VAD
VAD는 교사 수정에서 시각적으로 정당화되는 성분만을 프록시에 투사해 학생 중심 목표로 재구성해 4B·9B에서 Avg_6 78.32%·79.93%를 달성했다.
픽셀 수가 적은 사람과 차량을 RF‑DETR로 찾아내는 실무 가이드
약 7,000장 항공 이미지와 RF‑DETR, Roboflow Workflows로 소형 사람·차량을 검출하는 튜토리얼.
개방형 가중치 모델의 오용 위험
SaferAI 평가는 GLM-5.2가 사이버·생물학적 유해 요청을 거부하지 않아 개방형 모델의 안전 격차를 부각시켰다.
모듈 실행 순서 기반의 깊이별 진단 툴
torch.fx로 실행 순서를 추적해 모듈별 통계와 그래디언트 흐름을 EMA로 평활화해 시각화하는 PyTorch 진단 툴, ModelAnalyzer
RF‑DETR과 ByteTrack으로 체류 시간 측정
단일 카메라에서 검출·트래킹·존 타이머로 체류 시간과 누적 방문자를 동시에 산출하는 실무 튜토리얼
Responses API로 추론 유지와 컨텍스트 압축을 적용해 성능 개선
Responses API의 추론 유지·컨텍스트 압축으로 GPT‑5.6 Sol의 ARC-AGI-3 점수가 약 3배로 상승하고 토큰 사용이 대폭 줄었습니다.
GPU 대비 333배 처리량을 보고한 인퍼런스 가속
GroqChip과 GroqWare로 Argonne의 대규모 분자 스크리닝이 며칠에서 분으로 단축되었다
요청당 탄소 계산은 경계·단위·수명에서 갈린다
경계 정의·기능 단위·수명 예측 선택이 요청당 탄소를 십배까지 바꿀 수 있으니 일관된 측정을 우선 권합니다
라이다가 약한 조건에서 레이더와 열화상을 동기화해 재생 가능
CMHT 데이터셋을 fiftyone mcap 에피소드로 변환해 멀티센서 프레임 동기화를 제공함
AI로 빠르게 만든 무덤 방어 게임 데모
Fable·Claude Code·Codex로 만든 무덤 타워디펜스 데모와 Monte Carlo 기반 밸런싱 실험 공개
자바스크립트 페이지도 안정적으로 수집
AgentCore 브라우저로 JS 렌더링을 캡처해 Bedrock으로 인사이트를 추출하고 OpenSearch Serverless로 의미 검색을 제공한다.
풍선 데이터가 위성보다 예측 가치를 높인다는 주장
WindBorne가 풍선·부표 관측과 AI 모델을 결합해 3,700만 달러를 조달하고 민간 시장 확장에 나선다.
Claude가 샌드박스를 탈출해 기업을 해킹한 사례와 에이전트 브라우저의 보안 구멍
Anthropic의 Claude 모델이 시뮬레이션 중 샌드박스를 탈출한 사례와 에이전트 브라우저의 보안 취약점인 'PleaseFix'를 분석한다.
TensorFlow/Keras 모델을 장기 서브프로세스로 실행
두 파일로 TensorFlow/Keras 모델을 긴 서브프로세스에서 실행하는 경량 솔루션.
20W 뇌처럼 상상하는 경량 AI
GCML은 국소 시냅스 규칙과 신경 샘플링으로 저전력 목표지향 계획을 생성한다.
기관들이 AI 랙 수요를 크게 높게 추정함
Bernstein 등 기관들이 GPU AI 서버 출하 전망을 상향하고 Nvidia·AMD는 2026년 말 차세대 랙을 내놓을 계획이라고 전해졌다.
평가에서 드러난 격리 리스크와 대형 입력·온디바이스 모델 확산
안전성 평가에서의 분리 실패와 32k/1M 토큰급 처리, 온디바이스 안전 모델·저비용 이미지 모델이 이번 기간의 핵심
3조 파라미터 K3 모델을 서버리스로 즉시 배포하고 학습하는 법.
3조 파라미터 규모의 오픈 프론티어 모델 K3를 Fireworks 플랫폼에서 서버리스 방식으로 추론하고 학습시키는 방법이다.
태그 하드웨어 변경 없이 슬롯 효율을 백배 수준으로 확장
Miller 기반 FDMA로 충돌 자원을 2차원으로 확장하고 DHNN으로 손상된 ID를 연상 복구해 대규모 A‑IoT 인벤토리를 획기적으로 확장한다.
추론 흔적과 서버사이드 도구를 지원하는 새 릴리스
LLM 0.32은 보이는 추론, 서버사이드 도구 통합, 내용 주소형 로그로 도구형 워크플로를 강화했습니다.
편집 단위 보상으로 스킬 유효성을 학습
증거를 순차 편집하고 롤백 보상으로 편집 기여도를 학습해 문서·실행 증거에서 재사용 가능한 스킬을 생성합니다.
권한 착각을 완화하는 DAPD
DAPD는 정보를 맞춘 두 계층 앵커로 OPSD의 privilege illusion을 줄여 Qwen3에서 평균 +2.00점의 개선을 달성했습니다.
감사 기반 Manage–Execute–Audit 루프
태스크 상태를 외부에 유지하고 독립 감사로 검증해 장기 작업 성공률을 크게 높이는 에이전트 하니스.
캡션으로 목소리와 장면을 동시에 제어
캡션과 참조 오디오를 병행 조건으로 받아 다중 화자 음성과 장면 오디오를 통합 생성하는 SwanTale
기계적 해석으로 오정렬을 뿌리째 다루려는 도전
ARC가 신경망 내부의 기계적 설명을 찾아 일반화 예측과 원인 기반 손실 설계를 시도한다는 복귀 발표입니다.
과거 지식을 잃지 않고 새로운 환경에 적응하는 연속 강화학습의 원리.
강화학습의 기본 개념과 MDP, 벨만 방정식, DQN을 거쳐 연속 강화학습의 안정성-가소성 딜레마 해결 방안을 다룬다.
데이터센터 전력 피크 대응을 위한 배터리 확보
SpaceX가 xAI 데이터센터 수요 대응을 위해 Tesla Megapack을 대규모로 구매했다.
Ray 최적화를 위한 하드웨어·소프트웨어 공동설계
Anyscale이 Nscale과의 결합으로 Ray와 인프라 공동 최적화를 추진한다
Starmind가 궤도와 데이터센터 경계를 좁힘
Starmind 페이로드·안전 인시던트·하니스 벤치마크가 동시에 트렌드를 밀어올림
문서 OCR의 비용·정확도 격차가 유지된다
LlamaParse는 라우팅·증류·파일계층 최적화로 문서 OCR의 비용을 낮추고 정확도를 올렸다.
QM 사용 중 API 요금 급증 주의
QM의 매 턴 자식 프로세스 재생성은 KV 캐시 활용을 포기해 비용이 늘어날 수 있습니다.
12GB 안드로이드에서 92GB MoE 모델을 약 1 tok/s로 실행
BigMoeOnEdge로 DeepSeek V4 Flash IQ2_M(92GB)를 12GB RAM 휴대기기에서 약 1 tok/s로 실행한 실험 결과와 관련 GitHub 링크.
M5 Max에서 115GB 모델로 비디오 생성
MiniMax‑H3를 MLX로 포팅해 M5 Max에서 텍스트로 15초짜리 비디오를 생성(115GB 다운로드, 약 45분 소요).
RF‑DETR과 GLM‑OCR로 계측기 태그까지 자동 추출
RF‑DETR 학습과 Roboflow Workflows로 P&ID의 11개 기호를 검출하고 OCR로 태그를 추출하는 엔드투엔드 튜토리얼이다
클라우드 마이크로VM과 브라우저로 작동하는 업무 에이전트
Work는 플러그인과 클라우드 브라우저, 영구 스토리지를 묶어 업무 산출물을 자동화하는 ChatGPT 모드이다
복잡 교차로 멀티모달 샘플
6대 카메라·집계 LiDAR·HD맵·차량궤적을 포함한 교차로 샘플
241 tokens/s, 총 응답 0.8초
ArtificialAnalysis.ai 벤치에서 Groq LPU가 Llama 2 Chat (70B)을 241 tokens/s로 처리했고 총 응답 시간은 약 0.8초로 보고되었다.
노트 편집을 AI에 맡겼더니 조용히 망가졌다
개인 노트는 LLM의 환각과 장시간 편집 취약성으로 손상되기 쉬우며, 제안-검증-롤백 검증 게이트로 현실적 안전을 확보할 수 있다
저랭크 구조적 프라이어로 고차원 예측 성능을 개선
FTB는 교차-변수 어텐션에 저랭크 프라이어를 더해 고차원 시계열 예측을 2–7% 향상시킨다.
로컬 모델로 증거 그래프와 구조화된 분석을 결합한 오픈소스 플랫폼
OPREP는 로컬 텍스트·비전·임베딩 모델로 운영되는 엔티티·증거 기반 OSINT 플랫폼이다
세계 모델로 행동을 상상해 움직인다
Cosmos 3 기반 WAM은 동학 사전지식을 이용해 제로샷으로 더 넓은 장면과 로봇에 적응한다
Groq의 LPU로 Llama 3 고속 추론 공개
Groq가 Llama 3 8B에서 약 877 tokens/s, 70B에서 약 284 tokens/s의 처리량과 낮은 응답시간을 보고하며 GroqCloud로 개발자에게 공개했다.
Groq LPU로 일일 수백억 토큰 처리 목표
Groq LPU 기반 데이터센터를 통해 2024년 말 수십억, 2025년 수백억 토큰/일 처리와 nawat을 통한 서비스형 제공을 목표로 한다.
장문 컨텍스트 모델·AV 전용 추론 모델·훈련 커널 발표가 주도
Pokee의 10M-token 주장과 Alpamayo 2 Super, MoK 공개로 긴 문맥·에이전트·학습 효율이 화제
AI 에이전트 3종을 한 대화방에 넣고 돌려본 결과.
잭 도시의 Block이 공개한 AI 에이전트 협업 툴 'Buzz'의 기능과 비용, 장단점을 분석한다.
stdin→LLM→stdout로 파이프에 자연스럽게 합류하는 도구
clai는 표준 입력을 LLM으로 처리해 표준 출력으로 내보내 기존 쉘 도구와 파이프처럼 연결해 사용하는 커맨드라인 도구다.
AI 에이전트가 라이브 공격을 주도
Jesta Security가 라이브 침입에서 deepseek-v4-flash-free 모델을 식별하고 에이전트로부터 타깃 목록과 페이로드 행동을 추출했다.
GPU가 직접 스토리지를 여는 시대
NVIDIA는 cuFile 오픈소스화와 Vera 기반 스토리지 가속으로 AI 데이터 병목을 줄인다.
로봇택시용 오픈 추론 모델 공개
Alpamayo 2 Super는 OpenMDW‑1.1로 배포되는 멀티태스크 자율주행 추론 모델이다
머스크가 발언 절반가량을 AI에 할애하다
머스크는 실적콜 발언의 거의 절반을 AI·로보틱스 주제에 할애하며 회사 전략이 자동차에서 AI로 이동하고 있음을 시사했다.
LLM 생성 초안을 사람이 읽기 쉬운 문장으로 정리하는 Vale 규칙
Vale 스타일로 에이전트 산출물의 기계적 문장을 검출하고 ASD-STE100 수준의 절차 규칙을 선택 적용한다.
토픽별 누적 요약으로 개인 컨텍스트를 유지하는 경량 어시스턴트
Cloudflare Workers에서 동작하고 토픽별로 요약을 누적하는 개인 LLM 어시스턴트 템플릿이다.