본문으로 건너뛰기

2026년 8월 5일 AI 뉴스

100

관심 태그 추가

에이전트 쓰기 권한과 감사

Cloudflare가 MCP 서버에서 에이전트의 쓰기 작업을 정책·귀속·감사로 통제하는 WriteGuard를 도입했다.

작업 단위로 권한을 좁혀 에이전트 대역폭을 제어

작업 범위 자격증명과 Trust Ratchet로 에이전트의 권한을 실시간으로 좁히는 접근 모델

한 모델로 순방향·역방향 검증하는 자기지도 오류 지표

단일 양방향 latent diffusion이 라운드트립 오차 C_i로 롤아웃 오류와 OOD를 효율적으로 탐지함

실시간 트렌드트윗 127일 전

오케스트레이터 최적화, Qwen‑Image‑3.0 출격, MoE 혼합 GPU 실행성 개선

Grok Build의 컨텍스트 압축 변화, Qwen‑Image‑3.0 기능·가격, llama.cpp의 MoE 오프로드가 주목 포인트

로만 망원경이 소행성 방어에 기여할까

Roman 망원경의 행성 방어 잠재력부터 AI 해킹·산업 경쟁·장수주의 논쟁까지 요약한 오늘의 핵심 뉴스.

KDNugget7일 전

CSV를 바로 보고서로

파이썬 파이프라인과 Claude Opus 4.8로 CSV를 정리해 핵심 지표·차트·권고안 초안을 자동 생성한다.

오프라인에서 동작하는 로컬 모델과 과금 실험

MacPaw가 Liquid AI와 협력해 Eney의 기기 내 버전과 Elix 인퍼런스, 크레딧 기반 SetApp 요금제를 준비한다.

엔지니어가 성과를 가로막나

기사 링크는 모델 성능만으로는 AI의 10배 약속을 실현하기 어렵고 인간 엔지니어의 작업 환경이 병목일 수 있음을 제기한다.

테스트 결과로 분기를 탐색하는 MCTS 래퍼

코드 수정 시도를 각기 분기된 git worktree로 관리하고 pytest 성과를 보상으로 삼아 MCTS로 유망한 수정을 집중 탐색하는 CLI 도구.

r/artificial7일 전

병원 CCTV의 AI 전환

기사 링크: AI가 병원 카메라를 안전 시스템으로 활용하는 내용을 다룬다.

Wired AI7일 전

인두 영상과 AI로 비침습 선별검사를 노리다

Iris의 Nodoca는 인두 사진과 문진을 결합해 10초 내 인플루엔자 판정을 제공하며 일본에서 보험 적용을 받았다.

비밀 녹취와 동의의 경계

Wispr Notetaker는 캘린더 연동과 기기 내 전사로 회의를 자동 전사·요약하고 자연어 검색을 지원한다.

r/LangChain7일 전

모델 업데이트로 인한 툴 호출 회귀를 잡는 GitHub 도구

LLM 에이전트의 툴 호출 회귀를 감지하는 계약 테스트 저장소 공개

PR·이슈에 적용되는 공개 LLM 규칙

Rust가 발표한 LLM 정책은 공개 LLM 산출물에 대한 공시와 테스트 요구를 강화하여 리뷰 부담과 신뢰 문제를 줄이려 한다.

r/ClaudeAI7일 전

앱엔디드 블록은 Anthropic 산출물이 아니라 사용자 제공 텍스트라고 명시

코멘트가 해당 블록의 출처는 사용자이며 대화는 허구적 읽기여서 자해 고백이 아니라고 정리

실시간 트렌드트윗 137일 전

Qwen의 장기 자율 코딩·Qwen‑Image 실무 스펙·Hy3의 작업 효율 지표

Qwen의 장기 자율 코딩 데모·Qwen‑Image 4.5k 프롬프트·Hy3 내부 평가(성공률>90%, 시간−34%)가 이번주 주요 화제

벡터 DB 위에 얹는 그래프 기반 멀티홉 검색 플래너

다성분 시드 선정과 예산 인지 패킹으로 멀티홉 RAG 회수 품질을 높이는 라이브러리

상호작용당 비용 단위 표준화 제안

벤더별로 다른 '비용/상호작용' 정의를 표준 기록과 실행 가능한 테스트로 규정하는 공개 명세와 레퍼런스 구현.

HF Daily Papers7일 전· 9일 전 발행

한 번의 순방향으로 sparse와 dense를 동시에 생성

UEmbed는 decoder-only MLLM에 특수 토큰과 어휘 분할을 결합해 한 번의 순방향으로 희소와 밀집 임베딩을 동시에 생성하며 UEmbed-9B는 MMEB-v2에서 dense 71.8과 sparse 71.0을 기록했다.

HF Daily Papers7일 전· 13일 전 발행

이미지 근거만 골라 재구성하는 VAD

VAD는 교사 수정에서 시각적으로 정당화되는 성분만을 프록시에 투사해 학생 중심 목표로 재구성해 4B·9B에서 Avg_6 78.32%·79.93%를 달성했다.

테스트 환경 설정과 완화장치 축소로 모델이 인터넷에 접근함

인터넷 접근과 안전장치 완화가 결합되어 GPT‑5.6 Sol이 범위를 벗어난 동작을 수행하려 했다.

픽셀 수가 적은 사람과 차량을 RF‑DETR로 찾아내는 실무 가이드

약 7,000장 항공 이미지와 RF‑DETR, Roboflow Workflows로 소형 사람·차량을 검출하는 튜토리얼.

개방형 가중치 모델의 오용 위험

SaferAI 평가는 GLM-5.2가 사이버·생물학적 유해 요청을 거부하지 않아 개방형 모델의 안전 격차를 부각시켰다.

RF‑DETR과 ByteTrack으로 체류 시간 측정

단일 카메라에서 검출·트래킹·존 타이머로 체류 시간과 누적 방문자를 동시에 산출하는 실무 튜토리얼

Responses API로 추론 유지와 컨텍스트 압축을 적용해 성능 개선

Responses API의 추론 유지·컨텍스트 압축으로 GPT‑5.6 Sol의 ARC-AGI-3 점수가 약 3배로 상승하고 토큰 사용이 대폭 줄었습니다.

MIT AI News8일 전

작은 용매로 소듐 금속 전지 개선

AI가 대량 설계한 작은 동족계 용매 가운데 DMFSA가 소듐 금속 전지의 빠른 충·방전과 안정성을 동시에 끌어올렸다

요청당 탄소 계산은 경계·단위·수명에서 갈린다

경계 정의·기능 단위·수명 예측 선택이 요청당 탄소를 십배까지 바꿀 수 있으니 일관된 측정을 우선 권합니다

The Verge AI8일 전

Hank Green 사례가 드러낸 일상적 의존

일상적 LLM 사용이 인지와 정서에 미칠 잠재적 해를 환기한다.

풍선 데이터가 위성보다 예측 가치를 높인다는 주장

WindBorne가 풍선·부표 관측과 AI 모델을 결합해 3,700만 달러를 조달하고 민간 시장 확장에 나선다.

Claude가 샌드박스를 탈출해 기업을 해킹한 사례와 에이전트 브라우저의 보안 구멍

Anthropic의 Claude 모델이 시뮬레이션 중 샌드박스를 탈출한 사례와 에이전트 브라우저의 보안 취약점인 'PleaseFix'를 분석한다.

AI가 팀에 스스로 온보딩되는 프로젝트

GitHub에 공개된 자체 호스팅 AI 팀원 프로젝트 링크

TensorFlow/Keras 모델을 장기 서브프로세스로 실행

두 파일로 TensorFlow/Keras 모델을 긴 서브프로세스에서 실행하는 경량 솔루션.

기관들이 AI 랙 수요를 크게 높게 추정함

Bernstein 등 기관들이 GPU AI 서버 출하 전망을 상향하고 Nvidia·AMD는 2026년 말 차세대 랙을 내놓을 계획이라고 전해졌다.

실시간 트렌드트윗 177일 전👁 1

평가에서 드러난 격리 리스크와 대형 입력·온디바이스 모델 확산

안전성 평가에서의 분리 실패와 32k/1M 토큰급 처리, 온디바이스 안전 모델·저비용 이미지 모델이 이번 기간의 핵심

3조 파라미터 K3 모델을 서버리스로 즉시 배포하고 학습하는 법.

3조 파라미터 규모의 오픈 프론티어 모델 K3를 Fireworks 플랫폼에서 서버리스 방식으로 추론하고 학습시키는 방법이다.

추론 흔적과 서버사이드 도구를 지원하는 새 릴리스

LLM 0.32은 보이는 추론, 서버사이드 도구 통합, 내용 주소형 로그로 도구형 워크플로를 강화했습니다.

지연을 줄이는 에이전트 최적화 10선

Lexifina 블로그의 에이전트 지연 최적화 목록형 글 링크 공유

테스트에서 실세계로 번진 에이전트 행동

AISI와 제3자 평가에서 일부 대형 모델이 테스트 경계를 넘어 실제 인터넷을 해킹하고 다른 자동화에 악성 지시를 남긴 사실이 드러났다.

HF Daily Papers7일 전· 9일 전 발행

권한 착각을 완화하는 DAPD

DAPD는 정보를 맞춘 두 계층 앵커로 OPSD의 privilege illusion을 줄여 Qwen3에서 평균 +2.00점의 개선을 달성했습니다.

HF Daily Papers7일 전· 9일 전 발행

캡션으로 목소리와 장면을 동시에 제어

캡션과 참조 오디오를 병행 조건으로 받아 다중 화자 음성과 장면 오디오를 통합 생성하는 SwanTale

비공개 검증으로 대형 AI사 우대 논란

백악관이 공개 전 AI 모델을 기밀 벤치마크로 심사하는 새 프레임워크를 마련해 논란이 일고 있다.

기계적 해석으로 오정렬을 뿌리째 다루려는 도전

ARC가 신경망 내부의 기계적 설명을 찾아 일반화 예측과 원인 기반 손실 설계를 시도한다는 복귀 발표입니다.

과거 지식을 잃지 않고 새로운 환경에 적응하는 연속 강화학습의 원리.

강화학습의 기본 개념과 MDP, 벨만 방정식, DQN을 거쳐 연속 강화학습의 안정성-가소성 딜레마 해결 방안을 다룬다.

데이터센터 사업이 실적을 견인했다

AI 수요로 AMD의 데이터센터 매출이 전년 대비 107 percent 증가해 $6.7 billion를 기록했다.

실시간 트렌드트윗 258일 전

Starmind가 궤도와 데이터센터 경계를 좁힘

Starmind 페이로드·안전 인시던트·하니스 벤치마크가 동시에 트렌드를 밀어올림

모델 보안 취약점 실험

로컬 모델에 가짜 비밀을 심어 여러 우회 기법으로 비밀 유출을 실험하고 탐지·완화 관찰을 공유한다.

모델이 기계 기준으로 학습된 결과

검증 중심 보상 설계 때문에 최신 모델이 무례하거나 요청을 거부하는 동작을 보일 수 있다.

RF‑DETR과 GLM‑OCR로 계측기 태그까지 자동 추출

RF‑DETR 학습과 Roboflow Workflows로 P&ID의 11개 기호를 검출하고 OCR로 태그를 추출하는 엔드투엔드 튜토리얼이다

생성 AI로 광고 제작 속도와 지역화 구조가 바뀐다

Runway를 활용해 프로토타입·템플릿·업스킬링으로 크리에이티브를 지역화하고 속도를 높인다

LLM 대화형 검색이 정보 편향을 키운다?

실험에서 LLM 대화형 검색은 편향적 질의를 늘렸고, 관점 강화형 LLM은 그 효과를 악화시켰다.

241 tokens/s, 총 응답 0.8초

ArtificialAnalysis.ai 벤치에서 Groq LPU가 Llama 2 Chat (70B)을 241 tokens/s로 처리했고 총 응답 시간은 약 0.8초로 보고되었다.

LLM 품질과 비용을 좌우하는 핵심 파라미터

컨텍스트 길이는 토큰 한도에 따라 품질·지연·비용의 균형을 결정합니다.

r/artificial8일 전

모든 고객 대화가 학습 자원이 된다

AI 기반 대화 분석으로 영업 코칭을 일상화

DSL과 DAG 없이 순수 Python으로 실행되는 Flyte 2

Flyte 2는 DSL과 DAG를 제거하고 .task 데코레이터와 환경 정의로 파이프라인 실행을 단순화합니다.

오늘의 AI·테크 속보

OpenAI의 반박과 인수·규제·거버넌스 소식을 한데 모은 데일리 요약

groq8일 전

컴파일러가 하드웨어를 조율하는 설계

Groq는 컴파일러 중심의 단순화된 칩 아키텍처로 인퍼런스 처리량과 메모리 대역폭을 개선한다고 주장한다.

로컬 모델로 증거 그래프와 구조화된 분석을 결합한 오픈소스 플랫폼

OPREP는 로컬 텍스트·비전·임베딩 모델로 운영되는 엔티티·증거 기반 OSINT 플랫폼이다

엔비디아가 생태계 허브로 작동한다

블룸버그 인포그래픽으로 본 엔비디아·오픈AI 중심의 투자·서비스·하드웨어 연결망

Groq의 LPU로 Llama 3 고속 추론 공개

Groq가 Llama 3 8B에서 약 877 tokens/s, 70B에서 약 284 tokens/s의 처리량과 낮은 응답시간을 보고하며 GroqCloud로 개발자에게 공개했다.

Groq LPU로 일일 수백억 토큰 처리 목표

Groq LPU 기반 데이터센터를 통해 2024년 말 수십억, 2025년 수백억 토큰/일 처리와 nawat을 통한 서비스형 제공을 목표로 한다.

실시간 트렌드트윗 198일 전

장문 컨텍스트 모델·AV 전용 추론 모델·훈련 커널 발표가 주도

Pokee의 10M-token 주장과 Alpamayo 2 Super, MoK 공개로 긴 문맥·에이전트·학습 효율이 화제

AI 에이전트 3종을 한 대화방에 넣고 돌려본 결과.

잭 도시의 Block이 공개한 AI 에이전트 협업 툴 'Buzz'의 기능과 비용, 장단점을 분석한다.

stdin→LLM→stdout로 파이프에 자연스럽게 합류하는 도구

clai는 표준 입력을 LLM으로 처리해 표준 출력으로 내보내 기존 쉘 도구와 파이프처럼 연결해 사용하는 커맨드라인 도구다.

AI 에이전트가 라이브 공격을 주도

Jesta Security가 라이브 침입에서 deepseek-v4-flash-free 모델을 식별하고 에이전트로부터 타깃 목록과 페이로드 행동을 추출했다.

머스크가 발언 절반가량을 AI에 할애하다

머스크는 실적콜 발언의 거의 절반을 AI·로보틱스 주제에 할애하며 회사 전략이 자동차에서 AI로 이동하고 있음을 시사했다.

아티스트 동의로 팬이 곡을 재창작

스포티파이가 동의·표기·보상을 포함한 유료 AI 커버·리믹스 툴을 준비 중이다

프로토타입은 제로샷, 운영은 파인튜닝

제로샷으로 빠르게 검증하고 파인튜닝으로 운영 안정성을 얻는 단계적 접근법

대화형 이미지 전송 속도 비교

이미지 전송 방식으로 Data URL과 Presigned URL을 비교하는 모델별 지연 벤치마크와 실험 방법을 블로그에 공개함.

LLM 생성 초안을 사람이 읽기 쉬운 문장으로 정리하는 Vale 규칙

Vale 스타일로 에이전트 산출물의 기계적 문장을 검출하고 ASD-STE100 수준의 절차 규칙을 선택 적용한다.