본문으로 건너뛰기

2026년 7월 21일 AI 뉴스

69

관심 태그 추가

2025년은 에이전트의 해, 단순 LLM을 넘어 자율 시스템을 구축하는 법

LLM을 활용한 워크플로와 자율 에이전트의 설계 원리, 추론 모델의 작동 방식, 그리고 MCP와 A2A 등 에이전트 생태계의 표준 프로토콜을 다룹니다.

llama.cpp 기반 Qwythos-9B 로컬 구동과 MTP speculative decoding을 통한저

Qwythos-9B-Claude-Mythos-5-1M 모델을 llama.cpp로 로컬에서 구동하고 Pi coding agent와 연동해 MTP speculative decoding과 OpenAI 호환 API로 저지연 코딩 워크플로를 구성한다.

Ben의 개인 고백과 Kimi K3 2.8T·1M-token 소식

작성자는 개인적 소진에서 벗어나 뉴스레터에 더 집중하겠다고 밝히며 Kimi K3의 2.8T 파라미터·1M 토큰 컨텍스트와 Fable 5의 구독 통합 같은 최신 AI 소식을 전했다.

ESP32 기반 가중치 스트리밍 LLM 추론 데모

저자는 ESP32에서 호스트로부터 필요한 가중치만 WiFi로 스트리밍해 LLM 추론을 구현했고 속도는 매우 느렸으나 슬라이딩 윈도우로 무한 생성이 가능하다고 설명했다.

실시간 트렌드트윗 1222일 전👁 3

Grok 오픈소스 가능성과 12-bit 3D 비디오 파이프라인

Grok 오픈소스가 모델·인프라·앱의 마진 구조를 바꿀 수 있다는 논의가 부각됐다. 동시에 12-bit 깊이 보존 비디오 파이프라인과 K3의 에이전트형 워크플로가 멀티모달·자동화 축에서 진전 모습을 보였다.

Claude를 AI 직원으로 만드는 12가지 핵심 기능과 실전 활용법

Claude의 모델 선택부터 프로젝트, 커넥터, Claude Code까지 비즈니스 자동화를 위한 12가지 핵심 기능을 정리한다.

파인튜닝 vs RAG: 현대 AI 모델 커스터마이징의 올바른 선택 기준

RAG와 에이전트 스킬 등 현대적 기법의 발전으로 파인튜닝의 필요성이 변화함에 따라, 문제 상황별 최적의 모델 커스터마이징 전략을 제시한다.

빨래 접기 99.1% 성공, Sunday Robotics의 ACT-2와 11억 달러 가치 Walden Rob

Sunday Robotics의 제로샷 빨래 접기 모델 ACT-2와 Russ Tedrake가 창업한 Walden Robotics의 기술 철학 및 투자 현황을 분석한다.

AI21 Labs22일 전

싼 모델 쓰면 비용 줄어든다? 모델 라우팅의 제본스의 역설과 해결책

모델 라우팅을 단순 분류 문제로 접근하면 KV 캐시 파괴와 비용 증가를 초래하며, 이를 강화학습 기반의 에이전트 문제로 해결해야 한다.

Codex 사용과 풀 리퀘스트 70% 차이 내부 분석

OpenAI 내부 자료에서 Codex를 적극 활용하는 엔지니어들이 동료보다 약 70% 더 많은 풀 리퀘스트를 열었고 해당 차이가 시간이 지남에 따라 더 벌어지고 있으며 이로 인해 엔지니어링 생산성 측정의 난도가 증가했다.

단어·은유 재검증으로 드러난 평가 불확실성

단어와 은유 실험에서 상반된 점수가 발견되어 모델 감성과 훈련 데이터 서술 경향을 분리하려는 노력이 공개되었다.

실시간 트렌드트윗 1122일 전👁 1

SpaceX 코퍼스 추가로 Grok 엔지니어링 능력 강화와 에이전트 평가 개선 소식

Grok에 SpaceX 엔지니어링 코퍼스가 보조 학습으로 투입되고, 에이전트 RAG 누출을 잡는 corpus_abstention 평가가 실전에서 효과를 냈다. Alibaba의 HappyHorse 1.1·WonderClip과 ElevenMusic의 무료 확장도 병행해 눈에 띈다.

에이전트 중심 엔지니어링과 인간 승인 기반 거버넌스 도입 사례

Snowflake Summit에서 에이전트 중심 엔지니어링으로 전환하는 추세와 인간 승인 및 컨트롤 레이어를 통한 기업 거버넌스 확장 전망이 제시됐다.

Vizuara22일 전

ChatGPT의 첫 답변이 늦는 이유: Prefill과 Decode의 비밀

ChatGPT의 응답 지연은 전체 프롬프트를 처리하는 Prefill 단계와 토큰을 생성하는 Decode 단계의 구조적 차이에서 발생한다.

에이전트 아키텍처의 6개월 반감기, 무너지는 스택에서 살아남는 설계법

AI 에이전트 스택이 빠르게 변하는 상황에서, 실행 계층(Execution Layer)을 분리하고 내구성을 확보하여 아키텍처 변경을 최소화하는 전략을 다룬다.

OpenCV 기반 실시간 공 추적 서보 골키퍼 프로젝트

OpenCV로 공 위치를 실시간 추적해 서보가 골키퍼 팔을 움직여 슛을 차단하는 로봇 프로젝트와 관련 펌웨어가 GitHub에 공개되었다.

Qwen3-1.7B 생성 텍스트에서 인과 흐름을 시각화한 InfoLens 데모

생성된 텍스트의 토큰별 그래디언트 귀속을 DAG로 추적하고 희소 가지치기를 적용해 Qwen3-1.7B에서 추론 궤적을 시각화한 연구·데모이다.

Tri-Net v2 공개, ConvNeXt·DenseNet·Inception 기반 Mpox 진단 프레임워크

Tri-Net v2는 Scientific Reports 논문에 대응하는 재현 가능한 오픈소스 구현으로 여러 CNN 백본과 누수 방지 파이프라인·피처 융합·Grad-CAM·교차검증을 포함하며 PyPI와 도커·CI로 배포된다.

KDNugget22일 전

에이전트 운영을 버티는 설정과 명령 습관

구성·권한·훅·명령 습관의 차이가 신뢰성 있는 에이전트 운영의 지속성을 결정한다.

HF Daily Papers22일 전· 26일 전 발행

GiGPO에서 Muon 적용으로 최종 검증 성공률 88% 향상

GiGPO 환경에서 Muon을 정책의 숨겨진 행렬 파라미터에 적용하자 최종 윈도우 검증 성공률이 평균 0.29에서 0.55로 증가했고 학습 효율도 개선됐다.

HF Daily Papers22일 전· 26일 전 발행

RHI로 사용자 하니스의 실행 추적 품질과 비용 효율성 개선

하니스를 프롬프트 수준으로 표현하고 쌍별 피드백으로 반복 개정하는 RHI가 소수 반복으로 실행 추적 품질을 높여 저추론비용 에이전트의 성능을 끌어올리고 추론 비용을 최대 60% 줄였다.

AI 에이전트와 소셜 결제가 재편하는 2026 홀리데이 리테일

Salesforce 데이터는 2026년 쇼핑에서 AI 에이전트가 발견을 주도하고 거래는 소셜·오프플랫폼으로 분리되며 모바일과 경제 양극화가 전략 변화를 촉발한다고 보고했다.

프롬프트만으론 부족하다, AI 모델을 추론 파트너로 만드는 법

최신 AI 모델의 성능을 극대화하기 위해 프롬프트 엔지니어링을 넘어 모델과 상호작용하며 추론 과정을 관리하는 전략적 접근법을 다룹니다.

Bun 런타임에서 Rust로 Claude Code 실행 가이드

Bun 런타임과 Rust 연동으로 Claude Code를 로컬 환경에서 실행하는 방법과 구현상 고려사항을 정리한 기술 글이다.

실시간 DETR 기반 통합 탐지·분할 모델 D-FINE-seg 공개

D-FINE-seg은 실시간 DETR 백본으로 객체 검출과 인스턴스·시맨틱 분할을 동시에 수행하며 코드와 가중치는 상업적 이용을 포함해 무료로 제공된다.

Amazon Bedrock로 구현한 Capella iQ 다중 모델 추론 아키텍처

Capella iQ는 Amazon Bedrock과 Anthropic Claude를 연동해 VPC 인터페이스 엔드포인트와 Cross-Region Inference로 다중 모델 추론의 가용성과 유연성을 확보했다.

DeepRacer 개발자 부트로더로 커스텀 OS 설치 가능

AWS는 DeepRacer에서 최신 리눅스 배포판과 서명된 커스텀 OS를 설치할 수 있도록 shim 기반의 개발자용 부트로더를 공개했다.

AI 에이전트가 프로덕션 DB를 삭제했다면? 에이전트 개발 보안의 3대 핵심

AI 에이전트의 자율성이 높아짐에 따라 발생하는 보안 위협을 방지하기 위해, Snyk은 생성 코드, 공급망, 에이전트 행동을 제어하는 3단계 보안 프레임워크를 제시한다.

추론 비용 절감을 위한 실용 가이드와 체크리스트

전체 파이프라인을 프로파일링하여 비용 병목을 파악한 뒤 정확도 목표를 지키는 가장 저비용 대책부터 적용하라고 권고한다.

모델 컨텍스트에서 자격 증명을 분리하는 브로커 패턴

에이전트가 API 토큰을 모델 컨텍스트에 직접 넣으면 prompt injection으로 토큰이 외부로 유출될 수 있으므로 실제 토큰은 브로커가 보관하고 에이전트에는 범위 지정된 capability만 부여해야 한다.

"보는 것"만으론 부족하다? 촉각으로 반응하는 로봇 AI, T-Rex 분석

시각 계획과 촉각 반응을 분리하여 로봇의 정교한 조작 능력을 향상시킨 T-Rex 모델의 구조와 실험 결과를 분석합니다.

CodeEmporium23일 전

컴퓨터 비전의 판도를 바꾼 10가지 논문: LeNet부터 Stable Diffusion까지

LeNet, AlexNet, ResNet, YOLO, U-Net, ViT, CLIP, DINOv2, SAM, Stable Diffusion 등 컴퓨터 비전의 발전을 이끈 10가지 핵심 논문을 정리한다.

GPT-5.6 출시와 Grok 4.5·Muse Spark 경쟁 속 안전·인프라 논쟁

OpenAI의 GPT-5.6 공개와 Meta·SpaceX의 신모델 경쟁이 안전성 평가·가격경쟁·인프라·규제 논의와 함께 진행된 한주였다.

30Hz–25kHz 밴드패스와 ±전압 레일 설계 벤치마크 결과 보고

네 개 LLM을 동일한 회로 설계 과제로 비교한 결과 Kimi K3와 GPT 5.6 Sol이 상대적으로 안정적인 설계를 제공했고 DeepSeek와 Qwen은 반복 시도와 설계 전략에서 실패가 잦았다.

실시간 트렌드트윗 1022일 전👁 7

Grok 4.5 벤치 우위와 Motif-3-Beta(314B) 등장

Grok 4.5가 전문 업무 벤치에서 우위를 보였고, Motif-3-Beta는 314B·256K 컨텍스트로 주목을 모았다. Tencent는 Hyra-1.0과 오픈 결과물을 공개했고, Tesla는 Cybercab에 Starlink V5를 통합했다.

Hy3와 DeepSeek V4 Flash의 1M 토큰 가격 차이로 드러난 중국 모델의 저가 경쟁

업계 차트가 Hy3와 DeepSeek V4 Flash 등의 1M 토큰당 API 가격이 OpenAI·Anthropic보다 현저히 낮음을 나타내며 Kimi K3는 다른 가격 전략을 사용함이 관찰되었다.

실시간 트렌드트윗 1222일 전👁 5

Gemini Batch p95 -80% · motif 13B/314B MoE 오픈웨이트 · StarlinkV

Gemini Batch는 p95 지연을 80% 줄였고, motif는 13B 활성·314B 총합 MoE 오픈웨이트를 공개했다. Tesla는 Starlink V5를 Cybercab에 직접 통합했다.

iMessage 기반 어시스턴트의 지연·표시 제약으로 얻은 실무적 설계 인사이트

메시징 인터페이스 제약 때문에 응답 지연이 ‘문자열’로 인식되므로 빠른 의도 추출의 패스트패스와 실제 작업의 슬로우패스를 분리하고 응답 길이를 강하게 제한하는 설계가 필요하다는 교훈을 제시한다.

HF Daily Papers22일 전· 1달 전 발행

25Hz 단일 코드북 토큰·멜로디 체인오브쏘트로 전체 곡 생성과 고해상도 48kHz 스테레오 렌더링을 연결한

Qwen-Music은 25Hz Music Semantic Token과 Melody-CoT를 핵심으로 하는 LLM 기반 파이프라인과 DiT+Spec-VAE+Band-Mode Refiner 렌더러를 결합해 텍스트·가사·참조 멜로디에서 고음질 보컬 포함 완결곡을 생성하는 시스템이다.

HF Daily Papers22일 전· 26일 전 발행

프리트레이닝 손실이 RL 성능과 학습 속도를 결정하는 증거 기반 결과

체스 테스트베드를 이용해 프리트레이닝 손실이 고정 RL 계산에서 최종 성능을 예측하고 프리트레이닝 토큰 수가 RL 개선 속도의 기울기를 높인다는 합성 스케일링 법칙을 제시했다.

HF Daily Papers22일 전· 29일 전 발행

1.02M PR로 확인한 AI 리뷰 도입 방식별 효율과 리뷰 스멜 변화

207개 오픈소스 프로젝트의 1.02M PR 분석에서 Gradual AI와 Rapid AI Agent 도입은 리뷰 속도를 단축했지만 Rapid LLM 도입은 리뷰 스멜을 증가시킨 것으로 나타났다.

HF Daily Papers22일 전· 26일 전 발행

상태 저장 메모리·SID·잠재 추론으로 GPU 비용 52.4% 절감

RecGPT-V3는 Memory Hub, SID 기반 하이브리드 모달, Latent Intent Reasoning을 도입해 Taobao에서 IPV +1.28%·CTR +1.00%·TC +1.97%·GMV +3.97%를 달성하며 서빙 비용을 52.4% 절감했다.

HF Daily Papers22일 전· 28일 전 발행

데이터 혼합 self-evolution으로 HealthBench 등 의료 벤치마크 상위권을 달성한 Cura

Cura 1T는 Kimi-K2.6을 기반으로 LoRA 어댑터와 인간 게이트를 둔 self-evolution 루프를 이용해 벤치마크별 실패를 데이터로 해결한 결과 의료 평가 전반에서 우수한 성능을 보였다.

HF Daily Papers22일 전· 27일 전 발행

시간적 특징 증강과 희소 업데이트로 Residual-state를 N=16까지 확장한 xHC

xHC는 temporal feature augmentation과 sparse residual updates를 결합해 residual-stream을 N=16으로 확장하여 mHC 대비 18B 모델에서 평균 downstream 점수를 +4.0 포인트 개선하고 동일 손실을 달성하는데 필요한 계산량을 1.19×로 단축했다.

HF Daily Papers22일 전· 27일 전 발행

100K시간 실제 궤적과 자동 주석으로 확보한 로봇 행동 파운데이션 모델

100,000시간 이상의 UMI 실세계 궤적과 자동 언어 주석으로 사전학습한 Xiaomi-Robotics-1이 대규모 스케일링으로 실환경 지시 수행과 적은 데이터로의 효율적 미세조정 능력을 확보했다.

HF Daily Papers22일 전· 26일 전 발행

20B(2B active) MoE로 루프드 Transformer 성능 우위 입증

Loopie는 20B(2B active)와 6B(0.6B active) MoE 기반 루프드 Transformer를 제안하여 동일한 학습량에서 vanilla 30B-A3B보다 우수한 성능을 보였고 2025 IMO와 IPhO에서 금메달급 추론 능력을 달성했다.

HF Daily Papers22일 전· 1달 전 발행

단일 GPU로 구동되는 다단계 GraphRAG 엔진과 7B 추출기의 성능·효율 균형

RAGU는 추출과 통합을 분리한 다단계 GraphRAG 파이프라인과 7B 기반 Meno-Lite-0.1 추출기를 결합해 문맥 회수량을 높이고 합성형 과제에서 기존 시스템을 능가했다.

HF Daily Papers22일 전· 27일 전 발행

튜토리얼 영상 중심의 멀티모달 Skill Wiki로 에이전트 품질 11.9포인트 향상

Resource2Skill은 튜토리얼 영상·코드·문서를 멀티모달 스킬 위키로 증류하여 에이전트의 평균 전체 점수를 11.9포인트 향상시켰다.

2.8조 파라미터 Kimi K3 공개와 Gemini 지연, Anthropic 1.05–1.15조 달러 전망

이번 주에는 2.8조 파라미터와 100만 토큰 컨텍스트를 갖춘 공개 가중치 모델 Kimi K3가 등장했고 Gemini 3.5 Pro는 재차 연기되었으며 Anthropic의 IPO 예상 가치가 1조 달러 수준으로 재조정되었고 ChatGPT는 통합 검색 기능을 배포했다.

실시간 트렌드트윗 1323일 전👁 5

Gemma 4 31B·1GW 데이터센터·오픈웨이트 포렌식 동향

초저지연 음성(31B), 1GW 중국산 데이터센터, 오픈웨이트로 수행한 침해 포렌식이 이번주 업계 대화의 핵심이었다.

replay 버퍼 없이 유사도 기반 라우팅으로 연속학습 경량화

Coincidex는 context 기반 유사도 행렬로 입력을 동적으로 라우팅해 replay 버퍼 없이 연속 학습에서 전이를 달성하려는 PyTorch 연구용 프레임워크이다.

미국 법안과 Qwen 3.8 공개의 파급

Ben Thompson은 미국이 학습용 데이터 수집을 공정 이용으로 규정하고 서비스 약관으로 distillation을 금지하는 조항을 금지해야 한다고 권고했으며 Xi의 개방 권장 연설 이후 Alibaba가 Qwen 3.8 Max의 공개 가중치를 배포했다는 정황을 전했다.

쿼리 30배·TCO 40% 개선된 Amazon Quick 도입 사례

Tradeshift는 Amazon Quick의 agentic AI 기능을 도입해 쿼리 응답을 최대 30배, 총 소유 비용을 40% 절감하고 임베디드 분석을 통한 수익화를 달성했다.

내 컴퓨터에서 24시간 돌아가는 나만의 AI 에이전트, Hermes Agent 구축법

로컬 환경에서 실행되는 오픈소스 AI 에이전트 Hermes Agent의 설치, 메모리 관리, 도구 통합 및 로컬 모델 활용법을 다룬다.

AI 보안의 실체: 10억 달러 노출시킨 설정 실수와 인프라 보안의 중요성

ML 보안 사고의 78%는 복잡한 AI 공격이 아닌 권한 과다, 평면 네트워크 등 기본적인 인프라 설정 실수에서 발생한다.

AI Engineer23일 전

코딩 에이전트가 프로덕션 코드를 수정할 때 잠들 수 있는 방법: PatchPilot의 보안 아키텍처

CVE 패치 자동화 에이전트 PatchPilot의 보안 아키텍처와 공급망 공격 방지를 위한 격리 전략.

AI Engineer23일 전

아마존도 못 보는 내 데이터, 2만 줄의 코드로 구현한 프라이버시 AI

아마존의 AI 웨어러블 'Bee'는 사용자의 기기에서만 암호화 키를 관리하고, Sigstore를 통한 코드 검증으로 데이터 프라이버시를 보장한다.

AI Engineer23일 전

"내 에이전트가 밤중에 DB를 삭제한다면?" 에이전트 보안을 위한 OAuth 토큰 교환 전략

AI 에이전트의 과도한 API 키 권한 문제를 해결하기 위해, 각 도구 호출마다 단기 토큰을 발행하는 OAuth 토큰 교환(RFC 8693) 도입 전략을 설명합니다.

AI Engineer23일 전

AI 소프트웨어 개발을 가로막는 3가지 치명적 보안 위협

AI 개발의 생산성에도 불구하고 코드 보안, 에이전트 통제, 모델 접근성 문제가 대규모 배포의 걸림돌이 되고 있어 보안 내재화가 필수적이다.

AI 에이전트가 규칙을 어기는 이유: CISO가 제안하는 안전한 설계 전략

AI 에이전트가 목표 달성을 위해 내부에서 제약을 우회하는 문제를 해결하기 위해, 강제성 있는 제약 조건과 'Halt and Explain' 메커니즘을 포함한 Corrigibility by Design 전략을 제시한다.

고정된 하니스로 Terminal-Bench 성능을 향상한 Harness Training 공개

고정된 하니스를 학습해 여러 task LLM에 재사용하고 Terminal-Bench 2.0을 능가하는 전이 성능을 달성한 오픈소스 PyTorch 유사 프레임워크를 공개했다.

실시간 트렌드트윗 2423일 전👁 1

Grok Excel 통합·Kimi K3 순위 상승·Cosmos 3 Edge 오픈 소스 전개

Grok의 Excel 연결, 에이전트 벤치마크의 세대 교체, 엣지에서 실행 가능한 월드 모델 공개가 한 주에 겹쳤다. 개발 인프라·캐시·평가 툴의 실무적 개선 움직임이 눈에 띈다.

AI 에이전트의 환각과 기술 부채: 개발자가 반드시 알아야 할 3단계 검증 전략

AI 에이전트의 환각 위험을 줄이기 위한 3단계 검증 프레임워크와 에이전트 시대의 코드 품질 관리 전략을 다룬다.

무료 API 한도 전 LLM 에이전트 안전 중단 및 신속 재개 기능

요청 전 비용을 예측해 잔여 예산과 비교하고 필요 시 체크포인트로 중단해 이후 동일 단계에서 재개하는 도구로, 로컬 KV-cache 복원 시 재프리필 시간을 수십 배 줄였다.

평가 실패를 감지하고 차단·교정·증명까지 연결하는 워크플로

프로덕션에서 LLM의 실패를 감지한 뒤 수정안을 적용하고 같은 실패가 재발하지 않음을 증명하는 데 필요한 툴별 동작 방식과 온프레미스·라이선스 차이를 비교한 글이다.

r/artificial23일 전

컨텍스트 레이어 아키텍처 부재와 제안된 컴포넌트

중앙화된 컨텍스트 플랫폼 부재를 지적하고 지식 그래프·온톨로지·스킬·복리형 학습 루프를 포함한 레이어 아키텍처를 제시한다.

Claude Code 병렬 실행 시 발생하는 충돌을 완벽히 해결하는 워크플로

Claude Code를 병렬로 실행할 때 발생하는 파일 및 환경 충돌을 Git worktrees, Docker Sandbox, 오케스트레이션으로 해결하는 실전 가이드.