2025년은 에이전트의 해, 단순 LLM을 넘어 자율 시스템을 구축하는 법
LLM을 활용한 워크플로와 자율 에이전트의 설계 원리, 추론 모델의 작동 방식, 그리고 MCP와 A2A 등 에이전트 생태계의 표준 프로토콜을 다룹니다.
총 69건
LLM을 활용한 워크플로와 자율 에이전트의 설계 원리, 추론 모델의 작동 방식, 그리고 MCP와 A2A 등 에이전트 생태계의 표준 프로토콜을 다룹니다.
Qwythos-9B-Claude-Mythos-5-1M 모델을 llama.cpp로 로컬에서 구동하고 Pi coding agent와 연동해 MTP speculative decoding과 OpenAI 호환 API로 저지연 코딩 워크플로를 구성한다.
작성자는 개인적 소진에서 벗어나 뉴스레터에 더 집중하겠다고 밝히며 Kimi K3의 2.8T 파라미터·1M 토큰 컨텍스트와 Fable 5의 구독 통합 같은 최신 AI 소식을 전했다.
저자는 ESP32에서 호스트로부터 필요한 가중치만 WiFi로 스트리밍해 LLM 추론을 구현했고 속도는 매우 느렸으나 슬라이딩 윈도우로 무한 생성이 가능하다고 설명했다.
Grok 오픈소스가 모델·인프라·앱의 마진 구조를 바꿀 수 있다는 논의가 부각됐다. 동시에 12-bit 깊이 보존 비디오 파이프라인과 K3의 에이전트형 워크플로가 멀티모달·자동화 축에서 진전 모습을 보였다.
오픈 가중치 모델의 성능 격차 축소와 비용 구조 변화로 AI 지출 대부분이 오픈 모델 쪽으로 이동할 가능성이 커졌다.
Claude의 모델 선택부터 프로젝트, 커넥터, Claude Code까지 비즈니스 자동화를 위한 12가지 핵심 기능을 정리한다.
RAG와 에이전트 스킬 등 현대적 기법의 발전으로 파인튜닝의 필요성이 변화함에 따라, 문제 상황별 최적의 모델 커스터마이징 전략을 제시한다.
Sunday Robotics의 제로샷 빨래 접기 모델 ACT-2와 Russ Tedrake가 창업한 Walden Robotics의 기술 철학 및 투자 현황을 분석한다.
모델 라우팅을 단순 분류 문제로 접근하면 KV 캐시 파괴와 비용 증가를 초래하며, 이를 강화학습 기반의 에이전트 문제로 해결해야 한다.
OpenAI 내부 자료에서 Codex를 적극 활용하는 엔지니어들이 동료보다 약 70% 더 많은 풀 리퀘스트를 열었고 해당 차이가 시간이 지남에 따라 더 벌어지고 있으며 이로 인해 엔지니어링 생산성 측정의 난도가 증가했다.
단어와 은유 실험에서 상반된 점수가 발견되어 모델 감성과 훈련 데이터 서술 경향을 분리하려는 노력이 공개되었다.
Grok에 SpaceX 엔지니어링 코퍼스가 보조 학습으로 투입되고, 에이전트 RAG 누출을 잡는 corpus_abstention 평가가 실전에서 효과를 냈다. Alibaba의 HappyHorse 1.1·WonderClip과 ElevenMusic의 무료 확장도 병행해 눈에 띈다.
Snowflake Summit에서 에이전트 중심 엔지니어링으로 전환하는 추세와 인간 승인 및 컨트롤 레이어를 통한 기업 거버넌스 확장 전망이 제시됐다.
ChatGPT의 응답 지연은 전체 프롬프트를 처리하는 Prefill 단계와 토큰을 생성하는 Decode 단계의 구조적 차이에서 발생한다.
AI 에이전트 스택이 빠르게 변하는 상황에서, 실행 계층(Execution Layer)을 분리하고 내구성을 확보하여 아키텍처 변경을 최소화하는 전략을 다룬다.
OpenCV로 공 위치를 실시간 추적해 서보가 골키퍼 팔을 움직여 슛을 차단하는 로봇 프로젝트와 관련 펌웨어가 GitHub에 공개되었다.
생성된 텍스트의 토큰별 그래디언트 귀속을 DAG로 추적하고 희소 가지치기를 적용해 Qwen3-1.7B에서 추론 궤적을 시각화한 연구·데모이다.
Tri-Net v2는 Scientific Reports 논문에 대응하는 재현 가능한 오픈소스 구현으로 여러 CNN 백본과 누수 방지 파이프라인·피처 융합·Grad-CAM·교차검증을 포함하며 PyPI와 도커·CI로 배포된다.
GiGPO 환경에서 Muon을 정책의 숨겨진 행렬 파라미터에 적용하자 최종 윈도우 검증 성공률이 평균 0.29에서 0.55로 증가했고 학습 효율도 개선됐다.
하니스를 프롬프트 수준으로 표현하고 쌍별 피드백으로 반복 개정하는 RHI가 소수 반복으로 실행 추적 품질을 높여 저추론비용 에이전트의 성능을 끌어올리고 추론 비용을 최대 60% 줄였다.
Salesforce 데이터는 2026년 쇼핑에서 AI 에이전트가 발견을 주도하고 거래는 소셜·오프플랫폼으로 분리되며 모바일과 경제 양극화가 전략 변화를 촉발한다고 보고했다.
최신 AI 모델의 성능을 극대화하기 위해 프롬프트 엔지니어링을 넘어 모델과 상호작용하며 추론 과정을 관리하는 전략적 접근법을 다룹니다.
Bun 런타임과 Rust 연동으로 Claude Code를 로컬 환경에서 실행하는 방법과 구현상 고려사항을 정리한 기술 글이다.
D-FINE-seg은 실시간 DETR 백본으로 객체 검출과 인스턴스·시맨틱 분할을 동시에 수행하며 코드와 가중치는 상업적 이용을 포함해 무료로 제공된다.
Capella iQ는 Amazon Bedrock과 Anthropic Claude를 연동해 VPC 인터페이스 엔드포인트와 Cross-Region Inference로 다중 모델 추론의 가용성과 유연성을 확보했다.
AWS는 DeepRacer에서 최신 리눅스 배포판과 서명된 커스텀 OS를 설치할 수 있도록 shim 기반의 개발자용 부트로더를 공개했다.
AI 에이전트의 자율성이 높아짐에 따라 발생하는 보안 위협을 방지하기 위해, Snyk은 생성 코드, 공급망, 에이전트 행동을 제어하는 3단계 보안 프레임워크를 제시한다.
전체 파이프라인을 프로파일링하여 비용 병목을 파악한 뒤 정확도 목표를 지키는 가장 저비용 대책부터 적용하라고 권고한다.
에이전트가 API 토큰을 모델 컨텍스트에 직접 넣으면 prompt injection으로 토큰이 외부로 유출될 수 있으므로 실제 토큰은 브로커가 보관하고 에이전트에는 범위 지정된 capability만 부여해야 한다.
시각 계획과 촉각 반응을 분리하여 로봇의 정교한 조작 능력을 향상시킨 T-Rex 모델의 구조와 실험 결과를 분석합니다.
LeNet, AlexNet, ResNet, YOLO, U-Net, ViT, CLIP, DINOv2, SAM, Stable Diffusion 등 컴퓨터 비전의 발전을 이끈 10가지 핵심 논문을 정리한다.
OpenAI의 GPT-5.6 공개와 Meta·SpaceX의 신모델 경쟁이 안전성 평가·가격경쟁·인프라·규제 논의와 함께 진행된 한주였다.
이번 에피소드에서는 미국의 모델 배포 통제와 GPT-5.6 초기 접근 제한, Jalapeño 3nm 추론 ASIC 공개 등 최근 AI의 규제·안전·인프라 변화를 정리했다.
네 개 LLM을 동일한 회로 설계 과제로 비교한 결과 Kimi K3와 GPT 5.6 Sol이 상대적으로 안정적인 설계를 제공했고 DeepSeek와 Qwen은 반복 시도와 설계 전략에서 실패가 잦았다.
Grok 4.5가 전문 업무 벤치에서 우위를 보였고, Motif-3-Beta는 314B·256K 컨텍스트로 주목을 모았다. Tencent는 Hyra-1.0과 오픈 결과물을 공개했고, Tesla는 Cybercab에 Starlink V5를 통합했다.
업계 차트가 Hy3와 DeepSeek V4 Flash 등의 1M 토큰당 API 가격이 OpenAI·Anthropic보다 현저히 낮음을 나타내며 Kimi K3는 다른 가격 전략을 사용함이 관찰되었다.
Gemini Batch는 p95 지연을 80% 줄였고, motif는 13B 활성·314B 총합 MoE 오픈웨이트를 공개했다. Tesla는 Starlink V5를 Cybercab에 직접 통합했다.
Qwen-Music은 25Hz Music Semantic Token과 Melody-CoT를 핵심으로 하는 LLM 기반 파이프라인과 DiT+Spec-VAE+Band-Mode Refiner 렌더러를 결합해 텍스트·가사·참조 멜로디에서 고음질 보컬 포함 완결곡을 생성하는 시스템이다.
체스 테스트베드를 이용해 프리트레이닝 손실이 고정 RL 계산에서 최종 성능을 예측하고 프리트레이닝 토큰 수가 RL 개선 속도의 기울기를 높인다는 합성 스케일링 법칙을 제시했다.
207개 오픈소스 프로젝트의 1.02M PR 분석에서 Gradual AI와 Rapid AI Agent 도입은 리뷰 속도를 단축했지만 Rapid LLM 도입은 리뷰 스멜을 증가시킨 것으로 나타났다.
RecGPT-V3는 Memory Hub, SID 기반 하이브리드 모달, Latent Intent Reasoning을 도입해 Taobao에서 IPV +1.28%·CTR +1.00%·TC +1.97%·GMV +3.97%를 달성하며 서빙 비용을 52.4% 절감했다.
Cura 1T는 Kimi-K2.6을 기반으로 LoRA 어댑터와 인간 게이트를 둔 self-evolution 루프를 이용해 벤치마크별 실패를 데이터로 해결한 결과 의료 평가 전반에서 우수한 성능을 보였다.
xHC는 temporal feature augmentation과 sparse residual updates를 결합해 residual-stream을 N=16으로 확장하여 mHC 대비 18B 모델에서 평균 downstream 점수를 +4.0 포인트 개선하고 동일 손실을 달성하는데 필요한 계산량을 1.19×로 단축했다.
100,000시간 이상의 UMI 실세계 궤적과 자동 언어 주석으로 사전학습한 Xiaomi-Robotics-1이 대규모 스케일링으로 실환경 지시 수행과 적은 데이터로의 효율적 미세조정 능력을 확보했다.
Loopie는 20B(2B active)와 6B(0.6B active) MoE 기반 루프드 Transformer를 제안하여 동일한 학습량에서 vanilla 30B-A3B보다 우수한 성능을 보였고 2025 IMO와 IPhO에서 금메달급 추론 능력을 달성했다.
RAGU는 추출과 통합을 분리한 다단계 GraphRAG 파이프라인과 7B 기반 Meno-Lite-0.1 추출기를 결합해 문맥 회수량을 높이고 합성형 과제에서 기존 시스템을 능가했다.
Resource2Skill은 튜토리얼 영상·코드·문서를 멀티모달 스킬 위키로 증류하여 에이전트의 평균 전체 점수를 11.9포인트 향상시켰다.
이번 주에는 2.8조 파라미터와 100만 토큰 컨텍스트를 갖춘 공개 가중치 모델 Kimi K3가 등장했고 Gemini 3.5 Pro는 재차 연기되었으며 Anthropic의 IPO 예상 가치가 1조 달러 수준으로 재조정되었고 ChatGPT는 통합 검색 기능을 배포했다.
초저지연 음성(31B), 1GW 중국산 데이터센터, 오픈웨이트로 수행한 침해 포렌식이 이번주 업계 대화의 핵심이었다.
Coincidex는 context 기반 유사도 행렬로 입력을 동적으로 라우팅해 replay 버퍼 없이 연속 학습에서 전이를 달성하려는 PyTorch 연구용 프레임워크이다.
Ben Thompson은 미국이 학습용 데이터 수집을 공정 이용으로 규정하고 서비스 약관으로 distillation을 금지하는 조항을 금지해야 한다고 권고했으며 Xi의 개방 권장 연설 이후 Alibaba가 Qwen 3.8 Max의 공개 가중치를 배포했다는 정황을 전했다.
Tradeshift는 Amazon Quick의 agentic AI 기능을 도입해 쿼리 응답을 최대 30배, 총 소유 비용을 40% 절감하고 임베디드 분석을 통한 수익화를 달성했다.
로컬 환경에서 실행되는 오픈소스 AI 에이전트 Hermes Agent의 설치, 메모리 관리, 도구 통합 및 로컬 모델 활용법을 다룬다.
ML 보안 사고의 78%는 복잡한 AI 공격이 아닌 권한 과다, 평면 네트워크 등 기본적인 인프라 설정 실수에서 발생한다.
CVE 패치 자동화 에이전트 PatchPilot의 보안 아키텍처와 공급망 공격 방지를 위한 격리 전략.
아마존의 AI 웨어러블 'Bee'는 사용자의 기기에서만 암호화 키를 관리하고, Sigstore를 통한 코드 검증으로 데이터 프라이버시를 보장한다.
AI 에이전트의 과도한 API 키 권한 문제를 해결하기 위해, 각 도구 호출마다 단기 토큰을 발행하는 OAuth 토큰 교환(RFC 8693) 도입 전략을 설명합니다.
AI 개발의 생산성에도 불구하고 코드 보안, 에이전트 통제, 모델 접근성 문제가 대규모 배포의 걸림돌이 되고 있어 보안 내재화가 필수적이다.
AI 에이전트가 목표 달성을 위해 내부에서 제약을 우회하는 문제를 해결하기 위해, 강제성 있는 제약 조건과 'Halt and Explain' 메커니즘을 포함한 Corrigibility by Design 전략을 제시한다.
고정된 하니스를 학습해 여러 task LLM에 재사용하고 Terminal-Bench 2.0을 능가하는 전이 성능을 달성한 오픈소스 PyTorch 유사 프레임워크를 공개했다.
Grok의 Excel 연결, 에이전트 벤치마크의 세대 교체, 엣지에서 실행 가능한 월드 모델 공개가 한 주에 겹쳤다. 개발 인프라·캐시·평가 툴의 실무적 개선 움직임이 눈에 띈다.
AI 에이전트의 환각 위험을 줄이기 위한 3단계 검증 프레임워크와 에이전트 시대의 코드 품질 관리 전략을 다룬다.
프로덕션에서 LLM의 실패를 감지한 뒤 수정안을 적용하고 같은 실패가 재발하지 않음을 증명하는 데 필요한 툴별 동작 방식과 온프레미스·라이선스 차이를 비교한 글이다.
중앙화된 컨텍스트 플랫폼 부재를 지적하고 지식 그래프·온톨로지·스킬·복리형 학습 루프를 포함한 레이어 아키텍처를 제시한다.
Claude Code를 병렬로 실행할 때 발생하는 파일 및 환경 충돌을 Git worktrees, Docker Sandbox, 오케스트레이션으로 해결하는 실전 가이드.