섹션별 상세
기술
- DeepSeek V4
- MCP
- Notion
- Claude Opus 4.7
활용 사례
- 에이전트 런타임 최적화
- 벡터 검색 인프라 확장
- LLM 추론 비용 절감
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
에이전트 런타임의 기술 부채, DeepSeek V4의 KV-cache 압축, Notion의 벡터 검색 최적화 사례를 포함한 AI 뉴스레터.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
아직 관련 토론이 없습니다.
댓글을 작성하려면 로그인이 필요합니다.
이번 기간에는 PyTorch를 중심으로 분산 학습, GPU 풀링, Kubernetes 기반 추론을 여러 계층에서 연결하는 오픈소스 인프라 흐름이 이어졌습니다. 에이전트 쪽에서는 제한된 프롬프트 예산에 맞춘 메모리 병합·검색 방식과 prompt injection 방어 계층이 구체적인 수치와 함께 공유됐습니다. Perplexity Search의 Hermes 연결, GLM 5.3 Flash의 에이전트 자동화 성능과 저비용 서버리스 추론도 새 기능과 실행 환경의 변화로 묶였습니다. 한편 Astra와 Muse에서는 초기 사용량이 예상치를 크게 웃돌았고, AI가 보안 공격과 인간의 장기적 안전에 미치는 영향에 대한 경계도 함께 나타났습니다.
이번 포스트 묶음에서는 Grok Bot이 Slack·이메일·Notion·Stripe 같은 업무 도구를 연결해 브리핑과 후속 실행까지 맡는 에이전트 사례가 부각됐습니다. DeepSeek v4 Flash는 하루 처리량이 3T 토큰에서 18T 토큰으로 늘어난 뒤 가격 인상과 용량 제약으로 정점의 절반 이하로 감소했으며, 낮은 가격을 유지하려면 약 1000대의 B300이 필요하다는 운영 수치가 나왔습니다. Perplexity Agent API는 9개 제공업체의 41개 frontier model과 검색·코드 실행 도구를 한 endpoint에 묶었고, Matryoshka 구조는 36% 적은 training compute와 14~26% 빠른 speculative decoding을 기록했습니다. 메모리 기반 self-improving agent 평가는 작업 순서와 반복 실행을 무작위화하면 기존 성과가 줄어든다는 결과를 냈으며, LLM과 embedding의 검색 비용 차이도 함께 부각됐습니다.
이번 기간에는 GLM-5.3의 open-weight 공개와 로컬 실행 최적화가 가장 구체적인 모델 출시 흐름으로 나타났다. Anthropic은 Claude가 다른 모델의 alignment를 수행하도록 학습하는 실험을 공개했고, Gemini는 실제 과학 실험과 침수 지도 작성처럼 연구·현장 데이터를 연결하는 방향으로 확장됐다. 에이전트 개발에서는 MCP, Deep Agents, LangSmith, Claude Code의 세션 재개 기능이 도구 연결과 장기 작업 관리를 강화하는 흐름을 만들었다. 동시에 정적 임베딩의 처리량과 정확도 간 절충, AI가 가속기 설계와 양자 프로세서 연동에 관여하는 시스템 수준의 변화도 함께 나타났다.
이번 기간에는 에이전트의 모델 성능보다 도구 권한, 실행 계층, 인간 개입을 함께 설계해야 한다는 관점이 여러 게시물에서 이어졌습니다. Grok 4.6의 Agentic Index 공동 1위 주장과 Claude Code의 /design 기능은 에이전트가 계획과 제작 과정에 직접 관여하는 방향을 보여줬고, Claude Code CLI는 유휴 시점에 garbage collector를 실행해 p99 CPU 사용량을 절반으로 낮췄습니다. Qwen3.8-27B를 중심으로 로컬 open-weights 모델이 DeepSeek V4-Pro와 GPT-5.6 Luna에 가까운 성능을 보였다는 게시물이 집중됐지만, 일부 수치는 외부 평가를 인용한 주장으로 제시됐습니다. SynthID-Text 방식의 워터마크 판별과 AI Gateway 계층화는 생성 결과의 검증과 모델 교체를 위한 구현상의 관심사로 나타났습니다.
이번 기간에는 DeepSeek-V4-Flash-Vision-Exp의 weights 공개와 API 출시가 맞물리며 native vision과 multimodal agent 활용 범위가 넓어졌다. 모델 측면에서는 Hy4의 770B total·49B active·1M context 구성과 DeepSeek-V4-Flash EXL3-REAP의 128GB 로컬 실행 수치가 실제 사용 환경을 겨냥한 비교 기준으로 떠올랐다. 동시에 Agent가 작업마다 코드를 생성·실행·폐기하는 구조와 on-policy distillation 같은 post-training 기법이 모델 중심 개발 방식의 변화를 뒷받침했다. £100M 규모의 영국 공공 AI 조달과 250MW·$5B+ 인프라 계약은 에이전트 도입과 open source compute의 운영 조건을 바꾸는 사례로 나타났다.