본문으로 건너뛰기

GLM-5.3 오픈 웨이트, Claude 자율 얼라인먼트, Gemini 과학 실험, 에이전트 실행 인프라

오픈 모델 실행 비용부터 자율 연구·에이전트 인프라까지 AI 시스템의 실행 경계 확장

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이번 기간에는 GLM-5.3의 open-weight 공개와 로컬 실행 최적화가 가장 구체적인 모델 출시 흐름으로 나타났다. Anthropic은 Claude가 다른 모델의 alignment를 수행하도록 학습하는 실험을 공개했고, Gemini는 실제 과학 실험과 침수 지도 작성처럼 연구·현장 데이터를 연결하는 방향으로 확장됐다. 에이전트 개발에서는 MCP, Deep Agents, LangSmith, Claude Code의 세션 재개 기능이 도구 연결과 장기 작업 관리를 강화하는 흐름을 만들었다. 동시에 정적 임베딩의 처리량과 정확도 간 절충, AI가 가속기 설계와 양자 프로세서 연동에 관여하는 시스템 수준의 변화도 함께 나타났다.

𝕏 실시간 트렌드 토픽

🔥 GLM-5.3 오픈 웨이트와 로컬 실행 최적화포스트 5

GLM-5.3이 agentic coding과 cyber defense를 겨냥한 open-weight 모델로 공개되면서 다운로드·실행·커스터마이즈 경로가 열렸다. Unsloth는 2-bit 변환 결과와 GLM-5.3 Flash의 토큰 효율·실패 속도를 비교하며 로컬 배포 조건을 구체화했다.

세부 내용 보기
  • Z.ai는 GLM-5.3의 가중치를 공개해 사용자가 모델을 다운로드하고 실행하거나 수정할 수 있게 했다. Unsloth는 이 모델을 1.51TB에서 239GB로 줄인 2-bit 버전이 약 81%의 정확도를 유지한다고 전했으며, 크기는 -83% 감소했다.
  • GLM-5.3 Flash는 native precision에서 초당 180토큰을 생성하고 동시성 확장성이 높다는 평가를 받았다. 비교 게시물은 DSV4F 0731이 초당 300~400토큰으로 더 빠르게 디코딩하지만 더 많은 토큰을 사용하고, GLM-5.3 Flash는 해법에 필요한 토큰의 1/5만 사용해 실제 해법 도달 속도가 2배 이상 빠르다고 전했다.
  • 이 흐름은 모델 선택 기준을 단순한 생성 속도에서 해법 도달 시간, 토큰 소비량, 실패까지 소요되는 계산량, 로컬 메모리 요구량으로 넓힌다. 다만 GLM-5.3 Flash와 전체 GLM-5.3의 vision 지원 여부는 게시물에서 확정되지 않았다.
원문 트윗 2개 보기

📈 Claude가 다른 AI의 얼라인먼트를 수행하는 실험포스트 3

Anthropic은 Claude가 더 작은 모델의 alignment 방법을 연구하고 직접 학습·테스트하는 실험을 공개했다. 후속 실험에서는 Sonnet 5가 초기 Opus 4.8 체크포인트를 post-train해 생산 모델에 가까운 safety score를 얻었다.

세부 내용 보기
  • Anthropic은 Claude에 48시간과 GPU 1개를 제공하고 작은 모델의 alignment를 개선하도록 했다. Claude는 방법을 연구하고 제안한 뒤 모델을 직접 학습·테스트했으며, 게시물은 결과가 효과적이었다고 전했다.
  • 별도 실험에서는 Sonnet 5가 더 강한 후속 모델인 초기 Opus 4.8 체크포인트를 post-train했다. 이 과정은 사람이 전체 alignment training을 수행하는 대신 한 모델이 다음 모델의 안전 학습 일부를 맡는 구조로 진행됐다.
  • 초기 Opus 4.8 체크포인트는 production Opus 4.8에 가까운 safety score에 도달했다. Anthropic은 자동화된 alignment 연구 환경도 공개했지만, subtle하거나 드문 실패는 측정할 benchmark 자체가 없을 수 있어 무엇을 측정하는지가 핵심이라고 밝혔다.
원문 트윗 2개 보기

📈 Gemini의 실제 과학 연구와 도시 침수 탐지포스트 4

Gemini 기반 Co-Scientist가 재료과학·생물학·컴퓨터과학에서 가설과 실험을 연결하는 방향으로 확장됐다. 별도 연구에서는 vision-language models가 대규모 거리 장면 데이터에서 기존 방식이 놓친 뉴욕 침수 지역을 찾았다.

세부 내용 보기
  • Co-Scientist 확장은 과학자와 협업하며 가설 생성, 실험 설계, 실험실 하드웨어 상호작용, 실행 결과 피드백 반영, 논문 작성까지 이어지는 흐름으로 소개됐다. 기존 시뮬레이션 중심 사용에서 실제 실험 장비와 실행 피드백을 포함하는 구조로 범위가 넓어졌다.
  • Gemini를 활용한 연구 시스템은 재료과학·생물학·컴퓨터과학의 과학자들과 협업하도록 설계됐다. 게시물은 연구 아이디어를 생성한 뒤 실험을 수행하고 결과를 다시 반영하는 순환 구조를 핵심으로 전했다.
  • Nature Communications 논문 관련 게시물은 vision-language models가 대규모 street scene dataset에서 침수를 탐지해 도시 침수 지도를 작성한다고 전했다. 뉴욕시에서는 현재 방법이 놓친 침수 지역을 식별했으며, 해당 지역에는 10만 명이 거주한다고 밝혔다.
  • 두 흐름 모두 모델의 답변 생성만으로 끝나지 않고 이미지 데이터나 실제 실험 결과를 입력으로 되돌려 다음 판단에 반영한다는 공통점이 있다. 다만 Co-Scientist의 완전 자동화 범위는 게시물의 논문 소개에 기반한 주장으로 제시됐다.
원문 트윗 2개 보기

Gemini Omni 1.1 Flash의 영상 생성·편집 기능 확장포스트 3

Google은 Gemini Omni 1.1 Flash를 영상 생성과 편집의 제어성·반복 속도·제작 완성도 개선을 목표로 배포했다. Gemini 3.5 Transcribe, Gemini 앱의 Live 기능, Gmail 관리와 Expert Intelligence도 같은 주간 업데이트로 묶였다.

세부 내용 보기
  • Gemini Omni 1.1 Flash는 영상 생성과 편집에서 더 세밀한 제어와 빠른 반복 작업을 목표로 공개됐다. Google DeepMind는 FlowbyGoogle에서 사용하도록 안내했고, Runway도 해당 모델을 자사 서비스에 추가했다고 전했다.
  • Google의 주간 출시 목록에는 Gemini 3.5 Transcribe와 Gemini 앱의 Live 경험이 함께 포함됐다. Gemini 3.5 Transcribe는 speech-to-text 모델로 소개됐고, Live는 Daily Brief, Gemini Spark, Personal Intelligence, Gmail inbox management 같은 기능을 포함했다.
  • Expert Intelligence는 신뢰할 수 있는 출처의 통찰을 결합하는 Google 내부 연계 기능으로 소개됐으며, 시작점으로 대상 Google Play 전자책이 언급됐다. 여러 기능이 텍스트 대화뿐 아니라 영상 제작, 음성 변환, 개인 정보 관리로 확장되는 제품 구성을 이뤘다.
원문 트윗 2개 보기

📈 MCP와 Deep Agents를 중심으로 한 에이전트 개발 스택포스트 6

LangChain은 FastMCP 기반의 새 MCP 사양 지원을 예고했고, Deep Agents는 모델 공급자 선택과 복잡한 작업의 실행 인프라를 분리하는 사례로 소개됐다. DeepSeek harness와 LangSmith 사례는 플러그인 구조와 실행 추적을 각각 부각했다.

세부 내용 보기
  • LangChain 오픈소스에는 새 MCP 사양 지원이 추가되고 있으며, 초기 API는 FastMCP 위에 구축됐다. langchain==1.4.0a2에서 초기 버전을 사용할 수 있어 MCP 서버와 클라이언트를 만드는 개발 경험을 기존 도구 위에 연결하는 방식이다.
  • Box가 Deep Agents를 선택한 이유로는 특정 LLM 공급자에 종속되지 않는 구조와 open agent harness를 통한 빠른 반복이 제시됐다. 공통 에이전트 인프라를 직접 만드는 시간을 줄이고 기업별 문제 해결에 집중하는 흐름이다.
  • LangSmith 사례에서는 PodiumHQ 에이전트가 겉보기에는 고장 난 것처럼 보였지만, 입력된 context를 기준으로는 합리적으로 행동한 것으로 추적됐다. end-to-end reasoning trace가 에이전트의 실패 원인을 출력 결과가 아닌 실행 맥락에서 확인하게 했다.
  • DeepSeek harness는 모든 기능을 plugin으로 구성하고 커스터마이즈하는 구조로 소개됐으며 GitHub star 202K가 언급됐다. MCP·harness·trace가 각각 연결, 실행, 관찰 계층을 맡으면서 에이전트 개발 스택이 분리되는 양상이다.
원문 트윗 2개 보기

📈 에이전트 제품의 세션 지속과 실시간 정보 연결포스트 6

Claude Code 데스크톱 앱은 CLI에서 시작한 터미널 세션을 대화 맥락과 함께 재개하도록 바뀌었다. Perplexity 검색을 연결한 Decagon과 Grok Bot 사례는 에이전트가 최신 웹 정보, 이메일, 고객지원, 코드 저장소를 작업 흐름에 직접 편입하는 방향을 보여줬다.

세부 내용 보기
  • Claude Code 데스크톱 앱에서는 /resume 명령으로 CLI에서 시작한 터미널 세션을 불러올 수 있다. 기존 대화와 context를 유지한 채 앱에서 작업을 이어가므로 터미널과 데스크톱 사이의 작업 단절을 줄이는 구현이다.
  • Decagon 에이전트는 대화 중 Perplexity의 live web search를 호출해 시간에 따라 바뀌는 정보를 검색하고 출처를 붙여 답변한다. Delta Airlines, Ticketmaster, Deutsche Telekom, American Airlines의 고객지원에 사용된다고 게시물에서 전했다.
  • Grok Bot 사례에서는 이메일을 연결해 긴급 항목을 선별하고, Intercom과 GitHub를 연결해 UI 변경이나 새 기능 배포 뒤 help center 문서를 자동으로 갱신하는 흐름이 소개됐다. 다른 사례에서는 코드와 인증 흐름을 읽고 50개 사이트를 분류해 도메인 소유자를 찾았다고 전했다.
  • Andrew Ng의 AI Engineering Skills map은 agentic coding에서 소프트웨어 공학 기본기가 latency, reliability, cost의 절충을 좌우한다는 문제의식과 연결된다. 에이전트가 더 많은 외부 시스템을 호출할수록 세션 상태, 최신 정보, 실행 품질을 함께 관리해야 하는 구조다.
원문 트윗 2개 보기

정적 임베딩의 처리량과 검색 정확도 절충포스트 2

LlamaIndex는 static embeddings가 높은 처리량을 제공하지만 전통적인 embedding models보다 정확도가 낮을 수 있다는 문제를 다뤘다. per-token maxsim, adapter 학습, distillation target과 teacher 변경을 시험했지만 원하는 결과에는 도달하지 못했다.

세부 내용 보기
  • 정적 임베딩은 처리량을 높이는 대신 retrieval 정확도 손실을 감수하는 구조로 제시됐다. LlamaIndex는 이 절충을 줄이기 위해 per-token embeddings에 raw maxsim scoring을 적용하고 검색 점수 계산 방식을 바꿨다.
  • 추가 실험에서는 작은 adapter model을 학습하고 distillation training의 target과 teacher를 변경했다. 입력 임베딩을 그대로 사용하는 방식, 보정 모델을 거치는 방식, 교사 모델의 지식을 옮기는 방식을 비교한 셈이다.
  • 게시물은 시도한 방법들이 기대한 결과를 내지 못했다고 밝혔다. 따라서 현재 논점은 단순히 가장 빠른 임베딩을 선택하는 데 있지 않고, 높은 throughput을 유지하면서 retrieval 품질을 회복할 수 있는 scoring과 학습 목표를 찾는 데 있다.
원문 트윗 2개 보기

📈 AI가 엣지·가속기·양자 시스템으로 내려가는 실행 계층포스트 3

Gemma 4 E2B는 8GB NVIDIA Jetson Orin Nano에서 이미지·음성 입력과 function calling을 처리하는 엣지 구성을 보였다. 별도 게시물에서는 AI가 가속기 설계 전 과정을 생성하고, NVIDIA가 GPU와 양자 프로세서를 연결하는 실행 플랫폼을 구축하는 흐름이 이어졌다.

세부 내용 보기
  • Gemma 4 E2B는 8GB NVIDIA Jetson Orin Nano에서 완전히 로컬로 실행되며 native image/audio input과 function calling을 사용한다. 이 구성은 vision, voice interaction, camera control을 8GB memory footprint 안에서 처리하는 엣지 사용 사례다.
  • Redwood 가속기 연구에서는 두 명의 인간 설계자가 hardware specification을 작성한 뒤 AI 시스템이 performance model, RTL, UVM verification environment, formal proofs, firmware, kernels를 2주 이내에 생성했다고 주장했다. 각 block은 commercial EDA tools, proprietary formal engine, hardware-in-the-loop validation으로 95% coverage에 도달했다고 전했다.
  • 해당 연구는 Samsung 8nm에 투영한 Redwood가 측정된 Jetson Orin Nano보다 1.75배 높은 throughput과 1.9배 낮은 power를 제공해 performance per watt 3.4배를 기록한다고 제시했다. FPGA 버전은 multi-billion-parameter Llama와 Qwen 모델을 실행하며 specification 변경 뒤 48시간 안에 재검증·재배포한다고 밝혔다.
  • NVIDIA는 CUDA-Q로 주요 physical quantum processor에 같은 코드를 배포하고, NVQLink로 양자 프로세서와 GPU를 연결해 microsecond QPU-GPU latency의 실시간 error correction을 구현한다고 전했다. NVIDIA Ising은 logical error rate를 300배 이상 줄이고 qubit calibration 시간을 며칠에서 몇 시간으로 단축하는 모델군으로 소개됐다.
원문 트윗 2개 보기

용어 해설

오픈 웨이트(Open-weight)
모델 가중치를 외부에 공개해 사용자가 직접 다운로드하고 실행하거나 수정할 수 있는 배포 방식입니다. GLM-5.3은 agentic coding과 cyber defense 용도로 가중치를 공개했습니다.
에이전틱 코딩(Agentic Coding)
AI 에이전트가 코드를 작성하는 데 그치지 않고 터미널, 도구, 테스트 환경을 사용해 여러 단계를 수행하는 방식입니다. 모델 성능뿐 아니라 지연시간과 비용을 함께 고려해야 합니다.
비전-언어 모델(Vision-Language Model)
이미지와 텍스트를 함께 처리하는 모델입니다. 도시 거리 장면 이미지에서 침수 여부를 판별하고 위치 정보를 추출하는 데 활용됐습니다.
정적 임베딩(Static Embeddings)
토큰별 벡터를 고정된 방식으로 생성해 높은 처리량을 확보하는 임베딩 방식입니다. 전통적인 임베딩 모델보다 검색 정확도가 낮아질 수 있어 scoring과 distillation 개선이 시도됐습니다.
MCP
AI 에이전트와 외부 도구 또는 서버를 연결하기 위한 프로토콜입니다. LangChain은 FastMCP 기반 API를 활용한 새 MCP 사양 지원을 추가하고 있습니다.
제번스 역설(Jevons Paradox)
기술이 자원 사용 효율을 높여도 전체 자원 소비량은 오히려 증가할 수 있다는 경제 현상입니다. OpenRouter에서는 모델 가격 인하 뒤 토큰 사용량이 13.8배 증가한 사례와 함께 언급됐습니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 29.수집 2026. 08. 29.출처 타입 TWITTER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.