본문으로 건너뛰기
X (Twitter)조회 1

Grok Bot 확산, Gemini 기능 확장, GLM-5.3 로컬화, 에이전트 실행 비용 절감

공유 가능한 Bot과 생활형 Gemini, 로컬 GLM-5.3, 확장형 추론 계층

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이번 기간에는 Grok Bot의 템플릿 공유와 결제 연동, Gemini의 학습·차량·영상 기능, GLM-5.3의 오픈 웨이트 배포가 사용자 작업 범위를 넓혔다. GLM-5.3은 모델 파일을 1.51TB에서 239GB로 줄여 256GB Mac에서 실행하는 사례가 나왔고, Perplexity Computer와 로컬 환경으로 배포 경로가 갈라졌다. 추론 계층에서는 NVIDIA Dynamo가 vLLM·SGLang·TensorRT-LLM 주변에서 GPU와 노드 확장을 맡고 FastH3가 768p 영상 15초를 13초에 생성하는 실행 최적화를 내세웠다. Claude Code 2.1.251과 Appshots는 권한 검사·세션 제어·화면 맥락 전달을 보강했으며, 에이전트 운영에서는 월 3억 회 이상 평가와 비용 90~95% 절감 사례가 함께 제시됐다.

𝕏 실시간 트렌드 토픽

🔥 Grok Bot 템플릿 공유와 결제 연동포스트 4

Grok Bot을 다른 사람과 공유할 수 있는 템플릿 기능과 @link를 통한 구매 기능이 함께 확장됐다. Grok 4.6도 Grok.com과 iOS·Android에 배포됐다.

세부 내용 보기
  • 기존에는 Bot을 개인별로 구성해야 했지만, 새 기능은 Bot 설정을 템플릿으로 저장해 다른 사용자가 자신의 Bot으로 복제하는 흐름을 만든다. @elonmusk의 게시물은 템플릿 공유를 알렸고, @minchoi는 Sales Bot·Research Bot·Chief of Staff 같은 활용 예를 열거했다.
  • @link 연동은 Grok Bot이 구매 과정에 관여하도록 결제 서비스를 연결하는 방식이다. 원문은 Grok Bot이 어디서나 구매할 수 있다고 전했으며, 같은 기간 Grok 4.6은 복잡한 문제·에이전트형 질의·앱 구축 용도로 Grok.com, iOS, Android에 제공됐다.
원문 트윗 2개 보기

Gemini의 학습·차량·영상 기능 확장포스트 4

Gemini 앱에 학생용 허브와 학습 노트북, Gemini 3.7 Flash, Waymo 차량 연동, Omni 1.1 Flash 영상 확장이 추가됐다. 앱 안에서 학습과 이동 중 음성 조작, 연속 영상 제작을 한 흐름으로 묶는 방향이다.

세부 내용 보기
  • 학생 사용자는 1년 학생 요금제와 새 학생 허브를 이용하고, 대화형 학습 노트북으로 맞춤 수업을 구성한다. Gemini 3.7 Flash는 Gemini chat과 Gemini Spark에 제공되며, 여러 앱 연결과 Gemini Live의 에이전트형 기능도 함께 언급됐다.
  • Waymo 차량에서는 화면의 Gemini 아이콘을 누르고 음성으로 차량 실내를 제어하거나 주변 정보를 묻는다. Gemini는 Waymo Driver와 독립적으로 작동하고 사용자가 선택할 때까지 비활성 상태로 유지된다고 원문이 설명했다.
  • Omni 1.1 Flash는 Gemini에서 만든 영상의 마지막 장면부터 이어서 영상을 생성한다. 기존 클립의 끝에서 다음 장면을 연결해 연속적인 스토리라인을 만드는 처리 방식이다.
원문 트윗 2개 보기

📈 GLM-5.3 오픈 웨이트와 로컬 실행포스트 3

GLM-5.3이 Perplexity Computer와 오픈 웨이트 배포 경로에 등장했고, 압축된 모델을 256GB Mac에서 실행하는 사례가 공유됐다. 배포·상업 이용·Fine-tuning·로컬 추론이 하나의 모델 공개 소식에 결합됐다.

세부 내용 보기
  • GLM-5.3은 Perplexity Computer에서 긴 컨텍스트·멀티모달 에이전트 작업용으로 제공됐고 WANDR 벤치마크에서 GLM 5.2보다 높은 결과를 냈다고 전해졌다. 별도 게시물은 Hugging Face 다운로드와 Atomic Agent 실행을 오픈 웨이트의 경로로 제시했다.
  • Unsloth를 거친 로컬 배포 사례에서는 모델 크기가 1.51TB에서 239GB로 줄고 81% 정확도를 유지했으며, 압축률은 83%로 제시됐다. 이 변환으로 753B 코딩 모델을 256GB Mac에서 실행하는 구성이 가능해졌다는 설명이다.
  • GLM-5.3 License 아래 다운로드·로컬 배포·Fine-tuning·상업적 이용이 가능하다고 전해졌고, 공개 전 2주 동안 사이버보안 능력에 대한 추가 안전 평가를 진행했다는 내용도 포함됐다.
원문 트윗 2개 보기

Claude Code 2.1.251의 권한·세션 제어 강화포스트 2

Claude Code 2.1.251은 모델 전환 훅, symlink 경로 차단, 하위 에이전트 제어, 비용·캐시 표시를 추가했다. 대규모 변경 목록의 중심에는 파일 접근과 명령 실행을 세션 권한 안에 묶는 안전장치가 있다.

세부 내용 보기
  • 이번 버전은 PreModelSwitch와 PostModelSwitch 훅으로 모델 변경을 차단·확인·기록할 수 있게 하고, SessionStart resume 훅에 세션 오래됨과 예상 재캐시 비용을 전달한다. foreground subagent의 도구 호출과 결과도 Remote Control 클라이언트에 실시간으로 스트리밍한다.
  • Read·Write·Edit가 작업 디렉터리 밖으로 빠져나가는 교체된 symlink를 차단하고, Grep·Glob에도 Read 거부 규칙을 적용한다. 플러그인 경로 순회, Workflow의 외부 scriptPath, 샌드박스 출력 파일 교체와 같은 경로·권한 문제도 차단 대상으로 들어갔다.
  • /usage에는 지출 한도 막대가, /cost에는 세션별 prompt-cache 적중률·누락·재캐시 토큰이 추가됐다. 병렬 subagent의 UI 재렌더링을 줄이고 설치 바이너리도 약 5MB 작게 만든 변경이 함께 포함됐다.
원문 트윗 1개 보기

📈 Appshots와 Codex의 화면 맥락 작업포스트 4

Appshots는 현재 화면의 앱 맥락을 ChatGPT Work와 Codex에 전달해 문서 요약, 양식 입력, API 기반 기능 추가, 여행 계획 같은 작업을 수행하게 한다. ChatGPT Work에는 파일과 링크를 바탕으로 재사용 가능한 템플릿 흐름도 더해졌다.

세부 내용 보기
  • Appshots는 사용자가 보고 있는 앱의 화면과 관련 맥락을 ChatGPT Work와 Codex에 넘긴 뒤, 요청에 맞는 작업으로 변환한다. Slack 스레드 요약, 폼 입력, API 참고자료를 이용한 기능 추가, X 답글의 주제 추출, 대시보드 후속 문안 작성 등이 입력에서 결과로 이어지는 사례다.
  • 문서·스프레드시트·프레젠테이션·PDF·폴더와 Google Docs·Sheets·Slides 링크를 ChatGPT Work에 넣으면 Template Creator가 예시 한 건을 바탕으로 템플릿을 만든다. 이후 저장된 템플릿을 호출하고 새 정보를 추가하는 방식으로 반복 작업을 이어간다.
  • Codex 데스크톱 앱에는 사용자 작업과 프로젝트를 사이드바 섹션으로 나누는 기능이 추가됐고, Codex에 사이드바 정리를 요청할 수도 있다. /visualize가 three.js를 처리한다는 사례도 함께 공유됐다.
원문 트윗 2개 보기

📈 NVIDIA Dynamo와 오픈 영상 추론 스택포스트 6

NVIDIA Dynamo가 vLLM·SGLang·TensorRT-LLM을 둘러싼 분산 추론 계층으로 소개됐고, FastH3는 오픈 가중치 영상 생성 가속 사례를 만들었다. 모델 실행기는 단일 GPU 호출을 넘어 여러 GPU와 노드의 확장 구조로 이동하고 있다.

세부 내용 보기
  • NVIDIA Dynamo는 이미 사용 중인 inference engine 위에 배치돼 GPU와 노드 전반의 추론 확장을 담당하는 구성으로 설명됐다. NVIDIA의 자료는 vLLM, SGLang, TensorRT-LLM과 Dynamo의 관계를 5분 분량으로 정리한다.
  • FastH3 v1은 FastVideo·FastGen과의 협업으로 15초 768p 영상을 13초에 생성하고, NVIDIA Blackwell GPU에서 최대 14배 speedup을 냈다고 전해졌다. 가속 레시피를 완전히 공개해 커뮤니티가 실행하고 개선할 수 있게 한 점이 핵심이다.
  • vLLM은 FastH3를 vLLM-Omni에 연결하기 위해 FastVideo 팀과 협력하고 있으며, PyTorch Conference 게시물은 vLLM의 목표를 “the easiest to use and most efficient inference engine”으로 인용했다. PyTorch·DeepSpeed·Ray·Helion·Safetensors가 같은 오픈소스 AI 스택 행사에 함께 언급됐다.
원문 트윗 2개 보기

에이전트 평가 규모와 운영 비용 절감포스트 2

LangChain이 Clay의 월 3억 회 이상 에이전트 실행 평가와 운영·평가 연결 방식을 전했고, Unify는 출시 전 2주 동안 에이전트 비용을 90~95% 줄인 사례를 공유했다. 대규모 실행에서는 기능 추가보다 평가 루프와 계산량 통제가 운영 조건으로 부상했다.

세부 내용 보기
  • Clay는 에이전트 실행을 네 가지 영역으로 나눠 평가하고, 데이터 레이크와 긴 컨텍스트를 이용해 운영 데이터가 평가로 되돌아가는 흐름을 구축했다. 월 3억 회가 넘는 실행 규모에서 production-to-eval loop를 닫는 일이 가장 어려운 과제로 제시됐다.
  • Unify의 에이전트는 출시 2주 전 한 메시지가 고객 예산을 모두 소진할 만큼 많은 compute를 사용했다. 이후 비용을 90~95% 낮추는 최적화를 진행했다는 사례가 공유됐으며, 세부 구현은 원문에 제시되지 않았다.
원문 트윗 2개 보기

AI 시스템의 오작동·접근 통제 안전장치포스트 2

자동화 시스템이 10개 misaligned behavior 벤치마크 모두에서 성능을 높였다는 결과와, Meta AI glasses의 녹화 표시등 우회 문제를 막는 firmware update가 함께 공유됐다. 모델 평가와 실제 기기 접근 통제가 서로 다른 층위에서 안전성을 보강하는 사례다.

세부 내용 보기
  • 10개 misaligned behavior에 맞춘 벤치마크에서 자동화 시스템이 전체 성능 저하 없이 모든 항목의 결과를 개선했다고 전해졌다. 어떤 시스템과 개선 수치를 사용했는지는 원문에 명시되지 않았다.
  • Meta의 firmware update는 capture LED를 가린 상태에서 녹화를 시작하고 표시등을 숨기던 우회 경로를 차단한다. 회사는 LED 조작 서비스를 판매하던 일부 사업자가 중단했고, 주변 사람이 표시등의 의미를 알도록 billboard 캠페인을 진행한다고 밝혔다.
원문 트윗 2개 보기

용어 해설

에이전트형 질의(Agentic Query)
모델이 단순히 답변만 생성하지 않고 사용자의 목표를 여러 단계로 나눠 도구 호출이나 외부 서비스 연동까지 수행하는 질의 방식이다. Grok 4.6은 복잡한 문제와 에이전트형 질의를 처리하는 용도로 배포됐다.
오픈 웨이트 모델(Open-Weight Model)
학습된 모델 가중치를 외부에 공개해 다운로드, 로컬 실행, 추가 학습에 활용할 수 있게 한 모델이다. GLM-5.3은 Hugging Face 배포와 상업적 이용이 언급됐다.
모델 양자화(Model Quantization)
모델의 수치 표현이나 저장 방식을 줄여 파일 크기와 실행 메모리를 낮추는 최적화 방식이다. GLM-5.3은 1.51TB에서 239GB로 축소됐다는 수치와 함께 Mac 실행 사례가 제시됐다.
추론 엔진(Inference Engine)
학습된 모델에 입력을 전달하고 출력을 생성하는 실행 소프트웨어다. NVIDIA Dynamo는 vLLM, SGLang, TensorRT-LLM 같은 엔진 주변에서 GPU와 노드 규모의 추론 확장을 맡는 구조로 설명됐다.
프롬프트 캐시(Prompt Cache)
반복되는 프롬프트 일부를 저장해 다음 요청에서 재계산을 줄이는 처리 방식이다. Claude Code 2.1.251은 세션별 적중률, 누락, 재캐시 토큰을 비용 화면에 표시한다.
Model Context Protocol
모델과 외부 도구 또는 서버를 연결하기 위한 규격이다. LangChain은 FastMCP 기반의 새 API를 이용해 MCP 서버와 클라이언트를 구축하는 초기 지원을 추가했다.
에이전트 평가(Agent Evaluation)
에이전트의 작업 수행 결과를 반복 실행과 평가 기준으로 측정하는 과정이다. Clay 사례에서는 월 3억 회가 넘는 실행을 네 가지 영역으로 나눠 평가하고 운영 데이터와 평가 흐름을 연결했다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 29.수집 2026. 08. 29.출처 타입 TWITTER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.