본문으로 건너뛰기
X (Twitter)조회 3

Claude Code 안정화, 영상 모델 benchmark 경쟁, 실행형 AI 인프라

CLI 안정화부터 영상 편집 1위와 GPU 네트워크까지 이어진 실행 인프라 경쟁

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이번 기간에는 Claude Code가 제한 실행, 세션 간 메시징, 프롬프트 캐시 안정성을 묶은 CLI 업데이트를 내놓으며 에이전트 운용의 통제와 지속성을 보강했다. 영상 모델에서는 H3 Max가 post-training과 추론 스택 공동 설계로 prompt adherence, 시각 품질, 속도를 함께 겨냥했고, Wan3.0은 Video Edit Arena에서 1414 ps로 1위에 올랐다. vLLM은 모델과 workload에 맞춰 speculative decoding 방식을 선택해야 한다는 benchmark를 공개했으며, NVIDIA Mesh는 유휴 GPU를 연결하는 개방형 연산 네트워크를 내세웠다. GLM-5.3 Flash는 로보틱스 object detection과 ErdosBench 결과로, QwenWork와 Hermes는 조직 업무를 직접 실행하는 에이전트 구조로 확장됐다.

𝕏 실시간 트렌드 토픽

🔥 Claude Code 2.1.248·2.1.250의 제한 실행과 세션 안정화포스트 6

Claude Code 2.1.248과 2.1.250 업데이트가 외부 실행 제한, 세션 간 메시징, 장시간 대화의 prompt-cache 오류 수정에 초점을 맞췄다.

세부 내용 보기
  • Claude Code 2.1.248은 코드·명령 실행 도구와 WebFetch를 제한하는 `--restricted`를 추가하고, 작업 디렉터리 밖의 파일 도구 사용과 `bypassPermissions` 우회를 막는 구조를 채택했다.
  • Bedrock·Vertex·Foundry에서 telemetry가 꺼진 상태에도 같은 머신의 세션 사이에 `SendMessage`와 `ListAgents`를 사용할 수 있게 했으며, 2.1.250은 CLI bug fixes와 reliability improvements를 묶었다.
  • 장시간 세션에서 OAuth token refresh 뒤 tool definition이 다시 렌더링되며 prompt-cache가 대략 한 시간마다 누락되고 extended-thinking context가 사라지던 경로를 수정해 대화 연속성을 보존했다.
  • 2.1.248의 전체 변경 목록에는 MCP 인증·OAuth 재시도, worktree 잠금, 원격 세션 permission prompt, 민감 파일 업로드 방지, Workflow tool prompt footprint 축소가 포함됐다.
원문 트윗 2개 보기

📈 H3 Max의 post-training·추론 스택 공동 설계포스트 2

H3 Max가 MiniMax H3를 기반으로 post-training과 inference stack을 함께 설계해 prompt adherence, visual quality, speed를 동시에 겨냥했다.

세부 내용 보기
  • fal은 MiniMax H3를 post-training해 prompt adherence와 visual quality를 높이고, 모델과 inference stack을 함께 설계하는 방식으로 속도 개선을 진행했다.
  • 속도를 높이는 과정에서 품질을 계속 테스트하고, 품질 향상을 유지한 최적화만 남기는 기준을 적용해 모델 변경과 serving 구조를 함께 조정했다.
  • NVIDIAAIInfra는 H3 Max가 NVIDIA GB200 NVL72에서 완전히 post-trained되고 served됐다고 전했으며, MiniMax_AI는 MiniMax H3가 이 작업의 기반이라고 밝혔다.
원문 트윗 2개 보기

📈 Wan3.0의 Video Edit Arena 1위포스트 2

Wan3.0이 Video Edit Arena에서 1414 ps로 1위를 차지하며 영상 편집 모델 benchmark 경쟁의 새 순위를 만들었다.

세부 내용 보기

vLLM speculative decoding과 유휴 GPU 네트워크포스트 3

vLLM은 여러 speculative decoding 방식의 성능이 모델·workload·speculation depth에 따라 달라진다고 benchmark했고, NVIDIA Mesh는 유휴 GPU를 하나의 개방형 AI 연산망으로 묶는 구상을 내놓았다.

세부 내용 보기
  • vLLM은 MTP, EAGLE-3, DFlash, DSpark를 포함한 5개 speculative decoding 방식의 작동법과 vLLM 설정·튜닝 방법을 비교해, 모든 환경에 통하는 단일 승자는 없다는 결론을 내렸다.
  • benchmark는 Gemma, Qwen, Kimi, MiniMax를 대상으로 NVIDIA가 아닌 AMD Instinct MI300X와 MI355X에서 수행됐으며, 모델·workload·추측 깊이에 따라 선택 기준이 달라졌다.
  • NVIDIA Mesh는 여러 위치의 유휴 NVIDIA GPU를 연결해 수천 대의 머신이 AI 작업을 함께 실행하도록 하고, GPU 제공자에게 기여 대가를 지급하는 네트워크로 설계됐다.
  • NVIDIAAIInfra는 AI factory를 compute와 networking부터 systems와 software까지 공동 설계하는 새로운 인프라 계층으로 설명했으며, PyTorch는 GPU·NPU·모델 구조·inference engine 간 조율의 필요성을 전했다.
원문 트윗 2개 보기

📈 GLM-5.3 Flash의 로보틱스·수학·코딩 benchmark포스트 4

GLM-5.3 Flash가 로보틱스 object detection에서 약 3 Hz로 실행되고, ErdosBench에서 2위를 기록했으며, GLM-5.3 open weights 공개 예고까지 이어졌다.

세부 내용 보기
  • Sentdex는 GLM 5.3 Flash가 로보틱스 object detection에 사용되며 vision을 약 3 Hz로 실행한다고 전했고, 속도와 별개로 지능적인 vision 성능을 평가했다.
  • GLM-5.3 Flash는 private research-math benchmark인 ErdosBench에서 GPT-5.6 Sol xhigh 다음 2위를 기록했고, 원문에는 research-level math problems와 226/226 coverage가 함께 적혔다.
  • 다른 게시물은 GLM-5.3 weights가 다음 날 공개될 예정이며, GLM-5.2와 같은 base에 large post-training lift를 더하고 internal benchmark에서 50% coding gain을 냈다고 전했다.
  • GLM-5.3 Flash와 GPT-5.6 Terra, Claude Opus 4.8, Gemini 3.7 Flash를 3D Rubik’s cube 자동 재생 과제로 비교한 사례에서는 GLM과 Gemini의 시각 결과가 강하게 평가됐다.
원문 트윗 2개 보기

QwenWork와 Hermes의 조직형 자율 에이전트포스트 3

QwenWork는 질문에 답하는 chatbot·copilot에서 업무를 끝까지 실행하는 autonomous agent로의 이동을 내세웠고, Hermes는 팀별 workflow에 맞춘 bespoke agent harness로 쓰였다.

세부 내용 보기
  • Alibaba Cloud는 QwenWork가 context 수집, 복잡한 추론, 조직 전체의 end-to-end workflow 실행을 묶어 AI가 답하는 단계에서 행동하는 단계로 이동한다고 설명했다.
  • QwenWork 사례는 반복 업무와 수동 조정을 부서 간 workflow 실행으로 바꾸고, 실시간으로 여러 부서의 작업을 처리하는 구조를 전제로 한다.
  • Artie 팀은 NousResearch의 Hermes를 하나의 shared agent로 고정하지 않고 각 팀의 일상 업무 방식에 맞춘 bespoke version으로 구성해 workflow 지원에 사용했다.
원문 트윗 2개 보기

Gemini Omni 1.1 Flash의 장면 확장포스트 1

Gemini Omni 1.1 Flash가 기존 영상의 마지막 장면에서 이어지는 장면 확장과 분기형 스토리 생성을 지원한다.

세부 내용 보기
  • GeminiApp은 사용자가 영상을 만들거나 업로드한 뒤 Gemini Omni 1.1 Flash에 요청하면 영상이 끝난 지점에서 다음 장면을 이어 만들 수 있다고 전했다.
  • 이 입력-생성 흐름은 같은 이야기의 긴 버전을 만들거나 기존 장면에서 새로운 creative direction으로 분기하는 데 쓰이며, 단일 영상 생성보다 연속 장면 편집에 초점을 둔다.
원문 트윗 1개 보기

Grok 4.6의 Microsoft Foundry 배치포스트 1

Grok 4.6이 Microsoft Foundry Models에서 조직용으로 제공되며, 모델 비교·workload별 테스트·관리형 endpoint·enterprise governance를 한 플랫폼 안에서 지원한다.

세부 내용 보기
  • 원문에 따르면 SpaceXAI의 Grok 4.6은 Microsoft Foundry Models에서 사용할 수 있게 됐고, 조직이 frontier AI model을 비교하는 진입점을 제공한다.
  • Microsoft Foundry에서는 workload-specific test를 실행한 뒤 managed endpoint로 배포하고, enterprise security와 governance controls를 함께 운영하는 흐름이 제시됐다.
원문 트윗 1개 보기

용어 해설

추측 디코딩(Speculative Decoding)
작은 초안 모델이 다음 토큰을 미리 추측하고, 대상 모델이 여러 토큰을 한 번에 검증해 순차 생성을 줄이는 추론 최적화 기법입니다. 모델과 작업량에 따라 효과가 달라집니다.
프롬프트 캐시(Prompt Cache)
반복 요청에서 동일한 프롬프트 전처리 결과를 저장해 재사용하는 방식입니다. Claude Code 2.1.248은 장시간 세션에서 캐시 누락으로 extended-thinking 문맥이 사라지던 문제를 수정했습니다.
사후 학습(Post-training)
기본 모델이 학습된 뒤 지시 따르기와 특정 작업 성능을 높이도록 추가 학습하는 단계입니다. H3 Max는 prompt adherence와 visual quality 개선을 위해 MiniMax H3에 post-training을 적용했습니다.
자율 에이전트(Autonomous Agent)
사용자 질문에 답하는 데 그치지 않고 맥락 수집, 복잡한 추론, 업무 실행을 연속적으로 수행하는 AI 시스템입니다. QwenWork는 부서 간 workflow 실행을 핵심 사례로 내세웠습니다.
Video Edit Arena
영상 편집 모델의 결과를 비교하는 평가 순위입니다. 원문에서는 Wan3.0이 1414 ps로 1위를 차지했고, dreamina-seedance-2.5보다 4점, MiniMax-H3보다 22점 앞섰습니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 28.수집 2026. 08. 28.출처 타입 TWITTER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.