TL;DR
이번 기간에는 Claude Code와 Claude의 주간 사용 한도 조정, 에이전트 실행을 기준으로 한 AI 인프라 평가, MiniMax H3 Max의 실시간 영상 생성이 핵심 흐름으로 묶였습니다. AgentX는 Vera Rubin NVL72가 GB300 NVL72보다 전력당 처리량에서 최대 30배 높다고 측정했고, MCP 사양만으로 에이전트 테스트 시나리오를 만드는 연구도 나왔습니다. 장기 작업 에이전트에서는 기억 관리가 병목으로 확인됐으며, Deep RNN 사례는 은닉 상태가 순차 정보의 유일한 저장 공간이 되어 긴 입력에서 gradient가 폭발하거나 소실되는 원리를 계산으로 재현했습니다. 이와 함께 Hy4-preview의 vLLM 초기 지원, 개인 장비 기반 모델 실행, 무릎 MRI 이상 소견 예측용 notebook이 실무형 기술 사례로 등장했습니다.
𝕏 실시간 트렌드 토픽
🔥 Claude Code 주간 한도 조정포스트 5
ClaudeDevs가 Pro, Max, Team, seat-based Enterprise 요금제의 표준 주간 한도를 9월 14일부터 25% 영구 인상한다고 공지했습니다. Claude Code는 현재 대비 주간 한도가 17% 줄어드는 계산도 함께 안내됐습니다.
세부 내용 보기
- ClaudeDevs는 지속 가능한 서비스 제공량을 조정하는 과정에서 Claude와 Claude Code의 사용 한도를 함께 바꾸고 있습니다. 9월 13일까지는 기존 50% 증가분을 유지한 뒤 9월 14일부터 표준 주간 한도를 새 기준으로 전환하는 방식입니다.
- Pro, Max, Team, seat-based Enterprise 사용자는 표준 주간 한도가 25% 영구 인상되지만, Claude Code에 대해서는 현재 기준으로 17% 감소하는 계산이 제시됐습니다. 서비스 측은 사용량 가시성과 통제력을 높이는 변경도 준비 중이라고 밝혔습니다.
- 같은 공지 흐름에서 ClaudeDevs는 이용자에게 주말 동안 무엇을 만들지 물으며 변경된 한도 안에서 실제 제작 작업을 이어가도록 유도했습니다. 따라서 이번 변화의 핵심은 단순한 숫자 조정보다 요금제별 처리량과 사용량 관리 방식의 재설정입니다.
원문 트윗 2개 보기

ClaudeDevs
Starting Sept 14, we're permanently raising standard weekly limits by 25% for Pro, Max, Team, and seat-based Enterprise plans. Until then, the current 50% increase will stay in place until Sept 13.

ClaudeDevs
Compared to today, this works out to a 17% reduction in weekly limits on Claude Code. We’re working on exciting changes that will make it feel like you’re getting more from Claude, while having more visibility and control of your usage. Can’t wait to share them.
📈 AgentX 기준 AI 인프라 전력당 처리량포스트 2
NVIDIA가 SemiAnalysis의 AgentX 워크로드로 에이전트 실행 성능을 측정한 결과 Vera Rubin NVL72가 GB300 NVL72보다 전력당 처리량에서 최대 30배 높다고 밝혔습니다. 측정 기준을 일반 추론 속도에서 실제 agent 실행으로 옮긴 점이 핵심입니다.
세부 내용 보기
- AI 인프라 성능을 모델의 단일 추론 속도만으로 재면 에이전트가 반복적으로 도구를 호출하고 상태를 전환하는 실제 실행 비용을 놓칠 수 있습니다. SemiAnalysis가 만든 AgentX는 에이전트가 실제로 작동하는 조건을 측정하도록 설계된 워크로드입니다.
- NVIDIA는 AgentX에서 Vera Rubin NVL72와 GB300 NVL72를 비교하고 전력 단위 처리량을 계산했습니다. 그 결과 Vera Rubin NVL72의 처리량이 GB300 NVL72보다 최대 30배 높게 측정됐다고 밝혔습니다.
- 이 비교는 데이터센터의 가속기 선택 기준을 단순한 토큰 생성량에서 에이전트 작업 완료량과 전력 효율로 넓힙니다. 다만 게시물에 제시된 수치는 NVIDIA가 측정한 AgentX 워크로드 결과라는 조건을 가집니다.
🔥 MiniMax H3 Max의 시청 속도 초과 영상 생성포스트 5
MiniMax H3 Max가 시청 속도보다 빠르게 영상을 생성한다는 사례가 Twitch 생방송과 결합됐습니다. 게시물에는 5초 영상이 3초 이내에 렌더링된다는 수치와 24시간 HORSE 생성 이벤트가 함께 등장했습니다.
세부 내용 보기
- 기존 영상 생성은 15초 분량을 만드는 데 2~5분이 걸렸다는 비교가 제시됐지만, MiniMax H3 Max는 생성 속도가 재생 속도를 앞서는 사례로 소개됐습니다. Rehan Sheikh는 생성 결과를 Twitch 라이브스트림에 연결해 영상이 끊임없이 이어지는 구조를 만들었습니다.
- MiniMax H3 Max가 5초 클립을 3초 이내에 렌더링한다는 수치가 공유됐고, 이를 바탕으로 24시간 시청 가능한 AI 영상 스트림이 구성됐습니다. MiniMax_AI는 이 조건을 Twitch 스트리밍 속도와 비교하는 새로운 benchmark로 표현했습니다.
- RenLeanna와 MiniMax_AI는 같은 사례를 무한 애니메이션 방송과 새로운 경험의 가능성으로 연결했습니다. 생성 결과가 소비되는 속도보다 빨리 쌓이면 영상 모델의 평가는 품질뿐 아니라 실시간 스트림을 계속 채울 수 있는 처리 속도까지 포함하게 됩니다.
원문 트윗 2개 보기

MiniMax (official)
@rehan_shei may have just invented the best benchmark yet: can it generate faster than Twitch can stream? Incredible to see @fal pushing MiniMax H3 into entirely new experiences.
Minimax H3 Max has generates video faster than you can watch it so I hooked it to a twitch livestream! Now you can watch infinite interdimensional cable - link to the stream below
Md Ismail Šojal
MiniMax H3 Max renders a 5-second clip in under 3 seconds. You wired MiniMax H3 Max into a live stream so it never stops. You can now watch infinite AI television a 24/7 stream
📈 MCP 사양에서 에이전트 테스트를 만드는 방법포스트 2
Agent Seer는 단일 MCP 사양에서 예제, 실시간 도구 접근, 도메인별 추가 학습 없이 다중 턴 에이전트 테스트 시나리오를 합성합니다. WebMCP는 웹페이지가 이름과 타입 입력을 가진 동작을 직접 선언해 에이전트가 화면 추측을 덜 하도록 하는 방식으로 소개됐습니다.
세부 내용 보기
- 수작업 agent benchmark는 도메인 전문성이 많이 필요하고 도구 생태계가 커질수록 확장하기 어렵다는 문제가 있습니다. Agent Seer는 함수 이름, 자연어 설명, typed parameter schema에 담긴 의미를 읽어 등급을 매길 수 있는 시나리오와 synthetic tool output을 만든 뒤 mock-data 기반 대화로 확장합니다.
- Agent Seer는 7개 MCP specification에 적용됐고, 작은 규모와 중간 규모 사양에서는 도구 전체를 포함하는 결과를 얻었습니다. 도구 모음 크기보다 parameter schema 복잡도가 품질 변동을 더 잘 예측했으며, 가장 큰 실패 유형은 거친 이름 일치 지표로 포착하기 어려운 argument value 정확도였습니다.
- WebMCP는 에이전트가 화면을 이미지로 보고 버튼 모양을 추측하는 computer use, 익명 div를 해석하는 DOM 자동화와 달리 웹페이지가 명명된 동작과 설명, typed input을 제공합니다. 사용자의 agent를 유지하면서 별도 설정 없이 브라우저 세션 안에서 동작을 호출한다는 점이 게시물의 비교 기준입니다.
원문 트윗 2개 보기
elvis
Banger paper from Apple. If you build MCP servers, this can help you turn your specification into an evaluation suite. (bookmark it) It's actually a really neat idea that's easy to implement. And it showcases the awesomeness of MCP. Agent Seer starts from a single MCP spec and synthesizes multi-turn agent test scenarios with no examples, no live tool access, and no domain-specific tuning. Function names, natural-language descriptions and typed parameter schemas already carry enough semantics to generate graded scenarios with synthetic tool outputs, which then expand into mock-data-grounded dialogues. Hand-built agent benchmarks demand deep domain expertise, do not scale across tool ecosystems, and go stale as soon as an API changes. Generating them from the live spec keeps pace with the ecosystem instead. They ran it on seven MCP specifications spanning different domains and suite sizes, with complete tool coverage on small and medium specs. Parameter schema complexity predicts quality variation far better than tool-suite size does. And argument value accuracy is the dominant failure mode, a sub-dimension that coarse name-match tool-calling metrics cannot see at all. Paper: https:// arxiv.org/abs/2608.26133 Chat with Paper: https:// academy.dair.ai/papers/agent-s eer-synthesizing-scenarios-from-specification-understanding-2608.26133 …
Akshay
Agents reach websites in 6 ways. (Google and Microsoft are betting on the same one.) Ask an agent to buy something and watch it work. It screenshots the page, looks for something shaped like a button, clicks, and screenshots again to see what happened. You pay tokens every time it looks, and one redesign breaks the run. The site already knows what it can do. It has a search, a cart, a checkout, and none of that is written down anywhere a program can read. Here are the six, ordered from furthest from the interface to closest. 1) Raw API. Your script calls the backend with a key you manage. Precise and fast, though you had to find the endpoints yourself and the website never enters the picture. 2) Backend MCP server. The company describes its actions as named tools and your agent connects to them. Someone who understands the product wrote those definitions, so they name real actions instead of guessed ones. The interface is still skipped. 3) Computer use. The agent sees the live page as an image and clicks around it. Nothing to configure, but every look costs money and a layout change confuses it. 4) Browser automation over the DOM. The agent reads the page's underlying code instead of a picture of it. More reliable than pixels, except the tooling is generic, so the agent still infers meaning from anonymous divs and unlabeled buttons. 5) WebMCP, the one Chrome and Edge are building together. The page declares its own actions with names, plain-English descriptions, and typed inputs, and your agent calls them inside your live browser session. 6) The site's built-in assistant. The company ships a chat box, picks the model, and pays for the tokens. It works, and it is not your agent, so nothing it learns about you carries anywhere else. Three things vary across the six. Whose agent does the work, what you configure before anything happens, and what the agent receives when it arrives. Every option except one gives up at least one of the three. Raw API and backend MCP hand you typed actions and remove the website. Computer use asks for no setup and hands over pixels. The built-in assistant is precise and belongs to the vendor. WebMCP is the only one that keeps all three. Your own agent, nothing to configure, and named actions instead of guesswork. I wrote the full breakdown. The article is quoted below.
📈 장기 작업 에이전트의 기억 병목포스트 1
LLM agent를 축구 클럽의 20년 운영에 투입한 benchmark에서 모든 15개 frontier model이 전체 시간 범위를 통과했지만, 순위는 늦게 안정됐고 모델 규모·가격·token spend로 예측되지 않았습니다. 거부된 입찰에서 시장의 숨은 가격을 배우지 못하고, 자체 관리 memory가 보관함 또는 매 시즌 재작성 계획으로 무너지는 두 가지 공통 실패가 확인됐습니다.
세부 내용 보기
- 장기 작업에서는 에이전트가 수백 번의 의사결정 사이에 과거 관찰과 계획을 유지해야 하므로 memory와 recall이 핵심 병목이 됩니다. 연구진은 에이전트가 26개 도구와 약 340~400개의 decision stop을 거치며 축구 클럽을 20 in-game years 동안 운영하도록 구성하고 deterministic engine으로 점수화했습니다.
- 15개 frontier model은 모든 horizon을 통과했지만 모델 규모, 가격, vendor, token spend 어느 것도 최종 순위를 예측하지 못했고 순서는 실행 후반에야 안정됐습니다. 상위 모델을 가른 행동은 장기 수익이 늦게 나는 투자를 마지막 구간에 줄이고 계약 갱신을 마감일보다 훨씬 일찍 여는 관리 방식이었습니다.
- 모든 모델에서 거부된 입찰 수백 건으로 시장의 숨은 가격을 학습하지 못하는 문제와 self-managed memory가 계속 커지는 archive 또는 매 시즌 다시 쓰는 plan으로 붕괴하는 문제가 나타났습니다. 장기 에이전트의 성능은 단순한 모델 크기보다 기억을 저장하고 회수하며 갱신하는 운영 구조에 달려 있다는 결과입니다.
➖ Deep RNN 은닉 상태와 긴 시퀀스 기억포스트 1
Deep RNN이 네 개 입력을 세 개의 recurrent hidden layer로 순차 처리하는 과정을 손계산으로 재현했습니다. 은닉 상태가 다음 입력에 전달되는 유일한 기억이므로 긴 시퀀스에서는 정보가 희석되고 backpropagation through time의 gradient가 폭발하거나 사라집니다.
세부 내용 보기
- Deep RNN은 입력 X1부터 X4까지를 한 단계씩 읽으며 hidden layer a, b, c의 상태를 다음 단계로 넘깁니다. 초기 상태 a0, b0, c0를 0으로 놓고 입력과 이전 상태, bias를 쌓아 변환한 뒤 각 단계의 출력층 값을 계산하는 흐름입니다.
- 첫 입력에서는 a1 = [0, 1], b1 = [1, -1], c1 = [1, 1], Y1 = [3, 0, 3]이 나왔고, 이후 출력은 Y2 = [5, 0, 4], Y3 = [13, -1, 9], Y4 = [15, 7, 2]였습니다. 각 단계는 세 hidden layer 계산, output 계산, 상태 전달 순서로 반복됩니다.
- X1의 정보는 여러 hop을 거쳐 출력에 도달해야 하며 각 hop에서 gradient가 곱해집니다. 곱셈값이 1보다 조금 크면 gradient가 폭발하고 조금 작으면 사라지므로 긴 sequence에서 초기 정보가 잊히는 이유와 backpropagation through time의 불안정성이 같은 계산 경로에서 드러납니다.
📈 Hy4-preview의 vLLM 초기 추론 지원포스트 1
Hy4-preview가 공개 첫날부터 vLLM에서 실행되고 NVIDIA GPU에서 검증됐다는 소식이 나왔습니다. 770B total, 49B active, 256 routed experts와 1M context를 사용하면서 각 query는 2048 tokens에만 attend하는 구조가 제시됐습니다.
세부 내용 보기
- 대규모 모델을 실제 서비스에 올리려면 모델 구조와 추론 엔진이 빠르게 맞물려야 합니다. Hy4-preview는 vLLM에서 day 0부터 실행됐고 NVIDIA GPU에서 검증됐다는 점으로 배포 초기 호환성을 확보한 사례로 언급됐습니다.
- 모델은 770B total과 49B active 규모이며 256 routed experts와 one shared expert를 사용합니다. 1M context를 지원하지만 각 query가 attend하는 토큰은 2048개이고, 78개 layer 중 21개만 sparse index를 자체 계산하며 나머지 57개는 이를 재사용합니다.
- 전체 파라미터 규모와 실제 활성 계산량, 긴 context 처리 범위를 분리해 제시한 구조는 모델을 실행할 때 메모리와 계산 비용을 함께 봐야 한다는 점을 드러냅니다. 게시물에서 확인된 실행 환경은 vLLM과 NVIDIA GPU입니다.
➖ 개인 장비 기반 로컬 모델 실행포스트 3
Qwen3.8-27B-Uncensored와 Ling 3.0 Flash를 개인 장비에서 실행한 사례가 공유됐습니다. 9년 된 650달러 V100이 2025 Strix Halo보다 Qwen3.8-27B decode에서 빠르고, 124B 모델이 단일 DGX Spark에서 40 tok/s로 시작했다는 수치가 제시됐습니다.
세부 내용 보기
- 로컬 추론에서는 모델의 전체 크기보다 실제 decode 속도와 장비 가격 대비 성능이 중요한 비교 기준이 됩니다. 한 사례에서 9년 된 650달러 V100이 2025 Strix Halo보다 Qwen3.8-27B generation에서 빠른 결과를 냈고 속도는 56 tokens/sec였습니다.
- Qwen3.8-27B-Uncensored는 image + text 입력, 1M+ downloads, FastMTP를 통한 최대 3x faster generation과 함께 소개됐습니다. 별도 사례에서는 124B Ling 3.0 Flash가 단일 DGX Spark에서 실행됐고 decode가 40 tok/s로 시작했습니다.
- 이 수치들은 최신 소비자 장비만이 로컬 모델 실행의 기준이라는 가정을 약화시키지만, 게시물마다 모델과 하드웨어, 측정 조건이 다릅니다. 따라서 비교의 핵심은 특정 장비의 절대 우열보다 모델 크기와 decode 최적화가 실제 비용·속도에 미치는 영향입니다.
원문 트윗 2개 보기
Md Ismail Šojal
You can run locally Qwen3.8-27B-Uncensored for cyber use it doesn’t refuse - it already 1M+ downloads. - Image + text. - Feed it a photo Get a direct answer. - Zero-filter replies. - FastMTP for up to 3x faster generation. If you want raw multimodal output locally, this is the one. - http:// huggingface.co/HauhauCS/Qwen3 .8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF …
Md Ismail Šojal
The old card is faster on Qwen3.8-27B generation. A 9-year-old $650 eBay V100 just outperforming a 2025 Strix Halo on Qwen3.8-27B decode. - 56 tokens/sec. Price-to-performance is wild right now.
➖ 무릎 MRI 이상 소견 예측 notebook포스트 1
Kaggle이 무릎 MRI 해석용 starter notebook을 공유했습니다. DICOM 획득 데이터를 읽고 MRI slice를 샘플링·정규화한 뒤 pretrained vision backbone을 12개 이상 소견 예측기로 전환하는 순서입니다.
세부 내용 보기
- 무릎 MRI 모델 구축의 시작점은 장비가 만든 DICOM acquisition을 읽고 여러 slice를 모델 입력으로 정리하는 전처리입니다. notebook은 slice sampling과 normalization을 거쳐 영상 데이터를 일관된 형태로 바꾸는 과정을 포함합니다.
- 전처리한 MRI slice를 pretrained vision backbone에 입력하고, backbone을 12개 abnormality prediction 출력으로 연결합니다. 입력은 의료영상이고 출력은 무릎 MRI에서 탐지할 12개 이상 소견의 예측값입니다.
- 이 notebook은 의료영상 데이터를 읽는 단계와 사전 학습 vision backbone을 다중 예측 모델로 전환하는 단계를 한 흐름에 배치한 starter material입니다. 게시물에서 확인되는 범위는 구축 절차이며 실제 임상 성능 수치는 제시되지 않았습니다.
용어 해설
- AgentX 에이전트 성능 평가(AgentX)
- — AI 에이전트가 실제로 도구를 호출하고 여러 단계를 수행하는 상황을 기준으로 인프라 처리량을 측정하는 평가 워크로드입니다. 단순한 모델 추론 속도보다 에이전트 실행 패턴과 전력당 처리량을 함께 비교하는 데 쓰입니다.
- WebMCP
- — 웹페이지가 자신의 기능을 이름, 자연어 설명, 타입이 지정된 입력값과 함께 선언하고 에이전트가 브라우저 안에서 직접 호출하도록 하는 방식입니다. 화면의 픽셀이나 익명 DOM 요소를 추측하는 절차를 줄이는 데 목적이 있습니다.
- 장기 작업 에이전트(Long-horizon Agent)
- — 수백 번의 의사결정과 긴 시간 범위를 거치며 계획, 도구 사용, 기억 관리를 이어가는 에이전트입니다. 짧은 질의응답과 달리 과거 관찰을 저장하고 필요한 시점에 회수하는 능력이 성능을 좌우합니다.
- 희소 혼합 전문가 모델(Sparse Mixture of Experts)
- — 전체 전문가 층을 매번 계산하지 않고 입력마다 일부 전문가만 라우팅해 활성 계산량을 줄이는 구조입니다. Hy4-preview는 256개 라우팅 전문가와 하나의 공유 전문가를 사용하며, 쿼리마다 2048개 토큰에만 어텐션을 적용합니다.
- 의료영상 표준 형식(DICOM)
- — MRI 같은 의료영상 장비의 획득 정보와 영상 데이터를 저장하는 표준 형식입니다. 무릎 MRI 모델 구축에서는 DICOM 획득 데이터를 읽고 슬라이스를 샘플링·정규화한 뒤 vision backbone 입력으로 변환하는 단계가 필요합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.