TL;DR
이번 기간 X에서는 Grok Build의 워크플로 기능 도입과 Tavily 플러그인 통합으로 대규모 에이전트 병렬화와 LLM 최적화 웹 검색 연결이 부각됐다. Grok은 워크플로로 100+ 이슈 처리, 수천 줄 코드 리뷰를 기획하고 최대 1,024 에이전트를 병렬 실행하는 스테이지형 플랜을 제시했다. Claude 쪽은 '줌 툴'을 통해 모델이 관심 영역을 원본에서 다시 크롭해 재처리하도록 함으로써 Chartography에서 Fable 5 정확도를 29%→73%, Sonnet 5를 13%→44%로 끌어올렸다. ActiveVision 벤치마크는 단계적 시각 관찰을 요구해 GPT-5.5 10.6%, Claude Fable 5 3.5%, 인간 96.1%의 격차를 드러냈고, 결과는 단순 입력 토큰 확대가 아닌 인지-추론 루프의 구조적 개선 필요성을 시사한다.
𝕏 실시간 트렌드 토픽
🔥 Grok Build: 워크플로·대규모 에이전트 실행포스트 5
Grok Build는 복잡한 작업을 여러 에이전트로 분산해 처리하는 워크플로를 도입했고, 플랜을 단계별로 실행해 최대 1,024개 에이전트를 병렬 운영하는 구조를 제시했다. 저장된 워크플로는 슬래시 커맨드로 전환되어 팀 저장소와 공유되고, 각 단계에 독립적인 검증자(skeptics)를 두어 결과를 합산해 단일 보고서를 반환한다. Tavily 플러그인 연동으로 LLM 최적화 웹 검색을 워크플로에 실시간으로 주입할 수 있다.
- 워크플로는 Triage·검토 같은 대량 작업을 계획·병렬 실행·통합 보고하는 파이프라인을 구성한다.
- 각 실행은 단계별로 나뉘며 독립적인 skeptical 에이전트들이 결과를 검증해 신뢰도를 높인다.
- 저장된 워크플로는 슬래시 커맨드로 호출 가능하며, 레포지토리에 저장된 워크플로는 팀 공유가 가능하다.
- Tavily 플러그인은 실시간 LLM-최적화 웹 검색을 제공해 워크플로의 외부 정보 취득을 개선한다.
워크플로·에이전트 병렬화는 대량 이슈 처리와 코드 리뷰 같은 반복 작업의 처리량을 늘리며, 저장된 워크플로의 슬래시 커맨드화는 재현성과 팀 협업을 개선한다.
에이전트 수를 1,024까지 늘리는 계획은 처리량을 극대화하나, 단계별 검증과 리스크 관리가 부족하면 잘못된 자동화 결과가 증폭될 위험이 있다.
원문 트윗 2개 보기

Grok
@grok
Workflows are now in Grok Build. Hand Grok a task a single conversation can't hold: Triage 100+ issues, or review thousands of lines of code in detail. Build plans the work, runs up to hundreds of agents in parallel, and comes back with one report.
SpaceXAI
@SpaceXAI
Try the Tavily plugin for LLM-driven search inside Grok Build
Tavily is now live as an official plugin in @grok Build. Bring real-time, LLM-optimized web search into your Grok Build workflows. You'll get fast results, clean content, and reliable sources built for AI applications. Type /plugin, search for Tavily, and start building.
📈 Claude의 줌 툴과 Chartography 성능 개선포스트 2
ClaudeDevs는 대형 이미지가 축소될 때 잃어버린 디테일을 보완하는 '줌 툴' 쿡북을 공개했고, 모델이 관심 영역을 요청해 원본에서 해당 크롭을 받아 재처리하는 방식이 핵심이다. 이 방식을 Chartography 벤치마크에 적용해 Fable 5 정확도가 29%에서 73%로, Sonnet 5는 13%에서 44%로 향상했다. 쿡북은 언제·어떤 크롭 전략을 쓰는지가 성능에 결정적임을 제시한다.
- 줌 툴은 모델이 관심 영역을 식별하면 서버가 고해상도 크롭을 전달해 세부 정보를 보존한다.
- Chartography에서 Fable 5는 정확도 29%→73%, Sonnet 5는 13%→44%의 개선을 기록했다.
- 다운스케일로 인한 정보 손실을 보완하므로 차트나 작은 라벨을 읽는 작업에서 특히 효과적이다.
줌 툴은 다운스케일 과정에서 손실된 시각적 디테일을 원본 크롭으로 복구해 멀티모달 모델의 실제 이해도를 크게 높였다.
성능 개선 폭이 크지만, 줌 툴 도입은 추가 네트워크/IO 비용과 시스템 설계 복잡도를 수반하므로 적용 대상과 비용-이득 평가가 필요하다.
원문 트윗 2개 보기
@ClaudeDevs
We've updated our "zoom tool" cookbook. When large images get downscaled, important detail can be lost. A zoom tool lets Claude request a region and get that crop back from the full-res original.
@ClaudeDevs
On the Chartography benchmark (100 questions over dense real-world charts), Fable 5's accuracy goes from 29% to 73% with a zoom tool, and Sonnet 5’s from 13% to 44%. See the cookbook to learn more:
➖ ChatGPT Voice 데스크톱과 GPT-Live 기반 실시간 제어포스트 1
ChatGPT Voice가 데스크톱 앱으로 확장되어 GPT-Live를 기반으로 음성 입출력과 에이전트 제어를 동시에 수행한다. 음성으로 컴퓨터를 제어하고 ChatGPT Work·Codex에서 다중 에이전트를 동시 조정하는 워크플로가 가능해졌고, 글로벌 롤아웃이 진행 중이다. 실시간 음성 제어는 인간-컴퓨터 상호작용 흐름을 바꾸며 에이전트 조정의 대기 시간을 줄인다.
- GPT-Live는 음성 합성·음성 인식·에이전트 조정을 실시간으로 결합해 동시 작업을 지원한다.
- 데스크톱 앱은 로컬 작업 제어와 다중 에이전트 조정(동시 듣기·말하기)을 통합한다.
- 출시 문구는 전세계 롤아웃을 명시해 점진적 배포가 이뤄지고 있음을 시사한다.
음성 기반 실시간 제어는 복잡한 작업에서 대화형 오케스트레이션을 단축시키고 사용자 편의성을 높인다.
실시간 음성 에이전트 조정은 대역폭·지연·보안 측면의 추가 제약을 불러올 수 있어 도입 환경별 검증이 필요하다.
📈 ActiveVision 벤치마크가 드러낸 관찰 기반 멀티모달 한계포스트 1
ActiveVision은 모델이 장면을 여러 단계로 스캔·추적·비교해 관찰 기반 질문에 답해야 하는 평가 과제다. 공개된 수치에서 GPT-5.5는 10.6%, Claude Fable 5는 3.5%를 기록한 반면 인간은 96.1%를 기록해 큰 격차가 확인됐다. 코딩 에이전트들도 24.7–50.6% 범위를 보여 시각적 도구가 잘못되었을 때 이를 감지·교정하는 능력에 한계가 존재한다.
- ActiveVision은 단일 정적 응답이 아니라 모델의 단계적 관찰과 비교 능력을 요구해 실세계 시각 작업에 더 가까운 난이도를 제공한다.
- 보고된 결과는 멀티모달 모델이 '보는 능력'보다 '능동적 관찰·검증 루프'가 부족함을 시사한다.
- 코딩 에이전트의 성능(24.7–50.6%)도 인간 대비 크게 낮아 시각 도구 신뢰성 문제와 통합 추론의 필요성이 드러났다.
수치상 모델들은 단계적 관찰 과제에서 인간과 큰 격차를 보였고, 이는 단순한 모델 크기·토큰 증가로 해결되지 않는 구조적 문제를 나타낸다.
벤치마크 결과는 특정 실험 세팅과 데이터에 기반하므로, 일반화하려면 더 다양한 평가와 재현성 검증이 필요하다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
