TL;DR
이번 기간에는 Grok @Bot이 다른 모델과 CLI를 조정해 팟캐스트 요약과 스마트홈 제어를 수행하는 Agent 작업 흐름이 확산됐다. GPT-5.6 Sol은 가격 인하와 추론 상태 유지·압축으로 비용과 출력 토큰을 줄였고, Cursor는 GitHub 저장소·PR·Agent·배포를 묶은 Origin을 출시했다. Qwen3.8-27B와 Laguna S 2.1은 로컬 실행과 낮은 활성 파라미터를 앞세웠으며, Computer Use·Agent skill·MCP 같은 운영 계층도 빠르게 세분화됐다. 동시에 River API의 강화학습 실행, Grok Imagine·MiniMax H3의 영상 제작, 스마트폰 사진 기반 임상 연구처럼 모델을 실제 처리 과정에 연결하는 사례가 이어졌다.
𝕏 실시간 트렌드 토픽
🔥 Grok @Bot의 다중 도구 조정과 제작 자동화포스트 4
Grok @Bot을 다른 CLI와 연결해 요약·스마트홈 제어·영상 제작을 맡기는 사례가 모였다. 빠른 결과 생성과 함께 작업 중단 시 경고·failover가 부족하다는 운영상의 마찰도 드러났다.
- Grok @Bot은 단순 질의 도구를 넘어 여러 모델과 CLI를 조정하는 Coordinator로 쓰이고 있다. 사용자는 팟캐스트 요약기 제작을 약 15초 만에 끝냈다고 했고, 다른 사례에서는 Matic과 Nest를 한 지붕 아래 연결해 취침 한 시간 전 실내 온도를 78F로 낮추는 루틴을 만들었다. 작업 생성 속도와 외부 기기 연결이 Agent의 실사용 범위를 넓히는 방식이다.
- Grok이 제시한 제작 흐름은 장면 작성, 대사 고정, 쇼트 분할, Grok Imagine에 음성·영상·이미지 생성을 맡긴 뒤 편집하는 순서다. 반면 Coordinator로 GPT·Claude·Cursor CLI를 연결한 사용자는 사용 한도에 도달하면 모든 작업이 경고 없이 멈춘다고 했으며, 저가 모델로 자동 전환하는 failover를 요구했다. 실행 기능이 늘수록 결과 품질뿐 아니라 중단 처리와 자원 배분이 중요해진다.
Grok @Bot은 짧은 지시만으로 요약기 제작, 스마트홈 루틴, 여러 CLI 조정까지 연결해 개인 AI 사용량과 자동화 범위를 크게 넓힌다는 평가다.
사용 한도에 도달했을 때 경고 없이 전체 작업이 멈추는 동작은 Coordinator 용도에 적합하지 않으며, 저가 모델 failover가 필요하다는 지적이다.
원문 트윗 2개 보기

Elon Musk
@elonmusk
Grok @Bot
I think @bot is another “Claude Code” moment for AI. I would estimate my personal AI usage is up something like 100x. And for everyone who reached out about how to build a “podcast summarizer” it took me about 15 seconds in Grok Bot and is better than what I had before.
Emad
@EMostaque
Hit the @grok @bot limit after solid use testing things Using it as a coordinator (gave it my gpt/claude/cursor clis) it feels oddly frustrating versus running out of code model usage I think it’s because everything halts & no warning - should failover to cheap model
🔥 GPT-5.6 가격 인하와 추론 효율 경쟁포스트 5
GPT-5.6 Sol의 API 가격이 여러 경로에서 절반으로 낮아지고, retained reasoning·compaction과 programmatic tool calling을 통한 비용 절감 사례가 함께 제시됐다. 가격뿐 아니라 동일 품질을 더 적은 토큰과 더 낮은 입력 비용으로 내는 구조가 경쟁 축으로 부상했다.
- Vercel AI Gateway와 OpenRouter가 GPT-5.6 Sol 가격을 50% 낮췄고, OpenRouter의 flex tier는 입력 $1.25, 출력 $7.50까지 내려갔다. 할인은 2026년 9월 18일까지 적용되며 standard·fast mode와 batch·priority 계층도 포함된다. 같은 모델을 어떤 호출 경로에서 쓰느냐가 실제 사용 비용을 좌우하는 구조다.
- OpenAI 사례에서 GPT-5.6 Sol은 retained reasoning과 compaction을 적용해 ARC-AGI-3 점수를 13.3%에서 38.3%로 높이면서 출력 토큰을 약 6배 적게 사용했다. 문서 추출에서는 GPT-5.6 Luna가 GPT-5.5 정확도의 98%를 1/18 비용으로 유지했고, 금융 연구에서는 programmatic tool calling이 평가 품질을 유지하며 입력 토큰을 21% 줄였다. 모델 선택·추론 유지·도구 호출 방식을 함께 조정하는 접근이 비용 절감의 핵심이다.
원문 트윗 2개 보기

Vercel Developers
@vercel_dev
GPT 5.6 Sol is 50% off on AI Gateway. • Through September 18, 2026 • Applies to both standard and fast mode '𝚘𝚙𝚎𝚗𝚊𝚒/𝚐𝚙𝚝-𝟻.𝟼-𝚜𝚘𝚕'

OpenAI Developers
@OpenAIDevs
With retained reasoning and compaction, GPT-5.6 Sol improved from 13.3% to 38.3% on ARC-AGI-3 while using roughly 6x fewer output tokens.
📈 Cursor Origin의 코드 호스팅 통합포스트 4
Cursor가 GitHub 저장소를 동기화하는 자체 코드 호스팅 플랫폼 Origin을 출시했다. 저장소 관리에서 PR 리뷰, Agent 실행, Vercel 배포까지 개발 흐름을 한 공간으로 묶으려는 제품 확장이다.
- Origin은 GitHub 저장소를 동기화해 코드 호스팅을 제공하고 Cursor와 깊게 연결된다. Cursor 관련 게시물은 Vercel·Buildkite·Depot 통합이 이미 제공되며 추가 연동이 이어진다고 전했다. 코드가 있는 저장소와 Agent가 실행되는 환경을 분리하지 않는 것이 제품 구조의 방향이다.
- Origin을 소개한 사용자는 저장소 호스팅, PR 리뷰, Agent 실행, Vercel 배포를 한곳에서 처리하는 흐름을 강조했다. 기존 GitHub 연동을 출발점으로 외부 개발 도구를 연결하고, Cursor의 Agent 작업을 코드 변경·검토·배포 단계까지 확장하는 방식이다.
원문 트윗 2개 보기

Cursor
@cursor_ai
Origin, our code hosting platform, is now live. It's fast, easy to use, and deeply integrated with Cursor. Get started by syncing your repos from GitHub.

Min Choi
@minchoi
Cursor just launched its own GitHub. Origin is here. Host repos. Review PRs. Run agents. Deploy with Vercel. Your code + agents now live in one place.
Origin, our code hosting platform, is now live. It's fast, easy to use, and deeply integrated with Cursor. Get started by syncing your repos from GitHub.
📈 Qwen3.8과 Laguna S 2.1의 로컬 모델 확장포스트 3
Qwen3.8-27B가 Artificial Analysis Agentic Index에서 여러 대형 모델과 맞먹는 성능으로 언급됐고, Laguna S 2.1은 118B 총 파라미터 중 8B만 활성화하는 구조와 무료 사용 기간을 내세웠다. 로컬 실행성과 활성 파라미터 효율이 모델 선택의 기준으로 떠올랐다.
- Qwen3.8-27B는 네이티브 멀티모달 dense 모델로 소개됐으며, 27B 파라미터와 262K 네이티브 컨텍스트를 갖고 코딩·오피스 작업을 겨냥한다. Artificial Analysis Agentic Index 관련 게시물은 이 모델이 GPT-5.6 Terra, GLM 5.2, DeepSeek V4 Pro, Claude Opus 4.8보다 높은 점수를 냈다고 전했으며, 다른 게시물은 로컬 모델이 frontier model 수준에 도달한 첫 사례로 평가했다.
- Laguna S 2.1은 총 118B 파라미터 중 8B를 활성화하는 모델로 소개됐고, Nous Portal에서 2주 동안 무료로 제공됐다. 총 규모를 유지하면서 입력마다 일부 파라미터만 실행하는 방식이 빠른 실행을 뒷받침한다. Qwen3.8의 로컬 성능과 Laguna S 2.1의 활성 파라미터 구조는 비용·하드웨어·성능을 함께 비교하는 선택지를 넓힌다.
Qwen3.8-27B가 Agentic Index에서 대형 모델과 맞먹는 점수를 내면서 로컬 실행 모델의 성능 격차가 빠르게 줄고 있다는 평가다.
원문 트윗 2개 보기
Md Ismail Šojal
@0x0SojalSec
Open-Source Ai is Win Qwen 3.8 max just outscored the giants. Higher than GPT-5.6 Terra, GLM 5.2, DeepSeek V4 Pro, and Claude Opus 4.8 on the Artificial Analysis Agentic Index. and you can run locally Claude opus at your home with One RTX 3090
We promised open weights for Qwen3.8. Now, time to meet them! Qwen3.8-27B: - A native multimodal dense model. With just 27B parameters, it outperforms Qwen3.7-Plus overall and shines in real-world coding & office workflows. - 262K native context, easily extendable to 1M
Cline
@cline
Artificial Analysis Intelligence Index puts Qwen3.8-27B at DeepSeek V4-Pro and GPT 5.6 Luna performance. This is the first time a local model has scored frontier model capability. We weren’t expecting this pace of local progress anywhere near this soon.
➖ Agent 운영 계층의 세분화포스트 7
Claude Managed Agents, Codex 다중 Agent 조정, Agent skill의 자동 triggering, Hermes Bot Mode와 ElevenLabs MCP가 한 흐름으로 묶였다. Agent의 능력 자체보다 역할·메모리·도구·호출 조건·운영 화면을 분리하는 설계가 실제 배포의 핵심으로 이동했다.
- ABC Legal은 50개가 넘는 Claude Managed Agents를 법률 업무에 배치해 특정 작업 비용을 최대 50% 줄였고, 피드백 루프로 지속 개선하도록 구성했다. Codex를 여러 Agent와 조정하는 방법과 Computer Use를 통해 API 밖의 증거 수집에서 스크린샷을 확보하는 사례도 같은 방향이다. 업무를 작은 Agent 단위로 나누고 결과 피드백을 다시 운영 흐름에 넣는 방식이다.
- Agent skill이 시스템 프롬프트의 100개 미만 reliable trigger slot을 두고 56,804개 공개 skill과 경쟁한다는 문제가 제기됐다. 제안된 구조는 설치에 묶여 있던 content·persistence·automatic triggering을 분리하고, 경로를 읽어 필요한 skill만 불러오며, vendoring으로 팀 소유 사본을 만드는 방식이다. Hermes Bot Mode의 개별 역할·모델·메모리·skill·외부 연결과 ElevenLabs MCP의 성능 조회·설정 변경·비용 추정도 Agent 운영을 독립 구성요소로 나누는 사례다.
원문 트윗 2개 보기

ClaudeDevs
@ClaudeDevs
In a new blog post, we share how one customer, ABC Legal, deployed Claude Managed Agents. The fleet of 50+ agents have cut costs by up to 50% for certain legal tasks. The agents also use a feedback loop to improve continuously over time. Read more: https:// claude.com/blog/how-abc-l egal-turned-every-employee-into-a-builder-with-claude-managed-agents …
elvis
@omarsar0
Recommended paper for agent skill builders. There are 56,804 public agent skills today, all competing for fewer than 100 reliable trigger slots in the system prompt. Your own playbooks compete for that same space, and the long tail never gets used. skills separates the three things installation bundles together. Content, persistence, and automatic triggering. Only triggering needs to sit in the prompt. A path addresses any skill, subtree, or collection, and reading it is enough to use it. A directory becomes a menu, so bundles stop being all-or-nothing. Vendoring copies a skill into your Git tree at the same path, so your team owns and adapts it. No manifest, no lockfile, no registration, and SKILL.md is unchanged. Paper: https:// arxiv.org/abs/2608.12610 Track more trending AI papers in our academy: https:// academy.dair.ai
➖ River API와 정책 일치형 강화학습 실행포스트 2
River API가 동일한 학습 코드로 Tinker보다 강화학습 실행에서 높은 성능을 냈다는 사례가 공유됐다. routing replay와 train-infer mismatch를 조정해 대규모 MoE 모델의 학습 결과를 실제 추론 정책과 가깝게 유지하는 접근이다.
- River API 비교는 동일한 training code를 사용해 Tinker와 강화학습 실행 결과를 견줬고, routing replay 같은 세부 구현에 많은 작업을 투입했다고 전했다. 학습 코드가 같아도 라우팅 재현과 실행 환경이 다르면 결과가 달라질 수 있어 API 내부의 재현 조건이 성능 차이를 만든다.
- 대규모 MoE를 train-infer mismatch 없이 강화학습할 수 있고, Qwen3.6-35B-A3B에 Wordle 플레이를 학습시킨 과제가 사례로 제시됐다. CoreWeave와 NVIDIA의 논의에서도 빠른 rollout, on-policy 학습, 소형 모델의 경쟁력이 함께 언급됐다. 학습 중 사용한 정책과 추론 시 정책의 차이를 줄이는 것이 성능 개선의 기반이다.
원문 트윗 2개 보기

Igor Babuschkin
@ibab
The River API was tested in this blog post and outperformed Tinker on reinforcement learning runs with identical training code. We spent a lot of effort to get details like routing replay right so you get the best possible results with the API.
We can now RL large MoEs with 0 train-infer mismatch! And doing so can improve performance (pictured task: teach Qwen3.6-35B-A3B to play Wordle). Everything is open-source and we did a bunch of ablations.
CoreWeave
@CoreWeave
Our Serverless RL team spent a day at @nvidia comparing notes: Faster rollouts, training that stays on policy, small models that hold their own. CoreWeave NVIDIA
➖ Grok Imagine과 MiniMax H3의 영상 제작 파이프라인포스트 3
Grok Imagine은 대사·음성·영상·이미지를 한 제작 흐름에 연결하고, MiniMax H3는 캐릭터 움직임별 짧은 클립을 게임 스프라이트로 변환하는 작업에 쓰였다. 생성 모델의 경쟁이 단일 결과물에서 장면 분할·포즈 추출·편집을 포함한 파이프라인으로 확장됐다.
- Grok Imagine 공모전은 3~5분 영상, 최소 1분 대화, 영어 대사, Grok Imagine을 이용한 영상·이미지·캐릭터 음성을 요구했다. 제작 보조 흐름에서는 Grok @Bot이 장면과 대사를 정리하고 쇼트로 나눈 뒤 Imagine에 생성을 맡긴다. 입력 기획과 생성 도구를 분리해 긴 영상 제작 절차를 단계화하는 방식이다.
- MiniMax H3는 걷는 캐릭터의 움직임을 이해하는 영상 생성 모델로 소개됐고, 게임 스프라이트 작업에서는 캐릭터 디자인 한 장과 동작별 5초 클립을 만든 뒤 포즈 극단을 잘라 마젠타 배경을 제거하는 절차가 쓰였다. 이미지 모델의 보행 동작 일관성 한계와 달리 영상 모델의 시간적 움직임을 활용해 프레임 자산으로 변환한다는 점이 핵심이다.
원문 트윗 2개 보기

Grok
@grok
Homer had a lyre. You have Grok Imagine. Create a compelling scene from Homer’s The Odyssey that shows what Grok @Imagine ’s video and voice capabilities can do. We’re awarding $100K, $50K, and $25K to the top three videos submitted by quoting this post.
MiniMax (official)
@MiniMax_AI
This is super cool! Sota video generation models like our MiniMax H3 understand the movement of a walking character so well, while some people report that latest image generation model still struggles to keep walking motion consistent. MiniMax H3 is here for your game sprites creation.
Cool MiniMax-H3 use case unlocked for game sprites creation, here's the workflow: 1. one character design still, on a flat magenta background 2. one 5s H3 clip per move (walk, jump, punch, kick, block...) 3. cut each clip down to its pose extremes 4. key out the magenta, pack
➖ AI 기반 고래 음향 감지와 체성분 추정포스트 2
AI가 수중 음향을 대규모로 듣고 고래를 실시간 식별해 선박에 알리는 보전 사례와, 스마트폰 사진에서 체성분을 추정해 인슐린 저항성을 예측하는 임상 연구가 공유됐다. 이미지·음향 입력을 실제 감시와 의료 측정 절차에 연결하는 활용이다.
- Salish Sea에 남은 남부 상주 범고래가 약 75마리라는 맥락에서, AI가 수중 소리를 대규모로 처리해 고래를 실시간 식별하고 주변 선박에 경고하는 시스템이 소개됐다. 입력은 물속 소리이고 출력은 종 식별과 선박 경고이며, 선박이 감속하고 항로를 조정하도록 연결해 보전 활동의 관측 범위를 넓힌다.
- Google Research는 스마트폰 사진으로 체성분을 추정하고 인슐린 저항성을 예측하는 deep learning 접근을 임상 연구 환경에서 시험했다. 결과 정확도는 DXA scan과 comparable하다고 전해졌다. 값비싼 전용 측정 장비 대신 사진 입력에서 체성분 관련 신호를 추정하는 처리 흐름이 연구 대상으로 제시됐다.
원문 트윗 2개 보기
Microsoft
@Microsoft
There are only ~75 southern resident orcas left in the Salish Sea, and hidden in the sounds beneath the water is information that could help protect them. Now, AI is helping conservationists listen at scale, identifying whales in real time and alerting mariners when they're nearby so they can slow down and steer clear. https:// msft.it/6000aK5gY

Google Research
@GoogleResearch
Today on the blog, we demonstrate the feasibility of a deep learning approach estimating body composition from smartphone photos, to predict insulin resistance with accuracy comparable to DXA scans in a clinical research setting. Read more → https:// goo.gle/4xIGxHj
용어 해설
- 에이전트 오케스트레이션(Agent Orchestration)
- — 여러 Agent의 역할과 작업 순서를 조정하는 방식이다. Coordinator가 요청을 분해하고 각 Agent나 도구에 배분한 뒤 결과를 취합해 하나의 작업 흐름으로 연결하는 구조가 핵심이다.
- 컴퓨터 사용(Computer Use)
- — Agent가 API 호출만으로 처리하기 어려운 화면 기반 작업을 수행하는 방식이다. 화면을 읽고 마우스·키보드 입력을 실행해 스크린샷 수집이나 웹 조작 같은 절차를 자동화한다.
- 프로그래밍 방식 도구 호출(Programmatic Tool Calling)
- — 모델이 도구를 한 번씩 호출하는 대신 코드 실행을 통해 여러 도구와 데이터를 처리하는 방식이다. 금융 문서 검색처럼 반복적인 조회와 계산이 필요한 작업의 입력 토큰을 줄이는 데 쓰인다.
- 강화학습(Reinforcement Learning)
- — 모델이 환경의 상태와 행동 결과에서 얻은 보상을 바탕으로 정책을 개선하는 학습 방식이다. 이번 자료에서는 대규모 MoE 모델의 학습·추론 불일치를 줄이는 API 실행이 핵심으로 등장한다.
- Mixture of Experts
- — 전체 파라미터를 모두 활성화하지 않고 입력마다 일부 Expert만 선택하는 모델 구조다. Laguna S 2.1과 대규모 MoE 강화학습 사례에서는 총 파라미터와 실제 활성 파라미터를 분리해 효율을 높인다.
- 네이티브 멀티모달 모델(Native Multimodal Model)
- — 텍스트뿐 아니라 이미지 등 여러 입력 형식을 하나의 모델 구조에서 처리하는 모델이다. Qwen3.8-27B는 262K 네이티브 컨텍스트와 함께 코딩·오피스 작업 성능을 내세운다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.