TL;DR
이번 포스트 묶음에서는 한 번의 프롬프트로 인증·데이터베이스·공유·도메인을 갖춘 앱을 배포하는 Grok Build와, ChatGPT·Codex에서 협업·메시지 처리·읽기 전용 작업 공유를 묶는 기능이 두드러졌습니다. 에이전트는 브라우저 조작과 업무 위임을 넘어 여러 모델을 단계별로 선택하는 실행 계층으로 확장되고 있으며, Claude Managed Agents·AG-UI·NVIDIA NeMo Switchyard·LangChain 관련 도구가 그 흐름을 이룹니다. 평가 측면에서는 ARC-AGI 점수와 비용, WildArtifactBench의 승률·Elo, Adversarial Customer Service의 신원 도용 판별처럼 실제 과제에 가까운 기준이 부상했고, 에이전트 하네스의 변경으로 생기는 망각을 측정하고 통제하는 연구도 함께 등장했습니다. 무료 모델 접근과 기업 데이터 보존 정책, GPT-Image-2의 투명 배경 생성, MiniMax H3의 Runway·ComfyUI 연계는 모델 사용 조건과 제작 도구의 변화를 압축합니다.
𝕏 실시간 트렌드 토픽
🔥 Grok Build의 프롬프트 기반 앱 제작과 배포포스트 6
Grok Build가 SuperGrok과 X Premium 사용자를 대상으로 코딩 없이 앱을 만들고 게시하는 경로를 넓혔습니다. 인증·데이터베이스·비공개 공유·커스텀 도메인과 소스 내보내기가 한 제품 흐름에 결합됐습니다.
- Grok Build 관련 포스트는 아이디어를 한 번의 프롬프트로 앱으로 바꾸려는 흐름에서 출발하며, 별도 코딩 없이 제작·리믹스·프로토타이핑을 수행하고 게시 단계까지 연결하는 구조를 전제로 합니다. 입력은 자연어 아이디어이고, 처리 과정에서 앱 기능과 배포 설정을 구성한 뒤 결과물을 공개하거나 팀에만 공유하는 방식입니다.
- 기능 범위에는 full auth, database, private sharing, custom domains, SpaceXAI API use가 포함되며, Grok.me 또는 사용자가 보유한 도메인으로 게시하고 소스를 내보내 후속 개발을 이어갈 수 있습니다. 따라서 생성 결과를 일회성 시제품에 묶지 않고 접근 제어·데이터 저장·배포 주소까지 갖춘 제품 형태로 전환하는 경로가 핵심입니다.
- Grok 포스트는 SuperGrok과 X Premium 플랜에서 grok.com·iOS·Android 앱 제작과 게시가 가능하다고 밝혔고, 관련 사용자 포스트는 같은 기능을 무코드 제작과 커스텀 도메인 배포의 조합으로 재구성했습니다. 기능 접근 조건과 게시 방식이 명시되면서 자연어 제작 도구의 출력 단위가 코드 조각에서 공유 가능한 앱으로 이동했습니다.
원문 트윗 2개 보기

Grok
@grok
Building apps on https:// grok.com, iOS, and Android is now available on every SuperGrok and X Premium plan One prompt turns an idea into a published product with its own domain.

Andrew Milich
@milichab
Build apps with full auth, database, private sharing, custom domains, and SpaceXAI API use from any Grok app
Building apps on https:// grok.com, iOS, and Android is now available on every SuperGrok and X Premium plan One prompt turns an idea into a published product with its own domain.
📈 ChatGPT·Codex의 협업과 메시지 작업 연동포스트 6
ChatGPT Work와 Codex 데스크톱에 읽기 전용 대화 공유, 공동 편집, Apple Messages 연동이 추가됐습니다. 대화 맥락과 작업 과정을 다른 사람에게 전달하고 메시지 검색·답장 초안·캘린더 처리를 이어가는 사용 흐름입니다.
- ChatGPT Sites는 팀원을 editor로 추가해 같은 프로젝트를 공동 제작·게시하고, Codex가 뒤에서 git 관리와 CI를 처리하는 구조입니다. 사용자는 사이트와 게임을 함께 수정하고, 시스템은 변경 사항을 같은 프로젝트에 반영해 협업 결과물을 게시하는 방식으로 작동합니다.
- Apple Messages plugin은 Mac의 ChatGPT Work와 Codex 데스크톱에서 메시지 검색, 대화 요약, 답장 초안 작성·전송을 수행하며 캘린더 확인과 후속 조치 제안 같은 프롬프트도 지원합니다. 입력은 메시지와 일정 맥락이고, 출력은 검색 결과·답장·캘린더 작업으로 이어져 대화형 비서의 작업 범위를 넓힙니다.
- 공유 기능은 ChatGPT Work와 Codex 데스크톱 대화를 read-only 링크로 배포해 빌드 과정, pull request, 기술 검토, 프로젝트 인계의 맥락을 전달합니다. 원문 포스트는 이 링크가 작업 결과만이 아니라 과정과 reasoning을 함께 공유하는 수단이라고 설명해 협업 인계의 단위를 대화 기록으로 확장했습니다.
원문 트윗 2개 보기

ChatGPT
@ChatGPT
Everyday conversations just got easier with the new Apple Messages plugin. Search messages, catch up on conversations, draft and send replies—all with ChatGPT on your Mac. Now available in ChatGPT Work and Codex on desktop.

Tibo
@thsottiaux
Create a ChatGPT Site, share it and create something together. I've been building little games and sites with others and it is so much fun.
Add teammates as editors to your ChatGPT Sites so you can build and publish together. Collaborators can push changes to the same project while Codex handles git management and CI behind the scenes.
📈 브라우저 에이전트와 단계별 모델 라우팅포스트 6
Claude Managed Agents와 AG-UI, computer use·browser tool·Skills API·Files API, LangChain 기반 Stagehand 조합이 에이전트 실행 환경을 넓혔습니다. 작업 단계마다 모델을 선택하는 NVIDIA NeMo Switchyard까지 더해 UI·도구·모델을 연결하는 실행 계층이 형성됐습니다.
- Claude Platform의 computer use와 browser tool은 API가 없는 애플리케이션을 화면 조작으로 자동화하고, Skills API와 Files API는 버전이 있는 스킬과 재사용 파일을 Managed Agents에 연결합니다. 에이전트는 애플리케이션에서 여러 왕복을 거치며 작업하고, 결과는 다른 UI에도 연결 가능한 실행 흐름으로 전달됩니다.
- Stagehand와 Browserbase, LangChain을 이용한 브라우저 에이전트 사례에서는 도시가 주어진 뒤 지도를 드래그하고 확대하고 클릭하는 입력을 순서대로 처리했습니다. 첫 실행은 약 300/1000점이었고, trace를 코딩 에이전트가 검토해 더 작은 모델과 수정된 동작을 적용한 뒤 10분 후 perfect score screenshot을 남겼습니다.
- NVIDIA NeMo Switchyard는 에이전트 워크플로의 각 단계에 선택된 모델 풀을 배정하며 품질·지연시간·비용 기준을 라우팅 조건으로 둡니다. LangChain 업데이트도 재시도 가능한 오류와 그렇지 않은 오류를 구분하는 middleware, token accounting, document reranking을 보강해 장시간 에이전트 실행에서 도구 호출과 복구 경로를 세분화했습니다.
- Claude Managed Agents와 AG-UI 조합은 특정 화면에 고정되지 않은 에이전트 UI를 목표로 하며, Open Bot 관련 포스트는 AI coworkers·generative UI·computer use·agent-human handoffs·전체 데이터 기록을 한 harness에 넣는 구성을 제시했습니다. 이 조합은 에이전트를 단일 챗봇이 아니라 도구와 사람 사이를 오가는 실행 단위로 다루는 기반이 됩니다.
원문 트윗 2개 보기

ClaudeDevs
@ClaudeDevs
Computer use, the browser tool, the Skills API, and the Files API are now generally available on the Claude Platform. Automate work in applications that have no API with fewer round trips per task, and build Claude Managed Agents on versioned skills and reusable files.

Sydney Runkle
@sydneyrunkle
last night i spent some time building a browser agent with stagehand from @browserbase and deepagents from @LangChain i wanted to build something that required pretty complex web navigation to prove the value of agentic browser use! my agent plays a game called "map tap" where you are assigned a city around the globe, and have to drag the map, zoom in, and click as close to the given city as possible. you get points based on how close you are. 1. one shotted the agent w/ browserbase + langchain docs, it scored ~300/1000 points 2. asked my coding agent to review the trace and make it faster (smaller model) and more accurate (higher score) 3. came back 10 minutes later to see a perfect score screenshot in my trace here's a guide on how to build your own browser agent! https:// docs.langchain.com/oss/python/int egrations/tools/stagehand …
🔥 ARC-AGI와 실사용 과제로 이동하는 에이전트 평가포스트 3
Gemini 3.7 Flash의 ARC-AGI 성능·비용 수치, Meta의 WildArtifactBench, Kaggle의 Adversarial Customer Service가 서로 다른 방식으로 실제 문제 해결 능력을 측정합니다. 에이전트 평가가 단일 정답률에서 멀티모달 결과물·보안 판단·비용 효율을 함께 보는 방향으로 확장됐습니다.
- ARC Prize 포스트는 Gemini 3.7 Flash가 ARC-AGI-2에서 84.6%와 task당 $0.25, ARC-AGI-1에서 95.5%와 task당 $0.12를 기록했다고 밝혔습니다. 점수와 비용을 한 쌍으로 제시해 모델 선택 기준을 최고 성능 하나가 아니라 과제별 효율 비교로 바꿉니다.
- WildArtifactBench는 복잡한 실세계 과제를 다양한 결과물 형식으로 수행하는 멀티모달 에이전트를 평가하고, 엄격한 ground-truth rubric 대신 사람과 agentic preference judge의 win rate와 Elo score를 사용합니다. Meta는 이 프레임워크의 10개 과제를 공개해 실제 업무에 가까운 결과물 품질을 비교할 입력과 판정 절차를 마련했습니다.
- Kaggle의 Adversarial Customer Service는 한 모델이 고객 기록과 verification policy를 가진 은행 지원 에이전트가 되고, 다른 모델이 실제 고객 또는 신원 도용자로 위장한 호출자가 되는 양자 보안 게임입니다. 에이전트는 대화만으로 신원을 판별한 뒤 지원하거나 거부해야 하므로 고객 서비스의 유용성과 개인정보 보호 판단을 동시에 측정합니다.
- ARC-AGI의 정답률·비용, WildArtifactBench의 선호 기반 승률·Elo, Adversarial Customer Service의 공격자-방어자 구조는 서로 다른 실패를 포착합니다. 모델의 일반화 능력, 결과물의 실용성, 민감한 정보 처리 능력을 분리해 볼 수 있어 에이전트 배포 전 평가 범위가 넓어집니다.
원문 트윗 2개 보기
ARC Prize
@arcprize
Gemini 3.7 Flash from @Google on ARC-AGI (Verified): - ARC-AGI-2: 84.6%, $0.25/task - ARC-AGI-1: 95.5%, $0.12/task Gemini 3.7 Flash stands out for its low cost and high scores on ARC-AGI-1 and ARC-AGI-2 relative to other frontier models.

AI at Meta
@AIatMeta
Today we’re also previewing WildArtifactBench, an internal evaluation framework designed to assess agents on complex, real-world tasks across diverse deliverable formats. By using win rates and Elo scores from human and agentic preference judges rather than strict ground-truth rubrics, it expands task coverage across practical multimodal workflows. We’re releasing 10 tasks from WildArtifactBench as a step forward in our ability to measure the real practical utility delivered by multimodal agents: https:// research.meta.ai/wild-artifact- bench …
📈 에이전트 하네스 변경을 추적하는 지속 학습포스트 1
에이전트가 가중치 대신 프롬프트·메모리·도구·스킬·라우팅 규칙을 축적하는 환경에서, 하네스 변경 자체가 과거 성능을 훼손할 수 있다는 연구가 공유됐습니다. Continual Optimizer와 Continual Evaluator를 분리해 새 변경의 개선 효과와 과거 행동 보존을 함께 확인하는 방식입니다.
- 해당 논문은 현대 에이전트의 지속 학습이 모델 가중치뿐 아니라 prompts, memories, tools, skills, routing rules에 축적된다고 봅니다. 이 구성 요소 중 하나를 갱신하면 모델을 그대로 둔 상태에서도 이전에 안정적이던 행동이 깨질 수 있으며, 이를 harness-level forgetting으로 부릅니다.
- Guarded harness evolution은 실행 후 feedback에서 새 하네스 후보를 만드는 Continual Optimizer와, 후보를 실제 반영할지 판단하는 Continual Evaluator를 분리합니다. 입력은 실행 결과와 과거 하네스이고, 처리 과정에서 후보 변경을 만든 뒤 현재 개선·historical retention·validity를 검사하고, 조건을 통과한 변경만 commit합니다.
- 공유된 포스트는 이 방식이 textual reasoning, multimodal perception, open-world interaction에서 상대적 이득 10%를 넘겼다고 밝혔습니다. 모델 재학습 없이도 프롬프트와 도구 구성을 바꾸는 에이전트에서는 새 기능 추가보다 기존 동작의 보존을 함께 측정하는 절차가 운영 안정성의 기준이 됩니다.
📈 무료 접근과 데이터 통제를 둘러싼 모델 운영 조건포스트 3
Ox Alpha의 1M Context·멀티모달·Zero Data Retention 무료 제공과 Muse Spark 1.2의 OpenCode 지역 확대가 모델 접근 장벽을 낮췄습니다. 동시에 Anthropic은 고급 AI에서 기업이 데이터를 소유·통제하고 보존하지 않는 운영 방침을 예고해 사용량과 데이터 거버넌스가 함께 부각됐습니다.
- OpenCode 포스트는 Ox Alpha를 다음 일주일 동안 무료로 제공하면서 1M Context, Multi-modal, Zero Data Retention, 높은 rate limits와 거의 무제한 사용을 내걸었습니다. 100T tokens per day 처리 용량도 함께 제시해 무료 접근의 조건을 가격뿐 아니라 컨텍스트·보존 정책·처리 한도로 묶었습니다.
- Muse Spark 1.2는 OpenCode에서 무료로 제공되고 더 많은 지역에서 사용할 수 있게 됐습니다. 별도 유료 전환 절차보다 개발 도구 안에서 모델 선택지를 넓히는 방식이며, 같은 기간 Muse Spark 1.1과 1.2의 생성 결과물이 WildArtifactBench 관련 페이지에 게시됐습니다.
- Anthropic 관련 포스트는 Mythos-class models에 추가 안전 조치가 필요하고 기업은 자체 privacy·compliance rules를 충족해야 한다고 밝혔습니다. 고객이 데이터를 소유·통제하고 Anthropic은 데이터를 보존하지 않는 구조를 가을에 제공한다는 계획은 모델 성능과 별개로 데이터 처리 권한을 도입 조건으로 삼습니다.
기업 고객이 데이터를 직접 소유·통제하고 제공자가 데이터를 보존하지 않는 구조는 privacy와 compliance 요구를 충족하기 위한 운영 조건으로 제시됐습니다.
원문 트윗 2개 보기

OpenCode
@opencode
Ox Alpha (stealth model) is free for the next week - 1M Context - Multi-modal - Zero Data Retention Generous rate limits, near unlimited usage We have capacity for 100T tokens per day, lets see what you can do
Boris Cherny
@bcherny
We've been working on this with customers for a while. Mythos-class models require additional safety measures and enterprises need to meet their own privacy and compliance rules. Customers can own and control their own data and Anthropic retains none. It’s coming this fall.
Anthropic Plans to Change Data Retention Policy for Advanced AI https:// bloomberg.com/news/articles/ 2026-08-20/anthropic-plans-to-change-data-retention-policy-for-advanced-ai?taid=6a8740cb6510a600012fe6bc&utm_campaign=trueanthem&utm_content=business&utm_medium=social&utm_source=twitter …
➖ 투명 배경 이미지와 H3 영상 제작 생태계포스트 3
GPT-Image-2 API의 투명 배경 출력이 제품 이미지·그래픽 디자인·웹사이트 목업·마케팅 자산 제작에 연결됐습니다. MiniMax H3는 Runway의 무제한 제공과 ComfyUI 커뮤니티 챌린지를 통해 사용량과 로컬·클라우드 제작 경로를 넓혔습니다.
- OpenAIDevs는 GPT-Image-2 API preview에서 transparent backgrounds를 지원한다고 밝혔습니다. 생성된 자산을 어떤 배경에도 배치할 수 있어 입력 단계에서 배경을 고정하지 않고, 출력 단계에서 제품 이미지·그래픽 디자인·웹사이트 목업·마케팅 캠페인에 재사용하는 처리가 가능합니다.
- Runway는 Max plan 사용자가 MiniMax H3를 일정 기간 제한 없이 생성하도록 제공하며 counting이나 caps를 두지 않는다고 밝혔습니다. 동일 영상 모델을 반복 호출할 때 사용량 제한이 제작 과정의 병목이 되지 않도록 요금제 조건을 바꾼 사례입니다.
- MiniMax AI와 ComfyUI는 H3를 주제로 8월 20일부터 9월 1일까지 빌드·제출하는 커뮤니티 챌린지를 열고, 로컬 rig 또는 Comfy Cloud를 선택하게 했습니다. RTX 5090 또는 RTX 5060 Ti를 보상으로 두어 영상 모델 활용을 클라우드와 개인 하드웨어 양쪽의 제작 흐름으로 연결했습니다.
원문 트윗 2개 보기

OpenAI Developers
@OpenAIDevs
Transparent backgrounds are now available in preview for GPT-Image-2 in the API. Generate reusable assets you can place on any background—for product imagery, graphic design, website mockups, and marketing campaigns.

MiniMax (official)
@MiniMax_AI
Teaming up with @ComfyUI for the H3 challenge Build, submit by 9/1, win an RTX 5090 or 5060 Ti. Details below
We're teaming up with @MiniMax_AI on a community challenge built around H3. Two weeks, four ways to win an RTX 5090 or 5060 Ti, local rig or Comfy Cloud. 8/20 — challenge opens 8/20–9/1 — build and submit 9/2 — livestream with guest judges and winners Share on your
용어 해설
- ARC-AGI
- — AI가 새로운 추상 규칙을 파악하고 낯선 문제에 적용하는 능력을 측정하는 벤치마크입니다. ARC-AGI-1과 ARC-AGI-2는 과제별 정답률과 비용을 함께 비교하는 데 쓰입니다.
- 모델 라우팅(Model Routing)
- — 에이전트 작업의 각 단계에 적합한 모델을 품질·지연시간·비용 기준으로 배정하는 방식입니다. 하나의 모델을 모든 단계에 고정하지 않아 워크플로별 자원 배분을 조정할 수 있습니다.
- AG-UI
- — 에이전트와 사용자 인터페이스가 상호작용하는 방식을 맞추기 위한 공개 Agent-User Interaction Protocol입니다. Claude Managed Agents처럼 여러 화면에 연결되는 에이전트의 UI 통합에 활용됩니다.
- WildArtifactBench
- — 멀티모달 에이전트가 실제 업무에 가까운 복합 과제를 수행하고 다양한 결과물을 만드는 능력을 평가하는 프레임워크입니다. 정답표 대신 사람과 에이전트 선호 평가자의 승률과 Elo 점수를 사용합니다.
- 하네스 수준 망각(Harness-Level Forgetting)
- — 모델 가중치를 바꾸지 않아도 프롬프트·메모리·도구·스킬·라우팅 규칙을 갱신하는 과정에서 기존에 안정적이던 에이전트 행동이 깨지는 현상입니다.
- Elo 점수(Elo Score)
- — 두 시스템의 비교 결과를 누적해 상대적 성능을 나타내는 평가 점수입니다. WildArtifactBench는 엄격한 정답 판정 대신 사람과 에이전트 평가자의 선호 결과를 Elo 점수로 집계합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.