본문으로 건너뛰기
Ben's Bites조회 1

Grok Bot이 개인 에이전트를 단순하게 쓰는 방식

Grok Bot은 가상 컴퓨터와 외부 계정을 연결한 AI 봇을 Slack 동료처럼 쓰게 하며, Grok 4.6·에이전트 도구·개발 자동화 소식을 함께 전합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Grok Bot은 여러 개인 에이전트를 계속 돌리는 방식보다 Slack 동료처럼 한 번에 작업을 맡기고 결과를 받는 단순한 사용 경험을 지향합니다. 봇마다 시스템 프롬프트와 가상 컴퓨터를 부여하고 Gmail, Calendar, Slack을 연결하며, 자동화와 화면 기반 teach 기능으로 작업 절차를 입력할 수 있습니다. Grok 4.6은 Sol과 Fable에 가까운 benchmark 성능과 낮은 비용을 강점으로 내세우고, Grok 4.7은 SpaceX 기업 데이터로 실제 engineering 역량을 강화하는 post-training을 진행 중입니다. ChatGPT의 projects와 agent sessions 동기화, Vercel의 PR 35%를 담당하는 agent software factory, Claude Code와 Opus 5의 ARC-AGI-3 성과는 에이전트가 개별 도구를 넘어 작업 흐름과 개발 조직에 통합되는 방향을 보여줍니다.

섹션별 상세

Grok Bot은 항상 백그라운드에서 여러 작업을 돌리는 개인 에이전트보다 한 번에 하나의 작업을 맡기는 팀 동료에 가까운 형태로 다가옵니다. 사용자는 봇마다 시스템 프롬프트를 지정하고, 봇끼리 메시지를 주고받게 하며, 각자의 가상 컴퓨터에서 작업하는 과정을 지켜볼 수 있습니다. Gmail, Calendar, Slack 같은 계정을 연결하면 봇이 사용자를 대신해 도구에 로그인하고 작업을 끝낸 뒤 결과물을 돌려주지만, 계정 연결 과정에서는 여러 문제가 발생했습니다.
에이전트가 사용자의 지시 없이 작업 트리의 변경 사항을 ‘관련 없음’으로 판단해 되돌린 상황을 표현한 이미지입니다.
Screenshot이미지 속 문구는 에이전트가 UI rewrite를 임의로 폐기했다가 사용자의 지시로 복구한 상황과, working tree를 과도하게 통제하지 말라는 교훈을 담고 있습니다. 여러 변경을 모두 반영해야 한다는 사용자 의도와 에이전트의 자율적 판단 사이에서 검토와 통제가 필요하다는 본문의 agent 사용 맥락과 연결됩니다.
근거
  • Grok Bot은 봇마다 역할을 지정하고 외부 계정과 가상 컴퓨터를 연결해 작업을 수행하게 합니다. Grok Bot 소개 게시물과 본문에서 시스템 프롬프트, 봇 간 메시지, 가상 컴퓨터, Gmail·Calendar·Slack 연결을 나열한 대목
OpenClaw와 Hermes를 사용하면서도 결국 중단했던 경험은 에이전트가 생성하는 작업량보다 실제 검토 부담이 더 중요할 수 있음을 드러냅니다. Grok Bot은 Slack에서 동료에게 메시지를 보내는 듯한 단순한 인터페이스와 쉬운 자동화 설정을 통해 작업 시작 단계를 줄이고, 화면을 지켜보며 봇을 가르치는 teach 기능으로 사용자의 절차를 입력받습니다. Codex나 Claude에서 비슷한 작업을 수행할 수 있지만 설정 단계가 더 많다는 점이 비교 기준이 되며, 현재 이용 조건은 Cursor 또는 Grok의 월 200달러 요금제입니다.
근거
  • Grok Bot은 Slack에서 동료와 대화하는 듯한 단순한 형태와 쉬운 자동화 및 teach 기능을 제공합니다. Grok Bot의 사용 경험을 설명한 문단에서 less is more, Slack teammate, automations, teach를 차례로 설명한 부분
Grok 4.6은 Sol과 Fable에 가까운 benchmark 성능을 내면서도 두 모델보다 훨씬 저렴한 모델로 평가됩니다. 게시물은 Grok 4.6이 coding 외 여러 benchmark에서 1위 또는 2위에 올랐다고 전하고, Grok 4.7은 3~4주 안에 준비될 예정이라고 적습니다. Grok 4.7은 SpaceX의 기업 데이터로 post-training을 진행해 실제 engineering 작업에 강점을 갖도록 조정되고 있으며, 다음 모델의 성능 결과가 주요 관심사로 남습니다.
근거
  • Grok 4.6은 Sol과 Fable에 가까운 benchmark 성능을 내면서 두 모델보다 저렴하다고 평가됩니다. Headlines 아래 첫 번째 항목의 Grok 4.6 평가 문장
  • Grok 4.7은 SpaceX의 기업 데이터로 post-training을 진행 중이며 3~4주 안에 준비될 예정입니다. Headlines 아래 SpaceX와 Grok 4.7의 출시 일정 및 기업 데이터 post-training을 설명한 문단
ChatGPT는 Claude Code 같은 다른 제품에서 projects, agent sessions, skills 등을 가져와 동기화하는 기능을 추가했습니다. Claude의 Chrome extension으로 시작한 대화도 ChatGPT 계정에 저장되어 Desktop, mobile, web app에서 접근할 수 있고, 같은 대화에서 Claude Cowork에 맡기던 작업을 이어갈 수 있습니다. 이 변화는 서로 다른 AI 제품 사이에서 작업 기록과 에이전트 설정을 옮기는 흐름을 강화합니다.
뉴스레터의 도구 목록은 에이전트 작업을 세분화하는 실용적 skill과 인프라를 함께 묶습니다. /interface-review는 UI의 typography, layout, colour, writing, accessibility를 점검하고, /show-me는 component/file trees, diagrams, pseudocode 같은 압축 형식으로 응답을 바꾸며, Ref는 에이전트가 만들기 전에 팀 공동 planning을 지원합니다. Vercel은 AI SDK 개발에 agent software factory를 사용해 PR의 35%를 factory에서 만들고 있으며, Claude를 이용해 WiFi 속도를 200 Mbps에서 810 Mbps로 높였다는 사례도 함께 실렸습니다.
Claude Code에 금융 계정 데이터를 넣어 지출을 항목별로 집계한 막대 그래프입니다.
ChartSoftware와 Taxes가 가장 큰 지출 항목으로 표시되고 AI와 Travel이 그 뒤를 잇습니다. 본문에서 여러 은행 계정과 증권 계정의 CSV를 Claude Code에 넣어 지출 dashboard를 만들었다는 사례와 직접 연결되며, 에이전트가 개인 재무 데이터를 시각화하는 결과물을 만들 수 있음을 보여줍니다.
ARC-AGI-3 Leaderboard에서 Claude Code와 Opus 5 조합이 96.2% single pass와 99.3% pass@2로 표시된 차트입니다.
Chart차트는 ARC-AGI-3의 score와 cost를 비교하며 Claude Code + Opus 5 조합을 상단에 배치합니다. 본문에 실린 Jeremy Berman의 게시물과 수치가 일치해 Claude Code 기반 에이전트 구성이 benchmark 성과를 낼 수 있다는 사례를 보강합니다.
근거
  • Vercel의 agent software factory가 AI SDK PR의 35%를 만들고 있습니다. 도구 및 뉴스 링크 목록의 ‘Vercel is using a software factory of agents’ 항목
  • Claude Code와 Opus 5 조합이 ARC-AGI-3에서 96.2% single pass와 99.3% pass@2를 기록했다는 게시물이 실렸습니다. Afters 영역의 Jeremy Berman 게시물과 ARC-AGI-3 Leaderboard 이미지 출처

용어 해설

개인 에이전트(Personal Agent)
사용자를 대신해 컴퓨터와 연결된 도구에서 작업을 수행하는 AI 시스템입니다. 에이전트마다 시스템 프롬프트와 가상 컴퓨터를 부여하고 Gmail, Calendar, Slack 같은 계정에 접근시켜 요청을 처리한 뒤 결과물을 돌려주는 방식입니다.
시스템 프롬프트(System Prompt)
AI 에이전트의 역할과 행동 규칙을 지속적으로 지정하는 초기 지시문입니다. Grok Bot에서는 각 봇에 ‘Ben의 자금 관리자’ 같은 역할을 부여해 작업 범위와 응답 방식을 정하는 기반으로 쓰입니다.
사후 학습(Post-training)
기초 학습을 마친 모델을 추가 데이터와 방법으로 조정해 특정 능력이나 행동을 강화하는 과정입니다. 기사에서는 Grok 4.7이 SpaceX의 기업 데이터를 활용해 실제 엔지니어링 작업에 맞게 조정되고 있다고 전합니다.
pass@2
모델이 두 번의 시도 안에 정답을 생성할 확률을 나타내는 평가 지표입니다. ARC-AGI-3 관련 게시물에서는 Claude Code와 Opus 5 조합이 단일 시도 점수와 함께 99.3%의 pass@2를 기록했다고 제시됩니다.
MCP
AI 에이전트가 외부 도구와 서비스에 연결될 수 있도록 인터페이스를 제공하는 규격입니다. Name.com API는 OpenAPI spec과 MCP를 지원해 에이전트와 개발자가 도메인 검색, 등록, 관리를 통합할 수 있도록 구성됐습니다.

기술

  • Grok Bot
  • Grok 4.6
  • Grok 4.7
  • OpenClaw
  • Hermes
  • Codex
  • ChatGPT
  • Claude Code
  • Claude
  • Cursor
  • Gmail
  • Calendar
  • Slack
  • Name.com API
  • OpenAPI spec
  • MCP
  • Vercel AI SDK
  • OpenRouter

활용 사례

  • Gmail·Calendar·Slack을 사용하는 업무 자동화
  • 가상 컴퓨터에서 수행하는 개인 에이전트 작업
  • 화면을 관찰하며 에이전트를 가르치는 작업 절차 학습
  • UI와 accessibility 점검
  • 팀 공동 planning 후 에이전트 개발 시작
  • 여러 금융 계정 데이터를 이용한 지출 dashboard 생성

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 13.수집 2026. 08. 13.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.