TL;DR
이번 포스트에서는 Grok 4.6과 GPT-5.6 Sol을 중심으로 모델 접근성과 API 비용을 낮추고 에이전트가 광고 계정·이메일·개발 도구를 직접 조작하는 흐름이 이어졌다. OpenRouter의 Inkling 계열과 DeepSeek의 vision 모델은 agentic harness와 멀티모달 입력을 기준으로 실제 작업 성능을 넓히고 있다. 한편 Starship 시험과 배터리 인프라, 로컬 GPU 추론, 대규모 공개 학습은 AI 서비스를 지탱하는 계산·전력·하드웨어 계층의 확장을 보여준다. 모델 자체의 성능 경쟁과 함께 가격, 실행 권한, 평가 환경, 데이터센터 전력까지 제품 경쟁의 범위가 넓어진 상태이다.
𝕏 실시간 트렌드 토픽
🔥 Grok 4.6의 접근 경로와 업무 자동화 확대포스트 5
Grok 4.6이 Google Vertex AI와 Grok Build·Cursor를 통해 여러 실행 환경으로 확장되고, Grok Bot은 이메일과 사업 운영 작업에 연결되는 흐름이다.
- Grok 4.6은 Google Vertex AI에서 제공되며, Grok Build harness와 Cursor app에서도 사용하도록 안내됐다. 하나의 모델이 클라우드 플랫폼·개발 harness·코딩 앱으로 이어지는 접근 경로를 확보한 셈이다.
- CursorBench 3.2 인용 수치에서는 Grok 4.6 Extra High가 70.8%와 task당 2.81달러를 기록했고, 비교 대상으로 Fable 5 Max 70.5%·17.32달러, Opus 5 Max 70.0%·8.23달러, GPT-5.6 Sol Max 67.2%·5.69달러가 제시됐다. 점수와 비용을 함께 비교하는 선택 기준이 형성됐다.
- Grok Bot은 더 많은 요금제로 확대되고 무료 체험이 가능해졌으며, 이메일 주소를 부여하면 이메일 송수신·계정 인증·웹사이트 가입·워크플로 내 이메일 처리가 가능하다는 사례가 공유됐다. 모델 호출을 넘어 외부 서비스와 업무 절차를 연결하는 방식이다.
원문 트윗 2개 보기
SpaceXAI
Grok 4.6 is now available on Google Vertex AI https:// x.ai/news/grok-4-6- vertex-ai …

Elon Musk
Try Grok 4.6 using the Grok Build harness or Cursor app for max usefulness http:// X.ai/build
BREAKING: Grok 4.6 just took the #1 spot on CursorBench 3.2 — while delivering a massive efficiency advantage. • Grok 4.6 Extra High — 70.8% | $2.81/task • Fable 5 Max — 70.5% | $17.32/task • Opus 5 Max — 70.0% | $8.23/task • GPT-5.6 Sol Max — 67.2% | $5.69/task Grok
📈 GPT-5.6 Sol API 비용 인하와 지출 제어포스트 7
OpenAI가 GPT-5.6 Sol의 API 가격과 Codex 크레딧 사용 조건을 조정하고, API 키별 비용 추적과 하드 리밋을 추가했다.
- OpenAI는 GPT-5.6 Sol의 실행 효율 개선을 전제로 향후 3개월 동안 API 및 크레딧 가격을 20% 이상 낮췄다. 토큰 기반 Codex 요금제에서는 구매한 크레딧의 사용 범위가 넓어지고 Pro·Plus·Business 구독 사용량은 그대로 유지된다.
- 가격 변경은 API 사용자에게 적용되고 Codex와 ChatGPT Work로 순차 확대됐다. 같은 모델을 호출하는 비용을 낮추면서 기존 구독의 사용량 조건은 바꾸지 않는 방식이다.
- API Usage and Spend 대시보드에서는 API key별 사용량과 지출을 확인하고 조직·프로젝트 단위 월별 한도를 설정할 수 있다. hard limit에 도달하면 트래픽을 중단해 앱과 workload별 비용 추적부터 초과 지출 차단까지 한 흐름으로 묶는다.
원문 트윗 2개 보기
As we continue to push the frontier of capabilities while improving efficiency, we're dropping API and credit pricing of GPT-5.6 Sol by over 20% for the next 3 months.

OpenAI Developers
You can now track usage and spend by API key in the Usage and Spend dashboards to see which apps and workloads drive your spend. Set monthly organization or project spend limits, including hard limits that stop traffic when reached.
📈 𝕏 Ads MCP의 에이전트 광고 운영포스트 2
𝕏 Ads MCP가 Grok, Grok Build, Claude Code 등 에이전트를 광고 계정에 연결해 대화형 캠페인 운영을 가능하게 했다.
- 𝕏 Ads MCP는 사용자가 이미 쓰는 에이전트 환경에서 광고를 만들 수 있도록 연결 계층을 제공한다. 별도 광고 화면의 수동 조작 대신 에이전트가 계정과 캠페인 작업에 접근하는 구조이다.
- 인용된 사용 흐름에서는 Grok, Grok Build, Claude Code 또는 다른 AI agent가 𝕏 Ads 계정에 직접 연결되고, 일반 대화로 캠페인을 관리한다. 입력은 자연어 요청이고 처리는 에이전트의 계정 조작이며 출력은 광고 캠페인 변경이다.
- 광고 도구가 agent-native 형태로 이동하면서 MCP가 모델과 외부 서비스 사이의 실행 인터페이스로 쓰인다. 자동화의 핵심 범위가 콘텐츠 생성에서 계정 상태 변경과 캠페인 운영으로 넓어진다.
원문 트윗 2개 보기

Benji Taylor
We just launched the 𝕏 Ads MCP, allowing you to create ads directly from where you already use agents.

Elon Musk
Use your AI to manage 𝕏 ads!
𝕏 Ads just became agent-native... and this is a very powerful upgrade With the new 𝕏 Ads MCP, you can now connect Grok, Grok Build, Claude Code or other AI agents directly to your 𝕏 Ads account and manage campaigns through normal conversation You can literally ask: “How are
➖ Agentic Harness 중심의 모델 평가와 실행포스트 4
Inkling 계열이 agentic harness 전용 무료 접근으로 제공되고, 에이전트의 비결정적 행동을 추적·평가하는 개발 방식이 함께 부상했다.
- Thinky Machines는 Inkling의 real-world behavior를 파악하기 위해 OpenRouter에서 몇 주 동안 무료로 제공하며, 계정과 분리한 데이터를 개선에 활용한다고 밝혔다. 일반 채팅보다 실제 도구 실행 과정에서 수집되는 행동 데이터가 개선 루프의 입력이 된다.
- OpenRouter의 Inkling과 Inkling Small은 Open-weight MoE reasoning models로 제공되며, 텍스트·이미지·오디오 입력과 1M context window를 지원한다. Claude Code, Codex, Hermes Agent 같은 agentic harness에 연결해 무료 접근을 제한한 구조이다.
- CoreWeave는 agentic AI가 결정론적이지 않아 전통적인 소프트웨어 테스트만으로 부족하다고 밝혔다. 따라서 실행 trace를 기록하고 작업 결과를 평가하는 계층이 필요하며, 모델 정확도만이 아니라 반복 실행의 행동 품질과 실패 경로가 평가 대상이 된다.
- Berkeley의 Agentic AI Summit 관련 포스트는 약 5,000명의 현장 참석자와 약 100,000명의 온라인 참여자를 언급하며 agentic AI를 별도 개발 영역으로 묶었다. 에이전트의 실행 권한과 평가 환경이 모델 선택만큼 중요한 개발 주제로 이동했다.
agentic harness에서 실제 행동 데이터를 수집하면 모델이 현실 작업에서 어떻게 실패하는지 확인하고 개선할 수 있다는 입장이다.
에이전트가 비결정적으로 움직이므로 전통적인 소프트웨어 테스트만으로는 품질을 보장하기 어렵다는 입장이다.
원문 트윗 2개 보기
Thinking Machines
We want to improve Inkling’s agentic performance. To help us understand its real-world behavior, we are making it available for free on OpenRouter (only with agentic harnesses) for the next few weeks, starting now. We’ll use the data, disassociated from accounts, to better it.
Agentic AI isn't deterministic, which means traditional software testing doesn't cut it. At the NYSE, CoreWeave’s @shawnup joined @SiliconANGLE 's @theCUBE to discuss how developers are building for the agentic era and why @weave_wb is essential for tracking, evaluating, and
📈 로컬 GPU 추론과 공개 대규모 학습포스트 3
대형 모델을 개인·워크스테이션 GPU에서 실행하는 사례와 수조 토큰 규모의 공개 학습 계획이 함께 제시됐다.
- Sky Lab 사례에서는 공식 checkpoint와 극단적 양자화 없이 Qwen3.6 35B를 8GB RTX 4060 laptop에서 39 tok/s로 실행하고, DeepSeek-V4-Flash 284B를 RTX 5090 desktop에서 22~25 tok/s로 실행했다고 밝혔다. GLM-5.2 753B는 RTX PRO 6000 workstation에서 15 tok/s를 기록했다.
- Marin 535B-A23B는 pretraining 80%와 midtraining 20%로 구성된 18.75T tokens 학습을 11 x GB200 NVL72에서 약 3개월 동안 수행하는 계획으로 시작됐다. 약 2.7e24 FLOPs 규모이며 post-training이 뒤따른다.
- 본 학습 전에는 1.6B-A61M부터 27.7B-A1.2B까지 4-rung scaling ladder를 돌려 문제를 점검하고 본 학습 결과를 예측했다. 최종 loss뿐 아니라 중간 checkpoint의 loss도 예측해 학습 경로가 계획대로 진행되는지 확인하는 방식이다.
원문 트윗 2개 보기

Matei Zaharia
Really cool results from Sky Lab’s @Andy_ShuoYang to run massive LLMs on local GPUs!
Your gaming PC can now serve frontier models at interactive speed using official checkpoints without extreme quantization! Qwen3.6 35B → 8GB RTX 4060 laptop @ 39 tok/s DeepSeek-V4-Flash 284B → RTX 5090 desktop @ 22-25 tok/s GLM-5.2 753B → RTX PRO 6000 workstation @ 15 tok/s

Percy Liang
Marin 535B-A23B started training this week! As usual, the whole process is open. Voyage plan: pretraining (80%) + midtraining (20%) on 18.75T tokens on 11 x GB200 NVL72 for ~3 months (2.7e24 FLOPs). Post-training will follow. Before kicking off the run, we trained a 4-rung scaling ladder from 1.6B-A61M (48B tokens) to 27.7B-A1.2B (926B tokens) to debug issues, and to make a forecast of our hero run. This is by far our biggest run, so definitely expecting the unexpected.
➖ Starship 시험과 AI 전력 인프라포스트 3
Starship의 네 번째 비행 시험 준비와 Memphis·Southaven 데이터센터의 대규모 배터리 전력 공급이 같은 인프라 확장 흐름에 놓였다.
- Starship은 네 번째 flight test를 앞두고 6개 Raptor engine을 모두 사용한 60초 full-duration static fire를 완료했다. 실제 비행 전 지상에서 모든 엔진을 장시간 함께 점화해 추진기관 통합 상태를 확인하는 절차이다.
- Memphis와 Southaven 시설은 세계 최대 규모의 grid-connected battery pack으로 전력을 공급받을 예정이다. 배터리는 전력 비용을 낮추고 지역 전력 시스템의 reliability를 높이는 역할을 맡는다.
- 데이터센터 전력 공급을 전력망과 배터리 저장장치의 결합으로 구성하면 시설 운영 비용과 지역 전력 안정성을 함께 관리할 수 있다. 별도 포스트에서는 미국 내 intelligence를 제공하려면 데이터센터를 건설해야 한다는 frontier sovereignty 관점도 제기됐다.
데이터센터를 현지에 건설해야 미국 안에서 intelligence를 제공하고 frontier sovereignty를 확보할 수 있다는 입장이다.
원문 트윗 2개 보기
SpaceX
The Starship preparing for our fourteenth flight test completed a full-duration, 60-second static fire with all six Raptor engines

SpaceXAI Memphis
Our Memphis and Southaven sites will be powered by the world’s largest grid-connected battery pack, reducing the cost of electricity to local communities and increasing the reliability of their local power systems
📈 멀티모달 모델의 제품·서비스 진입포스트 4
DeepSeek의 vision 모델, Runway의 고비트 영상 변환, Waymo 차량 내 Gemini 기능이 멀티모달 AI의 실제 서비스 연결을 넓혔다.
- DeepSeek-V4-Flash-Vision-Exp는 DeepSeek-V4-Flash의 text capability를 유지하면서 vision capability를 추가한 실험 모델이다. Cline에서는 `deepseek/deepseek-v4-flash-vision-exp` model id로 사용할 수 있으며, 멀티모달 agent benchmark에서 별도 성능이 제시됐다.
- Runway Ruby는 Max와 Enterprise 요금제에서 영상을 16-bit EXR sequence 또는 10·12-bit ProRes와 HEVC로 생성·변환한다. BT.2020 색공간과 PQ 또는 HLG를 지원해 영상 생성 결과를 후속 제작 포맷으로 연결한다.
- Gemini in Waymo는 Ojai의 모든 탑승자에게 제공되며, 승객은 AC·좌석·실내등 조정, 음악 변경, 이동 도시 질문, 목적지와 ETA 확인을 대화로 처리한다. 모델의 이미지·텍스트 처리 범위가 차량 내부 제어와 여행 정보 질의로 이어진 사례이다.
- MiniMax AI는 video generation model이 무료이고 real-time이면 어떤 사용 사례가 가능한지 물으며 속도와 비용을 사용처의 핵심 조건으로 내세웠다. 생성 품질뿐 아니라 실시간성·가격이 서비스 확장의 기준으로 함께 다뤄졌다.
원문 트윗 2개 보기
Cline
DeepSeek's new V4-Flash-Vision-Exp matches V4-Flash benchmarks, but adds vision capabilities with performance similar to Opus 4.8. Use in Cline with: npm i -g cline /models then model id is `deepseek/deepseek-v4-flash-vision-exp`
DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world knowledge. On multimodal agent benchmarks, V4-Flash-Vision-Exp makes a major
Runway Ruby is now available for Max plans and Enterprise. Generate or convert any video into 16-bit EXR sequences or 10 and 12-bit ProRes and HEVC, in BT.2020 color with PQ or HLG. Try it now at the link below.
➖ Google AI 학습 도구와 검색 연동포스트 2
Google이 학생 대상 무료 Gemini 이용 기간과 새 학습 도구를 내놓고, Notebook 기능을 Google Search의 AI Mode로 확장했다.
- Google은 upcoming semester를 앞두고 학생에게 1년간 무료 student plan을 제공하고 GeminiApp 기반 study tools를 출시했다. 학기 준비라는 사용 맥락에 맞춰 모델 접근권과 학습 기능을 함께 묶은 방식이다.
- Gemini Notebook의 upgraded experience는 모든 사용자에게 제공되고 mobile 지원은 추후 제공될 예정이다. 기존 notebook 작업공간을 전체 사용자에게 열어 접근 범위를 넓혔다.
- Notebook은 Google Search의 AI Mode에서도 접근할 수 있게 됐다. 별도 노트 환경에 머물던 자료와 질의 흐름을 검색 인터페이스 안으로 연결해 학습 자료 접근 경로를 줄이는 구조이다.
원문 트윗 2개 보기
To help you prepare for the upcoming semester, Google is offering student plans for one year at no cost and launching new study tools. Here are five ways to make the most of this school year with help from @GeminiApp
Apologies for our radio silence, it's been a bit of a busy week for us . Here's what launched: — Our upgraded Notebook experience is now available to ALL users (mobile coming soon!) — You can now access your notebooks in AI Mode in Google Search — We've improved the way
용어 해설
- 정적 연소 시험(Static Fire Test)
- — 로켓 엔진을 실제 비행 없이 지상 설비에 고정한 채 점화해 추력계와 엔진 작동 상태를 확인하는 시험이다. Starship 발사 전 추진기관의 지속 연소와 통합 상태를 검증하는 단계로 쓰인다.
- 에이전트 실행 하네스(Agentic Harness)
- — AI 모델에 도구, 실행 환경, 반복 작업 절차를 연결해 실제 에이전트 작업을 수행하게 하는 실행 계층이다. Inkling은 일반 대화가 아니라 이 환경에서의 실제 행동 성능을 측정하도록 제공됐다.
- Mixture of Experts(MoE)
- — 여러 전문가 모듈 중 일부만 입력마다 선택해 계산하는 모델 구조다. Inkling과 Inkling Small은 MoE reasoning model로 제공되며, 텍스트·이미지·오디오 입력과 1M context window를 지원한다.
- 컨텍스트 윈도(Context Window)
- — 모델이 한 번의 처리에서 참고할 수 있는 입력과 출력 토큰의 범위다. Inkling 계열은 1M context window를 제공해 긴 작업 기록이나 대규모 자료를 한 작업 흐름 안에서 처리할 수 있다.
- 손실 예측(Loss Forecasting)
- — 학습 중간에 기록한 checkpoint의 loss 추이를 바탕으로 최종 학습 결과와 진행 경로를 추정하는 방법이다. Marin 학습에서는 최종 loss뿐 아니라 중간 checkpoint의 loss도 예측해 학습 상태를 확인한다.
- 멀티모달 에이전트 벤치마크(Multimodal Agent Benchmark)
- — 텍스트뿐 아니라 이미지나 기타 입력을 함께 받아 도구 사용과 추론 작업을 수행하는 에이전트 성능을 측정하는 평가다. DeepSeek-V4-Flash-Vision-Exp는 text capability와 멀티모달 에이전트 평가 결과가 함께 제시됐다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.