TL;DR
이번 포스트에서는 공개 가중치 모델의 로컬 실행, Linux용 ChatGPT 데스크톱 앱과 Codex 연동, coding agent의 비용·안전성 개선이 함께 부각됐습니다. Muse Glimmer는 30B parameter dense model의 가중치 공개로 로컬 사용 범위를 넓혔고, ChatGPT 데스크톱 앱은 Ubuntu·Debian·Fedora에서 .deb 또는 .rpm 패키지로 설치할 수 있게 됐습니다. coding agent 쪽에서는 기존 궤적을 자연어 skill로 압축해 비추론 모델의 출력 토큰과 추론 비용을 줄이는 연구가 공유됐으며, adversarial code review와 red-teaming은 설계·사용성 버그와 권한 분류 오류를 보완하는 수단으로 제시됐습니다. 영상 생성 모델의 캐릭터·장면·음악 동기화 기능, GeminiApp의 10억 사용자 milestone, MLX.fast의 2.6배 실행 속도 향상도 새 제품과 성능 축으로 묶였습니다.
𝕏 실시간 트렌드 토픽
🔥 Muse Glimmer 30B 공개 가중치와 로컬 실행포스트 1
Meta가 Muse Glimmer의 30B parameter dense model 가중치를 공개하면서 로컬 실행을 전면에 내세웠습니다.
- Mark Zuckerberg의 인용문에 따르면 Muse Glimmer는 30B parameter dense model이며 로컬에서 실행할 수 있는 가중치가 공개됐습니다. 가중치 배포는 외부 사용자가 자체 환경에서 모델을 구동하는 입력 경로를 열며, 포스트는 이를 Meta의 open source 지향과 연결했습니다.
- @SecScottBessent는 Muse Glimmer 공개를 미국 AI innovation의 성과로 평가하면서 open-weights와 closed-weight models를 함께 발전시켜야 한다고 밝혔습니다. 원문에서 별도의 품질 benchmark나 메모리 수치는 제시되지 않았으므로 성능 비교는 확인되지 않았습니다.
Muse Glimmer의 30B 가중치 공개와 로컬 실행을 open-weights 확산 및 미국 AI leadership의 사례로 평가하는 입장입니다.
🔥 Linux용 ChatGPT 데스크톱과 Codex workflow 동기화포스트 7
OpenAI가 Linux용 ChatGPT 데스크톱 앱을 preview로 열고, ChatGPT Work와 Codex의 기존 프로젝트·채팅·skill·plugin을 가져와 동기화하는 기능을 붙였습니다.
- ChatGPT 데스크톱 앱은 Ubuntu 24.04 LTS·26.04 LTS, Debian 13, Fedora 43·44에서 preview로 제공되며 x64와 ARM64용 .deb 또는 .rpm 패키지로 설치됩니다. Linux 환경에서 ChatGPT, ChatGPT Work, Codex를 기존 작업 공간과 browser workflow 안에서 사용하는 구조입니다.
- OpenAIDevs 포스트는 다른 agent의 작업을 ChatGPT Work와 Codex에 맞추는 방법으로 프로젝트·채팅·skill·plugin import와 import history 검토, Settings의 automatic updates 선택을 제시했습니다. 기존 workflow를 가져온 뒤 자동 동기화 여부를 설정하는 순서가 핵심이며, 별도의 성능 수치는 공개되지 않았습니다.
원문 트윗 2개 보기
Tibo
@thsottiaux
We did it, finally... Codex & ChatGPT desktop, now on Linux. Thanks for waiting and you can cancel that MacBook order if you got impatient. It’s that good.
Now in preview: The ChatGPT desktop app for Linux. Use ChatGPT, ChatGPT Work, and Codex where you already work and build, with your projects and browser workflows on supported Linux systems.

OpenAI Developers
@OpenAIDevs
You can now keep your work from other agents in sync with ChatGPT Work and Codex. Import projects, chats, skills, and plugins, review your import history, and opt in to automatic updates in Settings. Now available in the ChatGPT desktop app.
📈 Coding agent의 skill 압축과 검증 체계포스트 7
Coding agent가 기존 작업 궤적을 짧은 자연어 skill로 압축해 비추론 모델에 주입하는 방식과, adversarial code review·red-teaming으로 설계·권한 오류를 잡는 흐름이 공유됐습니다.
- 원문에 인용된 Microsoft 연구에서는 coding agent가 training split의 기존 trajectory 일부를 읽고 compact natural-language skill을 만든 뒤 non-reasoning model의 system prompt에 삽입합니다. 이 입력→압축→프롬프트 주입 과정으로 같은 절차를 매 episode마다 다시 추론하는 비용을 줄이는 구조입니다.
- ALFWorld, tau-squared-bench telecom and retail, SpreadsheetBench-Verified에서 GPT-5.4-mini 기준 reasoning gap의 55%에서 100% 이상을 회복했고, 네 benchmark 중 두 곳에서는 reasoning mode를 앞섰습니다. skill-equipped non-reasoning model은 2.7~6배 적은 output token과 zero reasoning tokens를 기록했으며, non-reasoning trajectory만으로 만든 skill도 paired corpus 기반 skill과 경쟁력을 유지했습니다.
- Boris Cherny의 포스트는 LLM의 bug가 off-by-one보다 system design·UI usability·broader context 문제로 이동했다고 짚고, iOS simulator에서 edge case를 적대적으로 시험하는 한 줄 프롬프트와 Claude의 /code-review를 대안으로 들었습니다. Apollo Research의 외부 red-teaming 뒤 Claude Code auto mode classifier miss rate는 12%에서 7%로 낮아졌고, Claude Code 2.1.228은 synced skill의 local command shadowing과 shell execution 문제를 막는 변경을 포함했습니다.
- NVIDIA는 Nemotron-RL-Agentic-Terminal-Pivot이라는 open agentic RL dataset을 공개해 coding agent capability의 post-training에 사용되는 데이터를 함께 배포했습니다. LangChain Python release도 middleware model call이 messages와 event stream으로 새어 나가지 않도록 하고, 실패한 summary를 재시도하는 변경을 담았습니다.
자연어 skill 주입과 adversarial 검증을 결합하면 reasoning token을 줄이면서도 coding agent의 다단계 작업 품질과 안정성을 높일 수 있다는 입장입니다.
LLM이 일부 coding 작업을 해결했어도 system design, UI usability, broader context에 관한 bug는 여전히 남아 기존 방식만으로 모든 오류를 없애기 어렵다는 입장입니다.
원문 트윗 2개 보기
DAIR.AI
@dair_ai
Impressive new paper from Microsoft. (bookmark it) Reasoning modes beat non-reasoning modes on multi-step agentic tasks, and they charge a 3 to 6x premium in output tokens on every single episode. Much of that spend goes into re-deriving procedures the model already worked out on earlier episodes in the same domain. This work amortizes that cost. A coding agent reads a small corpus of existing trajectories from a training split, compiles a compact natural-language skill, and injects it into the non-reasoning model's system prompt. Across ALFWorld, tau-squared-bench telecom and retail, and SpreadsheetBench-Verified, skills recover 55% to over 100% of the reasoning gap for GPT-5.4-mini on held-out tasks. On two of the four benchmarks the skill-equipped non-reasoning model beats reasoning mode outright, while emitting 2.7 to 6x fewer output tokens and zero reasoning tokens. Reasoning traces turn out to be optional. Skills distilled from non-reasoning trajectories alone stay competitive with skills distilled from paired corpora. Paper: https:// arxiv.org/abs/2608.07885 Track more trending AI papers in our academy: https:// academy.dair.ai

Boris Cherny
@bcherny
LLMs still produce bugs, but those bugs are different than what they used to be. It’s less off-by-ones and more about system design, ui usability, missing broader context. Some kinds of coding has been solved, but not all. While models continue to improve, adversarial code review has been an incredibly powerful tool to catch many of these kinds of bugs. It can be as simple as a one line prompt - “use a dynamic workflow to adversarial test every edge case in an iOS simulator”, or use Claude’s built in /code-review (or /code-review low, /code-review medium, etc.)
doesn’t happen anymore x.com/jarredsumner/s…
📈 영상 생성 모델의 장면·캐릭터·음악 제어포스트 4
Grok Imagine, LTX-2.5, Seedance 2.5, Gemini Omni가 영상 생성과 장면 일관성, 캐릭터 참조, 음악 동기화 기능을 앞세웠습니다.
- LTX-2.5는 film, robotics, real-time workflow에 사용되는 기존 model의 upgrade로 소개됐으며 higher pixel fidelity와 cut 사이에서 이어지는 multishot scene, pretrained foundation을 핵심으로 내세웠습니다. 입력 장면을 여러 shot으로 확장하면서 시각적 일관성을 유지하는 방향입니다.
- Runway의 Seedance 2.5는 50개의 unique character reference와 최대 30초 clip을 제공하고 음악에 맞춰 동기화합니다. 여러 캐릭터 참조와 음원 입력을 결합해 한 번의 generation에서 출연진과 soundtrack을 함께 다루는 제품 기능입니다.
- Elon Musk는 Grok Imagine으로 steampunk movie를 직접 만들 수 있다고 밝혔고, GeminiApp은 Gemini Omni를 8월 11일 11:59pm PT까지 최대 10개 영상 무료 생성 대상으로 안내했습니다. 두 포스트 모두 품질 benchmark나 생성 시간은 밝히지 않았습니다.
원문 트윗 2개 보기
@ltx_io
Introducing LTX-2.5, the world model the world builds on. One of the biggest upgrades yet to the model already powering film, robotics, and real-time workflows. Higher pixel fidelity, multishot scenes that hold together across cuts, and a pretrained foundation built to be
@runwayml
A full cast, a full track, one generation at a time. Seedance 2.5 is live on Runway, with 50 unique character references and clips up to 30 seconds synced to music. Get started at the link below.
➖ GeminiApp 월간 사용자 10억 milestone포스트 2
Demis Hassabis가 GeminiApp의 사용자 10억 명 milestone을 가장 빠르게 성장한 product의 성과로 알렸고, TechCrunch는 OpenAI ChatGPT의 6월 10억 monthly active users와 보조적으로 비교했습니다.
- GeminiApp 관련 포스트 두 건은 10억 사용자 수치를 동일하게 전하며, 이를 product growth의 milestone으로 연결했습니다. 원문에는 사용자 수의 산정 방식이나 기간별 증가율이 없어 monthly active users인지 여부는 GeminiApp 자체 포스트만으로 확정되지 않습니다.
- TechCrunch 포스트는 ChatGPT가 6월에 1 billion monthly active users를 기록했고 Gemini가 그 수준을 따라가고 있다고 적었습니다. 두 서비스의 사용자 지표가 같은 기준으로 집계됐는지에 관한 추가 근거는 포스트에 없습니다.
➖ MLX.fast의 Laguna XS 2.1 실행 속도 경쟁포스트 1
MLX.fast challenge가 Mac에서 Laguna XS 2.1을 더 빠르게 실행하는 과제를 커뮤니티에 열었고, 현재까지 2.6배 속도 향상과 1,800건에 가까운 submission을 기록했습니다.
- eigenlabs와 poolsideai가 제시한 과제는 Mac에서 Laguna XS 2.1의 실행 속도를 높이는 것이었으며, 참가자는 최적화 결과를 submission으로 제출했습니다. challenge 종료 시점까지 약 1,800 submissions와 35 solvers가 모였습니다.
- 현재 성과는 2.6x faster로 집계됐습니다. 원문은 기준 실행 시간, 하드웨어 구성, 최종 승자의 구현을 밝히지 않았으므로 2.6배 향상의 세부 원인은 확인되지 않았습니다.
📈 신선한 데이터 부족을 반영한 Compute-Data scaling포스트 1
데이터 제약 pretraining 연구가 반복 데이터의 효과를 새로운 token 수로 환산해 compute 증가와 고품질 데이터 부족 사이의 교환 비율을 다루는 방법을 제시했습니다.
- 인용된 연구의 핵심 문제는 compute가 지수적으로 늘어나는 동안 high-quality token 공급은 같은 속도로 늘지 않는다는 점입니다. 반복된 데이터와 fresh data를 직접 비교하기 어렵기 때문에, 반복 데이터가 validation loss에 기여한 정도를 같은 효과를 내는 fresh token 수로 환산합니다.
- 이 effectiveness 값을 사용하면 반복 데이터와 신선한 데이터를 하나의 공통 척도에 놓을 수 있습니다. 포스트는 이를 Chinchilla의 fresh-data 가정이 약해지는 상황에 대한 Compute-Data scaling laws로 연결했지만, 구체적인 법칙 계수나 benchmark 수치는 제시하지 않았습니다.
➖ Nemotron 로컬 실행과 DGX 하드웨어포스트 2
NVIDIA와 Perplexity 관련 포스트가 Nemotron 계열 open weights MoE model을 노트북·로컬 하드웨어에서 실행하는 경로와 DGX 장비 활용을 알렸습니다.
- NVIDIAAI는 Nemotron 3 Ultra를 DGX Station에서 로컬로 실행하는 경로를 알렸고, Arav Srinivas는 이를 laptop이나 DGX Spark 같은 local hardware에서 효율적으로 실행할 수 있는 American open weights MoE model로 설명했습니다. 모델 가중치와 로컬 장비를 결합하는 배포 방식입니다.
- Arav Srinivas의 같은 포스트는 larger Nemotron Ultra를 Perplexity에서 사용할 수 있다고 덧붙였습니다. 원문에는 Nemotron 3 Ultra와 Nemotron Ultra의 parameter 수, 속도, 품질 benchmark가 없어 모델 간 정량 비교는 확인되지 않았습니다.
원문 트윗 2개 보기

NVIDIA AI
@NVIDIAAI
Run Open Models Locally: Nemotron 3 Ultra on DGX Station | Nemotron Labs
@AravSrinivas
A great American open weights MoE model that can run efficiently on your laptop or local hardware like the DGX Spark! You can use the larger Nemotron Ultra on Perplexity!
용어 해설
- 공개 가중치(Open Weights)
- — 모델의 학습 가중치를 외부에 배포하는 방식입니다. 사용자는 제공된 가중치를 내려받아 자체 하드웨어에서 모델을 실행하거나 연구·개발에 활용할 수 있으며, Muse Glimmer는 30B parameter dense model의 가중치를 공개하는 사례로 제시됐습니다.
- 밀집 모델(Dense Model)
- — 입력 처리 때 대부분의 파라미터를 함께 사용하는 모델 구조입니다. Muse Glimmer는 30B parameter dense model로 소개됐고, 로컬 실행을 목표로 가중치가 공개됐습니다.
- 추론 모드(Reasoning Mode)
- — 다단계 작업에서 추가적인 추론 토큰을 생성하도록 설계된 모델 실행 방식입니다. 원문에 인용된 연구에서는 비추론 모델보다 높은 비용을 쓰지만, distilled skill과 비교되는 기준으로 활용됐습니다.
- 스킬 증류(Skill Distillation)
- — 기존 작업 궤적에서 반복 가능한 절차를 짧은 자연어 skill로 압축한 뒤 시스템 프롬프트에 삽입하는 방식입니다. 연구에서는 coding agent가 이를 수행해 비추론 모델의 성능 격차를 줄였습니다.
- 적대적 코드 리뷰(Adversarial Code Review)
- — 코드의 경계 조건과 실패 가능성을 의도적으로 공격하는 검토 방식입니다. 원문에서는 한 줄 프롬프트나 Claude의 /code-review를 사용해 iOS simulator에서 모든 edge case를 시험하는 방법으로 제시됐습니다.
- Compute-Data 스케일링 법칙(Compute-Data Scaling Laws)
- — 반복 데이터의 효과를 동일한 validation loss를 내는 새로운 token 수로 환산해, 반복 데이터와 신선한 데이터를 하나의 척도에서 비교하는 연구 개념입니다. 고품질 token 부족과 compute 증가의 교환 관계를 다룹니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
