TL;DR
이번 기간에는 Grok Bot의 동영상 편집과 에이전트 도구 연동, 정식 공개 전 모델의 코딩 성능 검증, Recurrent Neural Network 연구 재부상이 기술 포스트의 중심에 놓였습니다. Ox Alpha·Kimi 3.1·GLM-5.3·Composer 3와 Anthropic 내부 모델에 관한 글은 비공개 테스트와 벤치마크 수치가 모델 경쟁의 주요 신호로 쓰이는 흐름을 만들었습니다. 오픈소스 모델의 토큰 점유율 상승과 open-weight 모델의 창작자 통제권, LLM 엔지니어링을 직접 구현하며 배우는 학습 경로도 함께 부각됐습니다. 한편 AI 코딩 도구의 성능 주장은 uptime과 재현 가능한 증거를 기준으로 다시 검증해야 한다는 실무적 경계가 제기됐습니다.
𝕏 실시간 트렌드 토픽
🔥 Grok Bot의 동영상 편집과 에이전트 실행 환경포스트 3
Grok Bot 관련 포스트에서 수학 설명과 유체 시뮬레이션 프롬프트 처리, 음악 동기화 동영상 편집, 오픈소스 에이전트 실행 환경이 함께 등장했습니다. 브라우저·로그·도구를 분리하고 각 행동을 승인·기록하는 구조가 기능 확장의 핵심으로 제시됐습니다.
세부 내용 보기
- Grok Bot은 Navier-Stokes equation과 airfoil design을 실제 fluid dynamics simulation과 함께 설명하는 프롬프트 처리 사례에 이어 동영상 전체 편집과 음악 동기화 사례로 확장됐습니다. 텍스트 응답에 머물지 않고 입력 프롬프트를 시뮬레이션 설명이나 영상·음악 편집 결과로 연결하는 작업 범위가 핵심이며, 원문 포스트는 이를 Grok의 진전으로 평가합니다.
- 완전 오픈소스 Grok Bot 구현은 각 AI coworker에 별도의 컴퓨터·브라우저·로그·도구를 할당하고 LangGraph·CrewAI 같은 agent harness와 연결합니다. Generative UI와 human handoffs를 통해 작업 결과를 사람에게 넘기며, 행동 실행 전 승인과 실행 후 기록을 결합해 자동화 과정의 통제 지점을 구성합니다.
- OpenBot 관련 설명은 모든 행동의 audit trail을 남기고 데이터가 사용자 측에 머문다고 밝힙니다. 이는 에이전트가 무엇을 실행했는지 사후 확인하고 실행 권한을 단계별로 제한하는 구현 방식으로, 단순한 기능 추가보다 도구 사용의 추적성과 승인 절차를 중시하는 방향입니다.
원문 트윗 2개 보기

Elon Musk
Grok Bot can do amazing things!
Three months later, Grok’s progress is amazing, and @bot makes it even more powerful and easier to use. This is the fidelity using the same prompt: “Explain Navier-Stokes equation and how it relates to airfoil design with actual fluid dynamics simulation.” x.com/yunta_tsai/sta…
Md Ismail Šojal
This is the fully open-source Grok Bot. And it works with any agent harness. - Each AI coworker gets its own isolated computer own browser, logs, and tools. - Works with any agent harness (LangGraph, CrewAI, etc.) - Generative UI & human handoffs - Full audit trail, data stays with you - Every action is approved before it runs and recorded after. - http:// github.com/CopilotKit/ope nbot …
📈 비공개 모델 테스트와 코딩 성능 수치 경쟁포스트 7
Ox Alpha, Kimi 3.1, GLM-5.3, Composer 3와 Anthropic 내부 모델에 관한 포스트가 정식 출시 전 코드명·내부 테스트·벤치마크 수치를 통해 모델 경쟁을 추적했습니다. 공개 수치에서는 GLM-5.3의 비용 대비 solve rate와 Ox Alpha의 상반된 DeepSWE 결과가 함께 제시돼 측정 범위와 재현 조건의 중요성이 드러났습니다.
세부 내용 보기
- Ox Alpha는 인터넷 일부에서 추측을 불러온 미스터리 모델로 등장했고, 한 포스트는 5.6 Sol 수준의 성능과 open-weight 공개 뒤 DGX Spark 로컬 실행 가능성을 함께 언급했습니다. 그러나 인용된 DeepSWE 실행에서는 초기 부분집합 테스트의 80%가 아니라 약 63%가 기록됐으므로, 단일 초기 수치만으로 성능을 확정하기 어려운 상황입니다.
- GLM-5.3 (740B)은 Claude Fable 5와 비교된 코딩·사이버보안 사례에서 Fable 5의 $21.63 solve rate 69.7%, GLM-5.3의 $16 solve rate 87.6%로 제시됐습니다. 포스트의 계산대로라면 GLM-5.3은 더 낮은 비용에서 solve rate가 18 points 높으며, sub-agents를 붙인 주 모델 운용 사례도 함께 거론됩니다.
- Kimi 3.1은 Code Arena에 korrine이라는 새 코드명으로 나타났고, Kimi K3가 출시 전 kivine으로 테스트됐다는 과거 패턴과 연결됐습니다. Claude-marshmallow-eap·claude-melon-eap라는 Anthropic 내부 모델명과 Composer 3 (Vega)의 6개 내부 변형, Fast·Medium·High·XHigh 4개 reasoning level도 정식 공개 전 관찰 신호로 제시됐습니다.
- Qwen3.8-27B Uncensored는 MLX 4-bit와 24GB Mac에서 로컬 실행 가능하다고 소개됐으며 native vision·tool calling·262K context가 함께 언급됐습니다. 서로 다른 포스트가 비공개 코드명, 로컬 구동 조건, 평가 비용, solve rate를 경쟁 신호로 사용하면서 모델 비교가 출시 발표 이전의 관찰과 실행 검증으로 이동했습니다.
GLM-5.3은 포스트에 인용된 DeepSWE 수치에서 Claude Fable 5보다 낮은 비용과 높은 solve rate를 기록했으며, 코딩·사이버보안 작업의 주 모델과 sub-agents 구성에 활용된다는 평가를 받았습니다.
Ox Alpha와 각종 내부 코드명은 모델의 존재와 테스트 정황을 알리는 신호지만, 초기 부분집합 테스트와 전체 DeepSWE 실행 수치가 달라 공개 전 성능을 단정하기 어렵습니다.
원문 트윗 2개 보기
Md Ismail Šojal
Ox Alpha Performing at the level of 5.6 Sol and you can run locally on a DGX Spark after open-weight drop
Actual DeepSWE run on the ox alpha mystery model is done. Ended at ~63% NOT the 80% my first subset test got, which makes way more sense. I've been using this thing a ton and it is definitely a very good model. - Much better "voice" than Claude or GPT - Decent design - Handles x.com/winkey_h/statu…
Md Ismail Šojal
GLM-5.3 (740B) is getting strong praise for coding + cybersecurity work. - GLM-5.3 (only 740B) just beat Claude Fable 5 on DeepSWE fable 5 : $21.63 solve rate 69.7% GLM-5.3 : $16 solve rate 87.6% That’s +18 points higher solve rate at lower cost. And people are already running it as the main model with sub-agents. One of the strongest models right now for coding and cybersecurity tasks.
➖ Transformer 교사로 되살아나는 순환 신경망 연구포스트 3
Recurrent Neural Network 연구를 다시 다루는 논문들이 Transformer 중심의 연구 흐름에 다른 기억 구조를 대입했습니다. Transformer 교사로 predictive state representations를 학습하고 memory transition function을 지도학습하는 방식이 RNN의 recurrence 관련 문제를 우회하는 경로로 제시됐습니다.
세부 내용 보기
- Pretraining Recurrent Networks without Recurrence 논문은 RNN을 직접 recurrence 방식으로 사전학습하는 대신 Transformer teacher를 사용해 좋은 predictive state representations를 학습하고 memory transition function을 supervised learning으로 익힙니다. 입력의 예측 상태와 상태 전이 규칙을 분리해 학습함으로써 RNN의 기존 학습 난점을 피하는 구조입니다.
- 관련 포스트는 해당 접근이 RNN의 문제를 우회한다고 평가하면서도 LSTM RNN을 시험하지 않은 점을 지적합니다. 또 Section 3.3의 SMT→DMT 과정에서 GRU RNN이 memory space collapse로 학습되지 않는다는 설명만 있고 세부 정보가 부족하다고 짚어, 비교 대상과 실패 조건을 더 명확히 해야 한다는 실무적 쟁점을 남겼습니다.
- Christopher Manning은 Transformer뿐 아니라 FFN, CNN, LSTM, tree-recursive NN, BiDAF QA net, highway net 등을 폭넓게 가르쳤다고 밝혔습니다. 연구 포스트들은 Transformer의 계산 능력을 인정하면서도 recurrence 기반 구조의 기억 처리와 상태 전이를 다시 시험하는 흐름을 뒷받침합니다.
순환 구조는 기억 전이와 상태 표현을 다루는 별도 설계 공간을 제공하므로 Transformer만으로 신경망 도구 상자를 제한하지 않아야 한다는 입장입니다.
새 연구가 RNN의 부활을 시사하더라도 LSTM 미평가와 GRU 학습 실패 조건 미상으로 인해 기존 구조 대비 우위를 판단할 근거가 아직 부족하다는 지적입니다.
원문 트윗 2개 보기

Christopher Manning
Pretraining Recurrent Networks without Recurrence by @akarshkumar0101 & @phillip_isola is a great paper! It makes an end-run around the problems of RNNs via a transformer teacher to learn good predictive state representations & supervised learning of a memory transition function

Christopher Manning
When teaching CS224N, I thought it important to introduce students to a broad neural toolbox – not just transformers but FFNs, CNNs, LSTMs, tree-recursive NNs, BiDAF QA nets, highway nets, …. I think the resurgence of work using recurrence shows the importance of this approach.
Pretraining Recurrent Networks without Recurrence by @akarshkumar0101 & @phillip_isola is a great paper! It makes an end-run around the problems of RNNs via a transformer teacher to learn good predictive state representations & supervised learning of a memory transition function
➖ LLM 엔지니어링을 직접 구현하는 학습 경로포스트 1
한 로드맵은 튜토리얼 시청보다 작은 모델부터 serving과 평가 시스템까지 직접 만드는 과정을 LLM 엔지니어링 학습의 중심에 놓았습니다. tokenizer·attention·Transformer block 구현에서 SFT·DPO·RLHF·GRPO, quantization·RAG·tool use·agent loops까지 입력 처리부터 운영까지의 층위를 순서대로 연결합니다.
세부 내용 보기
- 로드맵은 작은 working model을 학습하고 embeddings와 tokenizer를 직접 만든 뒤 RoPE·ALiBi·attention·multi-head attention·complete Transformer block을 구현하도록 구성됩니다. training objectives와 generation strategies를 바꿔 보면서 모델 입력, 상태 계산, 출력 생성이 어떻게 이어지는지 코드 수준에서 확인하는 방식입니다.
- 추론 단계에서는 speculative decoding과 efficient KV caching을 만들고 MQA·GQA·MLA, long-context, FlashAttention, 실제 hardware limits를 다룹니다. 이어 Mixture-of-Experts와 sparse·dense trade-offs, state-space models, diffusion-based language models, data pipeline과 synthetic data까지 확장해 모델 구조와 시스템 비용을 함께 측정하도록 합니다.
- 후반부는 SFT에서 DPO·RLHF·GRPO로 이어지는 학습, quantization, serving infrastructure, reliable evaluation systems, RAG pipelines, tool use와 agent loops, vision adapters, interpretability, red-teaming, 완성형 end-to-end system 배포를 연결합니다. 개별 개념 암기보다 입력·학습·추론·검색·도구 실행·평가를 하나의 시스템으로 묶는 실습 경로라는 점이 핵심입니다.
📈 오픈 웨이트의 토큰 점유율과 창작자 통제권포스트 2
오픈소스 AI의 토큰 점유율이 Vercel에서 최근 2개월 동안 28%에서 62%로 올랐다는 인용과 Stable Audio 3.0을 활용한 창작자 인터뷰가 연결됐습니다. 비용·접근성뿐 아니라 가중치 투명성, 예술적 통제, 기술 사용 방식에 대한 발언권이 오픈 웨이트 모델의 가치로 제시됐습니다.
세부 내용 보기
- 인용된 차트는 Vercel에서 오픈소스 AI의 토큰 점유율이 최근 2개월 동안 28%에서 62%로 증가했다고 기록합니다. 같은 인용은 OpenAI와 Anthropic의 합산 사용량도 7월에 가속됐다고 적었으므로, 오픈소스 사용 확대가 frontier lab 사용량의 단순한 소멸로만 설명되지는 않는다는 수치 구조입니다.
- Stable Audio 3.0을 활용한 Montreal Music Technology Hackathon 참가자들은 open weight 모델의 가치를 transparency, artistic control, 기술 사용 방식에 대한 실제 발언권으로 설명했습니다. 모델 가중치 접근은 결과물을 생성하는 기능뿐 아니라 데이터와 창작 과정에 대한 통제 범위를 결정하는 조건으로 연결됩니다.
- 한 포스트는 open source가 tokens를 차지하고 frontier labs가 돈을 차지하는 구도를 제시합니다. 이 문장은 산업의 최종 결론이라기보다 토큰 사용량과 수익 귀속을 서로 다른 지표로 나눠 보는 프레임이며, 앞선 28%·62% 수치와 창작자 통제권 사례가 그 구도를 뒷받침하는 재료로 쓰였습니다.
오픈소스 모델은 토큰 사용량과 로컬·창작 환경의 선택권을 넓히며, open-weight 접근이 투명성과 예술적 통제권을 제공한다는 입장입니다.
오픈소스 토큰 점유율 증가는 분명한 사용량 변화지만, frontier lab의 합산 사용량도 가속됐다는 같은 자료가 있어 시장의 수익 구조까지 단정하기는 어렵습니다.
원문 트윗 2개 보기
Md Ismail Šojal
Most people are still arguing open source vs frontier. The real outcome is already clear: Open source wins tokens, Frontier labs keep the money yet,
More data than open-source AI is taking share from OpenAI and Anthropic. Open source has gone from 28% token share to 62% token share @vercel over the last 2 months. Chart from @rauchg Super impressive given that the sum of OpenAI and Anthropic accelerated in July. So net
Stable Audio
Music hackers building on Stable Audio 3.0 at the Montreal Music Technology Hackathon told us why open weight models matter to them: transparency, artistic control, and an actual say in how the technology gets used. Watch what they said
➖ AI 코딩 도구의 성능 주장과 운영 신뢰성포스트 2
AI 코딩 봇이 특정 작업을 매우 잘한다는 평가와, 높은 성능 주장은 재현 가능한 증거가 필요하다는 반론이 맞섰습니다. 코드 생성 능력과 99.999% uptime 같은 운영 지표를 분리해 검증해야 한다는 실무적 기준이 제기됐습니다.
세부 내용 보기
- 관련 포스트는 현재 모델이 특정 niche software domain에서 실제 코드 한 줄까지 직접 작성해야 하는 사용자에게 얼마나 유용한지 묻습니다. 이는 코딩 도구의 평가를 일반적인 데모가 아니라 도메인별 수작업 대체 범위와 실제 개발 과정의 사용성으로 옮기는 문제 제기입니다.
- 다른 포스트는 AI coding bots가 어려운 작업을 잘할 수 있어도 incredible claims에는 incredible proof가 필요하다고 지적합니다. uptime은 두 개의 nine을 넘기기도 어렵다는 현실적 제약과, coding이 해결됐다는 주장 뒤에 99.999% uptime을 가로막는 문제가 단순한 버그뿐인지 묻는 구분이 함께 제시됩니다.
- 논쟁의 초점은 코드 생성 성능과 서비스 운영 신뢰성을 하나의 수사로 묶지 않는 데 있습니다. 특정 사례의 성공 출력은 입력 조건과 검증 범위를 밝혀야 하며, 실제 배포에서는 오류 복구·가동률·도메인별 유지보수 부담을 별도 지표로 측정해야 한다는 실무적 결론으로 이어집니다.
AI coding bots는 복잡한 작업을 빠르게 처리할 수 있으므로 현재 도메인 소프트웨어 개발에서도 높은 실용성이 있다는 입장입니다.
코드 생성 데모나 off-the-cuff 발언만으로 개발이 해결됐다고 말할 수 없으며, 도메인별 재현성·오류 처리·99.999% uptime을 별도로 입증해야 한다는 입장입니다.
원문 트윗 2개 보기
Susan Zhang
a few gems in this thread, exercise left to reader how much of it is all cope and temporary and how much of it looks more structural
i would be super interested in hearing from ppl who don't find current models very useful in their current niche software domains. specifically something like "i in fact frequently have to hand-write individual lines of actual code" quite genuine curiosity ! pls speak up! x.com/suchenzang/sta…
Susan Zhang
this unc doesn't hold back, turd is a bit too extreme (unless you stare at them all day and it's normalized) i was simply... shook ai coding bots can do incredible things incredibly well but incredible claims require incredible proof and even when this is probably an off-the-cuff joke, it seems too representative of arrogant comms that one must wonder how far the tendrils of this type of thinking goes again, uptime is a cheap shot, it's very hard to keep systems up past two nines, i can totally sympathize, but if coding is solved, is it really just a few bugs that gets in the way of having 99.999% uptime? no need to crucify boris for a joke, there are now legions of xitterers building ai castles in their private homes and coming online crying "it's over it's over everything's over" and then it's shockingly often to find it's all over with turds swirled in ice cream (not all though! there's still hope!)
I've been thinking about this quote for a solid 24 hours It's a like a raspberry ripple of bullshit A vanilla ice cream of VC funding, stirred with a little pinch of turd x.com/bcherny/status…
➖ 실시간 주행과 개인화 가격 책정의 AI 적용포스트 2
Tesla의 FSD 주행 사례와 Delta의 실시간 항공권 가격 책정 사례가 AI를 즉시 의사결정 시스템에 연결하는 방식으로 묶였습니다. 차량은 교통 상황에서 주행 판단을 수행하고, Fetcherr는 각 검색 요청마다 다른 가격을 생성하는 구조로 설명됐습니다.
세부 내용 보기
- FSD 관련 포스트는 Tesla 차량이 심한 교통 상황의 Atlanta 왕복 주행에서 사람 운전자의 욕설을 제외한 모든 상황을 처리했다고 평가합니다. 사례의 입력은 복잡한 도로 상황이고 출력은 주행 제어이며, 포스트는 이를 현재 quasi-supervised 상태의 기술 도약으로 규정합니다.
- Delta 사례에서는 CEO 발언을 근거로 AI가 승객마다 다른 항공권 가격을 실시간으로 설정해 수익을 50% 높일 수 있다고 전했습니다. 항공사는 Fetcherr라는 AI 시스템을 사용해 각 shopping request마다 고유한 가격을 생성하는 방식으로 가격 의사결정을 자동화합니다.
- 두 사례 모두 고정된 규칙표 대신 입력 상황마다 판단 결과를 계산하는 구조를 강조하지만, 포스트에 제시된 것은 주행 경험담과 수익 전망입니다. 따라서 실제 성능이나 수익 효과를 일반화하기보다, 실시간 입력을 받아 행동 또는 가격이라는 운영 결정을 출력하는 적용 형태로 읽는 편이 적절합니다.
원문 트윗 2개 보기

Tesla
It will change your life
FSD in its current quasi-supervised state is one of the most impressive technological leaps of the 21st century. Our Y drove us to and from Atlanta in awful traffic yesterday and it handled everything (except my cursing out how stupid human drivers are!) with aplomb. Game changer x.com/sawyermerritt/…
Peyman Milanfar
winning minds and hearts with AI
Delta's CEO said AI will boost profits by 50% by setting a different ticket price for every passenger in real time. The airline uses an AI system called Fetcherr that generates a unique price for each shopping request. Delta told Congress last year it was not using personal
용어 해설
- 에이전트 실행 프레임워크(Agent Harness)
- — AI 에이전트가 브라우저·도구·컴퓨터 환경을 호출하고 작업 순서를 실행하도록 연결하는 실행 계층입니다. Grok Bot 관련 포스트에서는 LangGraph와 CrewAI 같은 프레임워크 호환성이 에이전트 구성과 도구 사용을 좌우하는 요소로 등장합니다.
- 오픈 웨이트 모델(Open-Weight Model)
- — 모델 가중치를 외부에 공개해 사용자가 직접 내려받고 실행하거나 수정할 수 있는 모델입니다. Stable Audio 3.0과 오픈소스 토큰 점유율 관련 포스트에서는 투명성, 창작자 통제권, 실행 주체의 선택권과 연결됩니다.
- DeepSWE
- — 코딩 모델의 문제 해결 성능을 비교하는 평가 이름으로 포스트에 등장합니다. Ox Alpha와 GLM-5.3 관련 글은 DeepSWE의 solve rate를 모델 성능과 비용 비교의 근거로 사용하지만, 일부 수치는 초기 부분집합 테스트와 전체 실행 결과가 다르게 제시됩니다.
- 순환 신경망(Recurrent Neural Network)
- — 이전 계산의 상태를 다음 입력 처리에 전달하는 신경망 구조입니다. 관련 논문들은 Transformer를 교사로 활용해 recurrence 없이 상태 표현을 사전학습하거나, 메모리 전이 함수를 지도학습하는 방식으로 RNN의 학습 문제를 우회합니다.
- KV 캐싱(KV Caching)
- — 생성 과정에서 이미 계산한 attention의 key와 value를 저장해 다음 토큰 처리 때 재사용하는 추론 최적화 기법입니다. LLM 엔지니어링 로드맵은 이를 긴 문맥 처리와 효율적인 serving 인프라를 익히는 핵심 구현 항목으로 포함합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.