TL;DR
이번 기간에는 Starship을 재사용 가능한 발사체를 넘어 우주 운송 시스템으로 바라보는 시각과, 궤도 운송 비용 하락이 우주 경제를 확장할 것이라는 전망이 함께 나왔습니다. Grok은 인터넷 구매를 대신 수행해 Tesla Model Y 주문까지 처리한 사례로 컴퓨터 사용 에이전트의 범위를 넓혔고, Hermes Agent는 사람이 마우스를 계속 쓰는 동안 백그라운드에서 작업하는 방식으로 Codex와 대비됐습니다. 연구 포스트에서는 공유 Transformer 코어를 반복 사용하는 Gated Recurrent Transformers, 과정 보상 기반 RLVR, 인간 대화 평가와 LLM 심사자의 불일치가 다뤄졌으며, PyTorch 행렬 곱셈과 GPU의 SM 구조를 연결하는 설명도 이어졌습니다.
𝕏 실시간 트렌드 토픽
🔥 Starship을 중심으로 한 우주 운송과 에너지 활용 규모포스트 4
재사용 로켓의 비용 구조 변화가 궤도 경제와 대규모 우주 인프라로 이어질 수 있다는 전망이 모였습니다.
세부 내용 보기
- Elon Musk는 인류 문명이 행성 에너지 가운데 활용하는 비율이 매우 작아 Kardashev one 척도에서 아직 낮은 수준이라고 말했고, 다른 포스트들은 재사용 로켓이 궤도 운송 비용 곡선을 바꾸면서 우주 경제의 기반을 넓힌다고 연결했습니다.
- Starship은 탑재량, 재사용성, 발사 빈도, 추진제, 궤도 인프라를 한 시스템 안에서 확장하는 방향으로 설계됐으며, 이 관점에서는 단순한 로켓보다 문명 규모의 우주 운송 시스템에 가깝게 기능합니다.
- 포스트에는 구체적인 비용 절감 수치가 제시되지 않았지만, 발사 비용 하락과 우주 GDP 확대 가능성이 반복적으로 언급됐고, 우주에서 대규모 활동을 가능하게 하는 핵심 조건으로 Starship이 지목됐습니다.
원문 트윗 2개 보기
X Freeze
Starship is designed to completely change the economics of space It is unlike anything humanity has ever built before The amount of engineering SpaceX has packed into this machine is insane... constantly pushing closer to the limits of what physics allows Everything around Starship is built for insane scale: payload, reusability, launch cadence, propellant, orbital infrastructure, the Moon, and Mars Anything humanity wants to build at serious scale in space eventually comes back to one machine that makes it possible: Starship This is the kind of scale humanity used to only imagine Everything changes when you realize Starship is no longer just a “rocket” It starts to look like a transportation system built for an entire civilization

Elon Musk
Keeping up with the Kardashevs
Elon Musk reveals why, measured against the sun's energy, human civilization barely registers as existing at all: "Right now we're very low on the Kardashev one scale. If you say what proportion of our planet's power are we harnessing, it's a very, very tiny number. And we're
🔥 Grok의 인터넷 구매 실행과 Tesla 주문 사례포스트 1
Grok Bot이 사용자의 요청을 받아 인터넷에서 상품을 구매하고 Tesla Model Y 주문까지 제출한 사례가 공유됐습니다.
세부 내용 보기
- 기존 대화형 모델이 상품 정보를 전달하는 데 그쳤다면, 이번 사례의 Grok Bot은 사용자의 구매 요청을 입력으로 받아 웹사이트에서 주문 절차를 수행하고 결과를 제출하는 단계까지 진행했습니다.
- 공유된 예시에서는 Baconbrix가 Grok Bot에 Tesla 구매를 요청했고, 에이전트가 실제로 Model Y 주문을 배치했습니다. 원문에는 결제 조건이나 주문 완료 여부 같은 추가 세부 정보는 제시되지 않았습니다.
- 이 사례는 Grok이 텍스트 응답을 넘어 브라우저 기반 외부 행동으로 연결되는 사용 방식을 갖추고 있음을 보여주지만, 한 건의 시연 사례만으로 일반적인 구매 성공률을 판단할 수는 없습니다.
📈 Hermes Agent의 브라우저 연동과 모델·하네스 분리포스트 4
Hermes Agent의 브라우저 지원과 사람의 커서 사용을 방해하지 않는 컴퓨터 조작 방식, 모델과 실행 하네스를 분리해야 한다는 원칙이 함께 부각됐습니다.
세부 내용 보기
- Hermes Agent에는 Brave Origin 지원이 추가됐고, 한 Windows 데스크톱 비교에서는 사람이 포인터를 계속 사용하는 동안 Hermes가 백그라운드에서 작동한 반면 Codex는 네이티브 커서를 점유했습니다.
- 두 에이전트의 차이는 모델 능력만이 아니라 브라우저와 입력 장치를 연결하는 실행 하네스가 커서를 어떻게 관리하는지에서 발생합니다. 백그라운드 작업과 사용자 입력을 분리하면 사람이 작업을 이어가면서 에이전트 결과를 받을 수 있습니다.
- OpenAI 모델과 Cursor의 파트너십 종료를 인용한 포스트에서는 에이전트 구축 시 모델과 하네스를 분리해 특정 모델이나 서비스에 종속되지 않는 구조를 첫 원칙으로 삼아야 한다는 메시지가 제기됐습니다.
모델과 실행 하네스를 분리하면 특정 모델 공급자나 제품의 변경에 에이전트 전체가 묶이지 않고, 브라우저·커서 같은 실행 환경도 독립적으로 교체할 수 있습니다.
원문 트윗 2개 보기
Hermes Agent Super-Intel
What most people miss about computer-use agents: the mouse matters. I tested Hermes vs Codex on one Windows desktop. Hermes worked in the background while I kept using my pointer. Codex took over the native cursor. Thoughtful human-agent UX. Proud work, @Teknium @NousResearch

Harrison Chase
Separation of model and harness One of the first commandments of agents building; don’t get locked in
We’re ending our partnership with Cursor following its acquisition by SpaceX. Under our proposal, Cursor’s direct access to our models would end on November 12. We know that the people most affected by this decision are the developers who rely on OpenAI models in Cursor. We care
📈 Gated Recurrent Transformers의 반복 깊이와 파라미터 절감포스트 1
Gated Recurrent Transformers는 작은 Transformer 코어를 반복 재사용해 파라미터 수를 줄이면서 추론 시 반복 횟수로 잠재 계산량을 조절하는 구조입니다.
세부 내용 보기
- 일반적인 깊은 모델이 층마다 별도 가중치를 배정하는 것과 달리, Gated Recurrent Transformers는 공유 Transformer 코어를 여러 번 재사용해 깊이와 파라미터 수를 분리합니다.
- 각 반복 단계에서 현재 hidden state와 고정된 prelude representation을 입력으로 받은 학습 게이트가 보존하거나 다시 쓸 정보를 선택하므로, 같은 가중치가 깊이에 따라 다른 처리를 수행합니다.
- 동일 FLOPs 조건에서 GRT는 35M 파라미터로 124M 파라미터의 GPT-2 Small과 맞먹었고, large 모델에서는 파라미터를 약 62%, 최대 decoding memory를 약 59% 줄였습니다. 반복 단계 수를 추론 시점의 compute hyperparam으로 사용할 수 있다는 점이 핵심입니다.
📈 과정 보상과 대화 평가의 신뢰성 문제포스트 2
RLVR의 희소 보상 한계와 LLM judge의 인간 대화 평가 불일치가 각각 학습 신호와 평가 설계의 문제로 제기됐습니다.
세부 내용 보기
- Sparse RLVR은 기본 모델이 이미 생성할 수 있는 행동을 주로 증폭하지만, dense process rewards는 중간 풀이 과정에 신호를 제공해 기존 분포에서 거의 나오지 않던 행동까지 탐색하게 만듭니다. 한 AIME 과제의 성능이 3.9%에서 92.2%로 올라간 사례가 근거로 제시됐습니다.
- 대화 평가에서는 전문 작가가 만든 인간 대화 30,000개 이상의 expert-generated turns와 36,000개 이상의 per-turn human annotations를 기준으로 classical automatic metrics와 reference-free LLM-as-a-judge를 비교했고, 두 방식 모두 전문가 판단과 안정적으로 맞지 않았습니다.
- Mixture-of-Judges는 여러 평가 신호를 결합해 인간 평가와의 상관을 약 30% 높였으며, 보상이나 평가 점수의 상승만으로 실제 일반화와 품질을 단정하지 않도록 데이터 분포와 인간 기준을 함께 확인해야 한다는 결론으로 이어집니다.
단일 LLM judge나 자동 지표는 실제 인간 대화 품질을 안정적으로 대변하지 못하므로, 평가 결과를 그대로 신뢰하기 어렵습니다.
과정 보상과 Mixture-of-Judges처럼 중간 과정과 복수 신호를 함께 반영하는 방식은 희소 보상이나 단일 평가자의 한계를 보완할 수 있습니다.
원문 트윗 2개 보기
alphaXiv
“Demystifying Reinforcement Learning Post-Training of Language Models” Sparse RLVR mostly amplifies behaviors the base model can already sample. This paper shows dense process rewards can overcome that exploration bottleneck and learn near-zero-probability behaviors, pushing one AIME task from 3.9% to 92.2%. It also explains spurious reward gains as prompt-distribution effects, not evidence that random rewards are generally useful. https:// alphaxiv.org/abs/2608.24949
DAIR.AI
// Your LLM judge disagrees with the experts // LLM Judges can be tricky to build. Here is an interesting showcasing why: There propose a reference-full benchmark of hundreds of complete human-to-human dialogues written by professional script writers, with realistic turn densities and more than 36,000 per-turn human annotations across over 30,000 expert-generated turns. Conversational evaluation frameworks were mostly built for summarization, translation and short-form QA, and the metrics themselves are often derived and validated on synthetic data rather than human dialogue. Tested against expert judgment at this scale, both classical automatic metrics and reference-free LLM-as-a-judge approaches turn out to be unreliable. Their Mixture-of-Judges framework combines multiple evaluative signals and recovers roughly 30 percent better correlation with human assessment. Paper: https:// arxiv.org/abs/2608.26131 Chat with Paper: https:// academy.dair.ai/papers/evaluat ing-language-models-in-realistic-conversational-contexts-2608.26131 …
➖ PyTorch 행렬 곱셈에서 GPU SM까지 이어지는 실행 구조포스트 2
간단한 PyTorch 행렬 곱셈이 메모리, 레지스터, FMA, warp scheduler로 구성된 GPU의 SM에서 처리되는 경로가 설명됐습니다.
세부 내용 보기
- 소프트웨어에서 `c = a @ b`로 작성한 행렬 곱셈은 GPU 내부에서 수치가 회로를 통과하는 연산으로 이어지며, 이를 이해하려면 코드 한 줄과 칩 설계 사이의 연결을 추적해야 합니다.
- GPU의 기본 실행 단위인 SM은 memory, register files, fused multiply-adds와 warp schedulers로 구성됩니다. 연산 데이터가 메모리에서 레지스터로 이동하고 FMA가 계산을 수행하는 동안 warp scheduler가 실행 흐름을 조정합니다.
- SM 자체의 구성은 단순하지만 여러 SM으로 확장하는 과정이 어렵다는 점이 지적됐고, 소프트웨어 엔지니어가 각 cycle의 수치 흐름을 이해하면 모델 연산과 하드웨어 실행 사이의 비용 구조를 파악하는 데 도움이 됩니다.
원문 트윗 2개 보기
Yun-Ta Tsai
I made a video about what happens when you execute `c = a @ b` in PyTorch, from the code to silicon. Hopefully it will help you appreciate that simple line of code more. Made by Grok @bot . Enjoy!
It's beneficial for a software engineer to learn chip design so they understand how numerics flow through circuitry each cycle.

Yun-Ta Tsai
An SM (the basic unit of a GPU) is actually quite simple: memory, register files and a bunch of FMAs (fused multiply-adds) along with warp schedulers. All GPU architecture changes began from SMs. Scaling up is the hard part.
➖ Hy4 preview의 짧은 프롬프트 기반 영상 생성포스트 1
WorkBuddy를 통한 Hy4 preview에서 한 문장의 거친 지시만으로 1인칭 롤러코스터 영상을 생성한 사례가 공유됐습니다.
세부 내용 보기
- 사용자는 상세한 사양이나 reference video 없이 1인칭 시점, 앞줄 좌석, 빠른 느낌을 담은 짧은 프롬프트만 입력했습니다.
- WorkBuddy를 통해 Hy4 preview에 전달된 입력은 구체적인 장면 설계보다 핵심 시점과 감각을 지정하는 방식이었고, 결과 영상은 원문 작성자가 기대를 충족했다고 평가했습니다.
- 원문에는 생성 시간, 해상도, 영상 길이, 품질 점수 같은 정량 지표가 없으므로 한 사례를 기반으로 생성 성능을 일반화할 수는 없습니다.
용어 해설
- 카르다셰프 척도(Kardashev Scale)
- — 문명이 활용하는 에너지 규모를 기준으로 발전 단계를 나누는 척도입니다. 행성 전체의 에너지, 항성 에너지 등 더 큰 자원 활용 범위를 기준으로 문명의 기술적 도달 수준을 가늠합니다.
- 컴퓨터 사용 에이전트(Computer-Use Agent)
- — 화면과 입력 장치를 직접 조작해 사용자의 컴퓨터 작업을 수행하는 에이전트입니다. 마우스 커서와 브라우저 같은 운영체제 인터페이스를 어떻게 공유하느냐가 사람과 에이전트의 동시 작업 경험을 좌우합니다.
- 반복 변조(Recurrent Modulation)
- — 같은 신경망 코어를 여러 번 통과시키면서 반복 단계마다 정보를 보존하거나 다시 쓰는 방식입니다. 학습된 게이트가 현재 은닉 상태와 사전 표현을 바탕으로 각 단계의 처리 변화를 결정합니다.
- 과정 보상(Process Reward)
- — 최종 정답뿐 아니라 문제를 푸는 중간 과정에도 보상을 부여하는 학습 신호입니다. 희소한 결과 보상으로는 탐색하기 어려운 행동을 학습 과정으로 끌어내는 데 쓰입니다.
- 복수 심사자 결합(Mixture-of-Judges)
- — 여러 평가 신호를 결합해 언어 모델의 응답 품질을 판단하는 평가 방식입니다. 단일 자동 지표나 LLM 심사자의 판단을 그대로 쓰지 않고 전문가 평가와의 상관을 높이는 방향으로 구성됩니다.
코드 예제
c = a @ bPyTorch에서 행렬 곱셈 한 줄이 소프트웨어 연산에서 GPU 회로의 FMA와 스케줄링으로 이어지는 과정을 가리키는 코드입니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.