본문으로 건너뛰기
X (Twitter)조회 2

NVIDIA Vera Rubin 에이전트 인프라, 공개 대규모 학습, 자기개선 harness, 실행 도구와 Attention 학습

에이전트용 컴퓨팅 확장, 공개 대규모 학습, 자기개선 제어, 실행 도구와 Attention 학습

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이번 포스트에서는 Agentic AI의 긴 실행을 받치는 NVIDIA Vera Rubin 하드웨어와 에이전트의 자기 수정 과정을 통제하는 harness 설계가 함께 부상했다. Marin Community의 대규모 공개 학습과 llama.cpp·ElevenLabs CLI·OpenResearch 같은 도구는 모델 개발과 에이전트 작업을 더 직접적인 실행 환경으로 옮기고 있다. 한편 François Chollet의 Deep Learning with Python 15~16장은 LLM을 처음부터 배우려는 독자를 위한 내적 Attention 학습 자료로 다시 확산됐다. 기술의 초점이 단순 대화 응답에서 장시간 실행, 상태 관리, 비용·처리량 최적화로 이동하는 흐름이다.

𝕏 실시간 트렌드 토픽

🔥 NVIDIA Vera Rubin의 에이전트용 궤도 컴퓨팅포스트 4

NVIDIA Vera Rubin을 에이전트의 오케스트레이션·코드 실행·데이터 처리에 맞춘 시스템으로 확장하는 소식이 이어졌다. NVIDIA는 실제 에이전트 코딩 궤적에서 GB300 NVL72 대비 전력당 처리량과 토큰 비용 수치를 제시했다.

세부 내용 보기
  • NVIDIA와 SpaceX는 Vera Rubin NVL72를 우주 환경에 맞춘 시스템으로 설계해 내년 4분기 궤도 발사를 계획하고 있으며, 2028년에는 규모 확대를 예고했다. 이 시스템의 입력은 에이전트 작업에서 발생하는 오케스트레이션·코드 실행·데이터 처리이고, Vera 아키텍처가 이를 처리해 GPU 유휴 시간을 줄이는 구조다.
  • NVIDIA는 SemiAnalysis의 AgentX 워크로드와 DeepSeek V4 Pro를 사용해 실제 에이전트 코딩 궤적을 측정했으며, Vera Rubin이 GB300 NVL72보다 전력당 처리량 최대 30배, 토큰 비용 최대 35% 낮은 수치를 기록했다고 밝혔다. 에이전트 세션은 수백 단계로 이어지고 문맥이 수십만 토큰까지 커질 수 있어 일반 채팅과 다른 하드웨어 평가가 필요하다는 설명이다.
  • NVIDIA Groq 3 LPX가 양산 단계에 들어갔고 Vera Rubin NVL72와 결합해 에이전트 처리 기반을 구성한다는 발표도 나왔다. 일곱 개 칩과 다섯 개 전용 랙을 함께 설계하는 방식이 모델 연산뿐 아니라 메모리·데이터 흐름·에이전트 실행을 한 시스템에서 맞추려는 방향을 드러낸다.
원문 트윗 2개 보기

📈 Marin Community의 공개 대규모 모델 학습포스트 3

Marin Community의 새 모델 학습 과정이 Weights & Biases 실행 기록과 함께 공개되며 대규모 사전학습의 진행 상황이 실시간으로 공유됐다. 별도 포스트에서는 4일 동안 26T 토큰을 처리한 Ox Alpha 학습 수치도 확산됐다.

세부 내용 보기
  • Marin Community는 535B-A23B 학습을 시작했고, 계획상 사전학습 80%와 중간학습 20%에 18.75T 토큰을 사용하며 11개의 GB200 NVL72에서 약 3개월 동안 실행한다. 학습 전 여러 단계의 스케일링 실험을 거친 뒤 본 학습을 시작하고, 전체 과정과 Weights & Biases 실행 기록을 공개하는 흐름이다.
  • 공개된 학습 기록에는 모델 학습의 loss 곡선과 실행 상태가 포함돼 외부 사용자가 진행 상황을 따라갈 수 있다. 학습 규모는 535B-A23B, 18.75T 토큰, 약 3개월, 2.7e24 FLOPs로 제시됐으며, 사전학습 이후 post-training이 이어질 예정이다.
  • Ox Alpha에 대해서는 4일 동안 26T 토큰을 처리했다는 짧은 수치가 공유됐다. 두 사례 모두 모델 이름이나 세부 구조보다 학습 토큰 수와 실행 기간을 앞세워 대규모 학습의 진행 속도와 자원 규모를 드러내는 방식이다.
원문 트윗 2개 보기

📈 에이전트 자기개선 제어와 Slack 배포 자동화포스트 6

에이전트가 프롬프트·도구·메모리를 스스로 바꾸는 상황을 견디기 위한 durable state·이벤트 로그·분기·롤백 구조가 제안됐다. 동시에 Managed Deep Agent는 Slack 앱 생성과 인증 설정을 한 명령으로 묶어 배포 절차를 줄였다.

세부 내용 보기
  • exo harness는 에이전트를 세 층으로 분리한다. exoharness가 수정 불가능한 append-only 이벤트 로그와 아티팩트·비밀·샌드박스 수명을 보존하고, executor가 프롬프트 조립·모델 호출·도구 실행·메모리를 관리하며, sandbox가 패키지·파일·명령을 격리된 머신에서 실행해 스냅샷과 되돌리기를 가능하게 한다.
  • 이 구조에서는 특정 이벤트에서 대화를 분기해 같은 작업의 두 버전을 병렬 실행하고, 에이전트가 스스로 망가진 직전 상태로 롤백하며, 몇 주 뒤 전체 기록과 마운트를 가진 채 작업을 재개할 수 있다. tool_requested와 tool_result를 읽어 실제 실행된 명령을 추적하는 방식까지 포함돼 자기 수정 과정의 감사 가능성을 높인다.
  • LangChain의 Managed Deep Agent 배포는 Slack 앱의 manifest 작성, OAuth redirect 처리, bot token 복사를 별도 절차에서 제거하고 한 명령으로 앱을 프로비저닝한다. 같은 기능을 소개한 포스트들은 에이전트 로직보다 배포에 필요한 인증·앱 설정의 반복 작업을 자동화하는 데 초점을 맞췄다.
원문 트윗 2개 보기

elvis

@omarsar0

11일 전

Solving recursive self-improvement with a harness. The big question with the agent harnesses I use is: how does it support RSI and compound on every iteration? What capabilities do I need to own the harness? What are the best solutions right now? Something important to understand when using harnesses. Once an agent starts rewriting its own prompts, tools, and memory, you need durable state underneath it that the agent cannot modify, plus a way to roll a run back to an earlier checkpoint. exo is a new open-source agent harness built to solve exactly that. It splits an agent into three layers. 1) The exoharness stores everything durable. Conversation history is an append-only event log the agent cannot alter, and it holds artifacts, secrets, and sandbox lifecycle alongside it. 2) The executor decides how the agent behaves. It assembles the prompt, calls the model, dispatches tools, and manages memory. The agent can rewrite any of that, and you can swap the executor for another harness. 3) The sandbox runs the important work. Packages, files, and commands execute in an isolated machine you can snapshot and rewind. You can do many things with that setup. - Fork a conversation from any event and run two versions of the same task - Roll back to the event right before an agent broke itself - Resume a conversation weeks later with its full history and its own mount - Read which commands actually ran from tool_requested and tool_result Agents will keep taking on more of their own configuration, and that raises the bar for the harness underneath them. It reaches a point where an event log, forking, and rollback are must-haves.

💬 3 2 7👁 1175

Christian Bromann

@bromann

11일 전

Starting today, a @LangChain 's Managed Deep Agent deploy provisions your Slack app for you No manifest. No OAuth redirects. No bot tokens to copy around. One command, and your agent says in Slack.

트윗에 첨부된 이미지
💬 0 7 15👁 1903

📈 에이전트와 모델 작업의 터미널·소형 기기 확장포스트 4

llama.cpp 문서의 추론 최적화 자료, ElevenLabs CLI, OpenResearch의 연구 에이전트 기능, Grok의 ESP32-S용 DOOM 포팅이 한 흐름으로 묶였다. 모델 작업을 웹 인터페이스에 한정하지 않고 터미널·격리 환경·소형 기기에서 직접 실행하려는 사례들이다.

세부 내용 보기
  • llama.cpp 문서의 새 경로에는 speculative decoding, k-quant·i-quant 양자화, coding agents 관련 자료가 추가될 예정이다. 보조 모델의 후보 생성과 큰 모델의 검증으로 디코딩을 가속하고, 낮은 비트 표현으로 메모리·연산량을 줄이는 추론 경로를 한 문서 공간에 모으는 구성이다.
  • ElevenLabs CLI v1은 전체 ElevenLabs API를 터미널에서 호출하게 하며, 구조화된 JSON·dry run·문서화된 명령·에이전트 스킬을 제공한다. 사용자는 실제 작업 전에 실행 결과를 미리 확인하고, coding agent는 터미널 명령으로 음성 관련 workflow를 연결할 수 있는 형태다.
  • OpenResearch는 Claude Code 또는 Codex를 연구 에이전트로 바꿔 실험 트리를 만들고, 수행 결과를 정리할 LaTex를 작성하며, 한 workspace에서 과정을 실시간으로 확인하게 한다. 별도 사례에서는 Grok @bot이 ESP32-S에서 DOOM 전체를 높은 프레임률로 포팅해 소형 장치에서 코드 생성·이식 작업을 수행했다.
원문 트윗 2개 보기

LLM 기초 학습을 위한 내적 Attention 자료포스트 4

François Chollet이 Deep Learning with Python의 15~16장을 LLM을 처음부터 배우려는 독자에게 추천했고, 여러 사용자가 내적 Attention 설명의 직관성을 재확산했다. 해당 장은 초보자가 앞선 장으로 되돌아갈 수 있는 독립적인 학습 경로로 소개됐다.

세부 내용 보기
  • 추천 자료는 Deep Learning with Python의 15~16장으로, 15장은 dot-product attention이 작동하는 이유를 설명하고 16장은 text generation을 다룬다. 책 안에서 개념이 처음 등장한 장으로 되돌아갈 수 있도록 구성해 LLM의 구성 요소를 처음부터 따라가는 입력 경로를 제공한다.
  • dot-product attention은 쿼리와 키의 내적을 이용해 관련도를 계산하고 그 결과로 값 벡터를 합성하는 방식이다. Chollet의 추천은 특정 모델의 성능 수치보다 이 계산 원리를 직관적으로 이해하는 데 초점을 맞추며, 독립적으로 읽을 수 있는 입문 자료라는 점을 근거로 삼는다.
  • 같은 링크를 인용한 포스트들이 책의 설명을 직관적이고 초보자에게 접근하기 쉬운 자료로 평가했다. 반응 수는 크지 않았지만 여러 계정에서 반복 공유돼 LLM 내부 원리를 직접 학습하려는 수요가 이어지고 있음을 나타냈다.
원문 트윗 2개 보기

용어 해설

에이전트형 AI(Agentic AI)
사용자의 한 번 요청에 답하는 데 그치지 않고 여러 단계에 걸쳐 계획을 세우고 도구를 호출하며 코드를 실행하는 AI 시스템입니다. 작업이 길어질수록 문맥과 실행 상태를 계속 유지해야 합니다.
추측 디코딩(Speculative Decoding)
작은 보조 모델이 다음 토큰 후보를 먼저 생성하고 큰 모델이 이를 한꺼번에 검증하는 추론 기법입니다. 큰 모델의 순차 계산을 일부 건너뛰어 출력 속도를 높이는 방식입니다.
양자화(Quantization)
모델 가중치와 활성값을 더 낮은 비트 수로 표현해 메모리 사용량과 연산량을 줄이는 최적화 기법입니다. 정밀도 감소와 하드웨어 효율 사이의 균형이 핵심입니다.
재귀적 자기개선(Recursive Self-Improvement)
에이전트가 자신의 프롬프트·도구·메모리 같은 실행 구성을 수정하고 다음 작업에 반영하는 순환 구조입니다. 상태 보존과 이전 시점으로의 복구 장치가 없으면 자기 수정 과정의 실패를 되돌리기 어렵습니다.
내적 어텐션(Dot-Product Attention)
쿼리와 키의 벡터 내적을 이용해 입력 요소별 관련도를 계산하고, 그 가중치로 값 벡터를 합성하는 Attention 방식입니다. Transformer가 문맥상 중요한 토큰에 계산을 집중하는 기본 원리입니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 25.수집 2026. 08. 25.출처 타입 TWITTER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.