본문으로 건너뛰기

Starbase Louisiana, Jalapeño, Claude 메모리와 로컬 에이전트 실행

발사 인프라·추론 칩·공유 메모리·로컬 에이전트 런타임의 동시 확장

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이번 포스트는 Starship 발사 빈도를 높이기 위한 SpaceX의 Starbase Louisiana 계획과 OpenAI의 자체 추론 칩 Jalapeño 성능 결과에 관심이 집중됐습니다. Claude는 Chat과 Claude Cowork 사이에 사용자가 읽고 수정할 수 있는 공유 메모리를 제공하기 시작했고, Perplexity는 오케스트레이터·하위 에이전트·하네스를 NVIDIA DGX Spark에서 모두 실행하는 Portable Computer를 내놓았습니다. 에이전트 개발 쪽에서는 실제 데이터와 사람 피드백으로 환경과 평가를 생성하는 eval-engineering 흐름, append-only event log와 영속 Python kernel을 이용한 문맥 관리 연구가 이어졌습니다. S1의 한 예시 기반 로봇 학습, Qwen3.8 계열의 로컬 실행·Fine-tuning, Jetson Orin Nano 2 같은 엣지 하드웨어도 함께 등장했습니다.

𝕏 실시간 트렌드 토픽

🔥 Starbase Louisiana의 초고빈도 Starship 발사 인프라포스트 6

SpaceX가 Louisiana에 Starship 전용 고빈도 발사장을 세워 지구 궤도·달·화성 임무를 반복 수행하려는 계획을 공개했습니다. 여러 발사 타워와 하루 30회 이상의 비행 목표가 핵심으로 묶였습니다.

  • SpaceX는 Louisiana에 Starship 발사장을 새로 구축해 기존 발사 경험과 운영 cadence를 더 높은 빈도로 확장하려고 합니다. 새 시설은 지구 궤도뿐 아니라 달·화성·그 너머를 향한 임무를 지원하도록 설계됐으며, 핵심 문제는 우주선 자체보다 반복 발사를 감당할 지상 인프라를 확보하는 데 있습니다.
  • 계획상 Starbase Louisiana에는 최종적으로 12개가 넘는 발사 타워가 들어서고, 각 타워가 Starship 발사 회전율을 높이는 구조입니다. SpaceX는 연간 수천 회의 Starship 비행과 하루 30회 이상의 비행을 목표로 제시했으며, 2027년 착공과 2029년 첫 발사 일정은 인용된 게시물에 함께 언급됐습니다.
  • Louisiana 출신 게시자는 Texas의 Starbase와 Cape·Vandenberg에서 얻은 경험과 발사 빈도 운영 지식을 새 부지에 반영한다고 설명했습니다. 따라서 이번 계획은 단순한 신규 우주항이 아니라, Starship을 반복 사용해 행성 간 이동을 지원하려는 발사 운영 체계의 확장으로 읽힙니다.
찬성다수

Starbase Louisiana를 Starship의 반복 발사에 맞춰 설계된 기반 시설로 평가합니다. 여러 타워와 대규모 발사 빈도가 지구 궤도·달·화성 임무의 실행 규모를 키울 수 있다는 관점입니다.

원문 트윗 2개 보기

🔥 OpenAI Jalapeño 추론 칩의 전력·지연 성능과 배치 계획포스트 7

OpenAI가 자체 추론 칩 Jalapeño의 첫 측정 결과를 공개하며 전력당 지능·처리량과 응답 속도를 함께 개선했다고 밝혔습니다. 연말부터 OpenAI 컴퓨팅 인프라에 배치하고 차세대 칩 개발을 이어갈 계획입니다.

  • OpenAI는 외부 칩 의존도와 증가하는 추론 수요를 배경으로 첫 자체 추론 칩 Jalapeño를 개발하고 시스템 전체를 시험했습니다. 칩과 시스템을 하나의 아키텍처로 묶어 전력당 처리량을 높이고 token latency를 낮추는 방식이며, 효율을 포기하지 않고 두 지표를 함께 개선하는 것이 목표입니다.
  • 공개된 설명에 따르면 Jalapeño는 더 높은 throughput과 더 낮은 latency를 동시에 달성했고, ChatGPT 응답·Codex 세션·에이전트의 반응성을 높이는 용도로 연결됩니다. 별도 인용에서는 공개 benchmark InferenceX와 GPT‑OSS 120B를 사용한 성능 수치가 언급됐지만, 제공된 포스트에는 구체적인 비교 숫자가 모두 담기지 않았습니다.
  • OpenAI는 Jalapeño를 연말까지 자사 compute infrastructure에 배치할 계획이며, Gen 2는 개발이 깊게 진행 중이고 Gen 3도 형태를 갖추는 단계라고 밝혔습니다. 추론 칩 세대가 이어지면 모델 서비스 수요 증가에 대응하는 속도와 전력 효율을 하드웨어 로드맵 안에서 함께 관리하게 됩니다.
찬성다수

Jalapeño를 전력당 처리량과 token latency를 동시에 개선하는 OpenAI의 인프라 전략으로 평가합니다. ChatGPT와 Codex, 에이전트의 응답성 개선 및 장기적인 칩 세대 확장이 기대된다는 입장입니다.

중립소수

첫 결과가 공개됐지만 실제 시장 성능과 규모 효과를 판단하려면 InferenceX 측정과 배치 이후의 추가 검증이 필요하다는 태도입니다.

원문 트윗 2개 보기

🔥 Claude와 Claude Cowork를 잇는 사용자 제어형 공유 메모리포스트 4

Claude가 Chat과 Claude Cowork 사이에서 하나의 메모리를 공유해 프로젝트와 선호도를 다시 입력하지 않도록 했습니다. 메모리 항목은 Settings에서 읽고 수정하거나 삭제할 수 있으며 민감한 정보의 저장 여부도 사용자가 조정합니다.

  • 기존에는 Chat과 Cowork가 서로 다른 대화 맥락을 가질 때 프로젝트 설명이나 관리자의 선호도 같은 정보를 반복해서 전달해야 했습니다. Claude의 새 메모리는 두 환경에서 같은 사용자 정보를 참조해 Cowork가 이전 대화에서 축적한 맥락을 작업 시작점으로 사용하게 합니다.
  • 메모리는 Settings에 topic 목록으로 저장되고, 사용자는 각 항목을 읽거나 편집하거나 삭제할 수 있습니다. 대화 중 특정 내용을 저장하도록 직접 요청할 수도 있으며, 새 세부 정보는 대화 흐름에 따라 자동으로 메모리에 추가됩니다.
  • 건강 정보나 종교적 신념처럼 민감하다고 여겨지는 주제는 Settings에서 켜지 않는 한 메모리에서 제외됩니다. Free·Pro·Max 플랜에서는 메모리가 기본으로 켜져 있어 편의성과 사용자 통제 사이의 설정 구조가 함께 제공됩니다.
찬성다수

공유 메모리가 Chat과 Cowork 사이의 반복적인 맥락 전달을 줄이고 장기 프로젝트의 연속성을 높인다는 평가입니다.

중립소수

메모리가 자동으로 갱신되는 만큼 Settings에서 저장 내용을 확인하고 삭제하는 사용자 통제가 핵심이라는 관점입니다.

원문 트윗 2개 보기

📈 로컬 하드웨어로 옮겨가는 에이전트 실행과 모델 배포포스트 8

Perplexity의 Portable Computer가 오케스트레이터 LLM·하위 에이전트·하네스를 NVIDIA DGX Spark에서 모두 실행하는 로컬 런타임으로 출시됐습니다. Qwen3.8 계열의 로컬 Fine-tuning과 Jetson Orin Nano 2의 엣지 추론 성능도 같은 방향의 흐름으로 묶였습니다.

  • 클라우드 의존성과 추론 비용·전력 제약이 로컬 실행을 요구하는 배경으로 언급됐습니다. Portable Computer는 모델과 agent harness를 포함한 전체 런타임을 사용자의 NVIDIA DGX Spark에서 실행해 네트워크를 거치지 않고 에이전트 작업을 처리하는 구조입니다.
  • Perplexity와 NVIDIA는 DGX Spark에서 Portable Computer를 제공하고, 관련 게시물에서는 로컬 하드웨어가 frontier model까지 서비스할 수 있는 방향을 언급했습니다. 별도로 Unsloth는 Qwen3.8-27B를 24GB VRAM에서 Fine-tuning하고 50% 적은 VRAM과 1.5배 빠른 학습을 지원한다고 밝혔습니다.
  • NVIDIA Jetson Orin Nano 2는 같은 15W 모드에서 동일 성능을 유지하면서 전력 소비를 40% 낮추고, Jetson Orin Nano Super 대비 추론 성능을 2배로 높이는 엣지 로봇 컴퓨터로 발표됐습니다. Qwen3.8 Flash의 로컬 공개와 Hugging Face에서 양자화 모델 다운로드가 늘었다는 게시물까지 합쳐지며, 모델·런타임·하드웨어를 사용자 장비에 배치하려는 선택지가 넓어졌습니다.
찬성다수

에이전트 런타임과 모델을 로컬 하드웨어에서 실행하면 클라우드 의존성을 줄이고 전력·추론 비용 제약에 대응할 수 있다는 입장입니다.

중립소수

DGX Spark와 24GB VRAM 같은 구체적인 장비 조건이 붙어 있어 로컬 실행의 접근성은 하드웨어와 모델별로 달라진다는 관점입니다.

원문 트윗 2개 보기

📈 실제 데이터에서 에이전트 평가 환경을 만드는 eval-engineering 흐름포스트 3

에이전트의 trace와 사람 피드백을 이용해 실제 작업 환경과 평가 과제를 자동 생성하는 eval-engineering 방식이 공유됐습니다. 월드 지식·사양·실행 파이프라인·검증 점수를 연결해 에이전트를 반복 개선하는 구조입니다.

  • 장기 실행 에이전트의 성능을 측정하려면 정적인 테스트 몇 개보다 실제 에이전트가 상호작용할 환경과 과제가 필요하다는 문제의식에서 출발합니다. 이 방식은 시스템의 월드 지식을 모으고 World Spec·Task Spec으로 요구사항을 정리한 뒤 사람과 에이전트가 사양을 반복 편집합니다.
  • 합의된 Task Spec은 실행 파이프라인을 거쳐 환경과 task로 변환되고, 실제 에이전트를 환경에 투입해 설계 결함을 찾습니다. verifier 점수와 trace를 채굴해 과제와 환경을 수정하므로 입력 데이터가 평가 세트와 개선 루프로 이어집니다.
  • 관련 skill은 coding agent가 사람 피드백을 언제 요청할지, 사양에 어떤 내용을 담을지, 월드 지식을 어떻게 갱신할지까지 작업 흐름에 포함합니다. 팀이 보유한 데이터를 Tasks와 Environments로 바꾸면 에이전트의 후속 post-training과 평가를 자체 파이프라인 안에서 반복할 수 있다는 의미입니다.
찬성다수

실제 trace와 human feedback을 환경·평가 생성에 연결하면 에이전트 성능을 측정하고 개선하는 루프를 빠르게 구축할 수 있다는 입장입니다.

원문 트윗 2개 보기

Viv

@Vtrivedy10

14시간 전

this is a practical guide (+ updated skill) on how we use real world data like traces + human feedback to make synthetic environments + evals so we can measure, harness engineer, and post-train our agents a few main components: - World Knowledge gathering of the systems our agent will interact with - Using Specs to coordinate what will be built —> World Spec & Task Spec - Human-Agent collaboration to iteratively edit a Spec and infuse human feedback - An execution pipeline that takes an agreed on Task Spec and generates an environment + task - Fixing design flaws in the task and environment by actually running agents in the environment & mining the verifier scoring + traces @harrison_chase , @nick_hollon and I spent a ton of time going back and forth on design decisions and the overall flow - how much a coding agent should prompt for human feedback - what specs do we need and what do they contain - how to create and update world knowledge this new flow is packaged in our updated eval-engineering skill. we want to help every team own their intelligence which means owning the pipeline to convert their valuable data into Tasks+Environments that improve their agent over time check out the skill and reach out if you’re thinking about this! https:// skills.sh/langchain-ai/l angchain-skills/eval-engineering …

💬 0 3 4👁 221

Nick Hollon

@nickhollon10

14시간 전

@Vtrivedy10 and I have spent a lot of time thinking about how to efficiently build evals and environments. our eval-engineering skill detailed here helps spin the environment generation loop very quickly!

💬 1 2 2👁 127

Append-Only Event Log 기반 에이전트 문맥 관리포스트 1

Alibaba 접근법은 에이전트 세션을 추가 전용 이벤트 로그와 영속 Python kernel로 뒷받침하고, 필요한 정보만 working view에 투영합니다. Qwen3.8-Max 평가에서 LongMemEval_S 94.8%, BEAM_10M 73.1%, LOCA_256K 86.7%를 기록했다는 결과가 공유됐습니다.

  • 장기 실행 에이전트는 대화가 길어질수록 메모리 스키마를 계속 다시 쓰거나 모든 기록을 prompt에 직렬화해야 하는 문제가 생깁니다. 이 접근법은 도구 출력·검색된 기록·파생 상태를 model call 사이의 typed variable로 유지하고, 원본 세션은 append-only event log에 손실 없이 보관합니다.
  • 모델이 작성한 코드는 저장된 상태를 검색하고 변환하며, 명시적으로 출력한 projection만 현재 working view에 들어갑니다. working view가 예산에 가까워지면 오래된 구간을 제거하지만, eviction index가 압축된 landmark를 정확한 event-log 주소와 연결해 필요한 구간으로 바로 돌아가게 합니다.
  • Qwen3.8-Max 기준 성능은 LongMemEval_S 94.8%, BEAM_10M 73.1%, LOCA_256K 86.7%로 제시됐고, BEAM_10M에서는 공개된 최선의 memory system보다 5.1포인트 높았다고 기록됐습니다. 문맥 관리를 프로그래밍 과제로 바꾸면 모델의 coding 능력 개선을 메모리 처리에도 이어갈 수 있다는 설계 논리가 핵심입니다.
찬성다수

문맥 관리를 prompt 압축 문제가 아니라 event log와 코드 실행을 이용한 상태 관리 문제로 바꾸면 장기 기억의 손실과 검색 비용을 함께 줄일 수 있다는 입장입니다.

원문 트윗 1개 보기

📈 한 개 영상 예시로 작업을 익히는 S1 로봇 모델포스트 1

SkildAI가 Fine-tuning 없이 한 개의 영상 프롬프트로 처음 보는 10분 길이 작업을 학습하는 foundation model S1을 공개했습니다. 실시간 In-Context Learning으로 로봇 작업을 수행하는 방식입니다.

  • 로봇이 사전에 보지 못한 작업을 수행하려면 작업별 Fine-tuning이나 별도 데이터 수집이 필요하다는 제약이 있습니다. S1은 영상 한 개를 입력으로 받아 작업 절차를 In-Context Learning하고, 기존 가중치를 다시 학습하지 않은 채 새로운 작업을 실행하도록 설계됐습니다.
  • 입력은 한 개의 영상 프롬프트이며, 모델은 그 안의 작업 정보를 문맥으로 사용해 최대 10분 길이의 낯선 task를 익힙니다. 게시물은 S1이 이 과정을 거친 뒤 실시간으로 작동하는 모습을 제공한다고 밝혔지만, 정확도나 성공률 수치는 제시하지 않았습니다.
원문 트윗 1개 보기

ElevenLabs의 음악 편집과 기업용 에이전트 확장포스트 2

ElevenLabs가 가사·트랙·빈 페이지·prompt에서 시작해 곡을 구간별로 편집하는 Composer를 출시했습니다. Stripe는 ElevenAgents를 고객 상호작용에, ElevenCreative를 브랜드·마케팅 작업에 사용하기 시작했습니다.

  • Composer는 완성된 곡을 한 번에 생성하는 대신 section-by-section 편집 흐름을 제공합니다. 사용자는 자신의 lyrics나 track, 빈 페이지 또는 prompt를 입력한 뒤 곡의 각 구간을 순서대로 조정해 최종 트랙을 만드는 방식입니다.
  • Stripe 관련 발표에서는 ElevenLabs가 고객 상호작용을 위한 ElevenAgents와 브랜드·마케팅 작업을 위한 ElevenCreative를 제공한다고 밝혔습니다. Stripe의 결제 인프라 위에서 운영되는 기업 고객 접점을 음성·창작 도구로 확장하는 사용 사례가 함께 언급됐습니다.
원문 트윗 2개 보기

용어 해설

고빈도 발사장(High-Cadence Launch Site)
짧은 간격으로 반복 발사를 수행하도록 설계한 우주 발사 시설입니다. 발사 타워와 지상 운영 체계를 확장해 Starship의 지구 궤도·달·화성 임무를 지원하는 기반으로 쓰입니다.
추론 칩(Inference Chip)
학습이 끝난 AI 모델의 응답 생성을 실행하는 전용 반도체입니다. Jalapeño는 전력당 처리량과 토큰 지연을 함께 개선하는 OpenAI의 자체 추론 칩으로 소개됐습니다.
In-Context Learning
모델 가중치를 Fine-tuning하지 않고 입력에 포함된 예시나 영상에서 작업 방식을 파악하는 방식입니다. S1은 한 개의 영상 프롬프트로 본 적 없는 10분 길이 작업을 학습합니다.
에이전트 런타임(Agent Runtime)
오케스트레이터 모델, 하위 에이전트, 도구 실행 하네스가 실제 작업을 처리하는 실행 계층입니다. Portable Computer는 이 구성 전체를 클라우드가 아닌 로컬 하드웨어에서 실행합니다.
추가 전용 이벤트 로그(Append-Only Event Log)
에이전트 세션의 도구 출력과 검색 기록을 삭제하지 않고 순서대로 쌓는 저장 방식입니다. 작업 중 필요한 정보만 현재 문맥으로 투영하고, 원본 기록은 나중에 다시 찾을 수 있도록 보존합니다.
평가 엔지니어링(Eval Engineering)
실제 사용 데이터와 사람 피드백을 이용해 에이전트가 작동할 환경과 평가 과제를 만드는 방법론입니다. 월드 지식·사양·실행 파이프라인·검증 점수와 trace를 연결해 반복 개선합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 26.수집 2026. 08. 26.출처 타입 TWITTER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.