본문으로 건너뛰기

Jalapeño와 로컬 에이전트의 부상

Jalapeño의 와트당 처리량부터 로컬 에이전트와 로봇 데이터까지 AI 인프라의 경쟁축이 이동하고 있습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이번 Latent Space 주간 정리는 OpenAI의 자체 추론 칩 Jalapeño를 중심으로 AI 인프라의 경쟁 기준이 절대 처리량에서 와트당 성능과 지연 시간의 균형으로 이동하는 흐름을 짚습니다. Jalapeño는 GPT-OSS 120B 비교에서 1.9배, DeepSeek R1 670B에서 1.7배, Kimi K2.5 1T에서 1.5배 높은 와트당 처리량을 기록했으며 GPT-Astra와 Codex가 저수준 Kernel 최적화에도 참여했습니다. 동시에 Agent Harness, 메모리 시스템, 평가 설계가 모델 자체만큼 중요한 요소로 부상했고, SWE Refactor Bench의 5.4% 생존율은 장기 코딩 작업의 난도를 드러냈습니다. Portable Computer와 Qwen3.8, Papers with Code 검색 인프라는 로컬 실행과 저비용 모델 배포의 확장을 보여주며, Figure의 Index와 물리 시뮬레이션 모델은 데이터와 Context 규모가 로봇·Embodied AI의 다음 병목이 될 가능성을 시사합니다.

섹션별 상세

01
OpenAI의 첫 자체 추론 칩 Jalapeño는 단순한 최고 처리량 경쟁보다 와트당 성능과 응답 지연을 함께 개선하는 방향으로 설계됐습니다. 공개된 비교에서 GPT-OSS 120B는 초당·킬로와트당 혼합 토큰 85,448개를 처리해 기존 최고 시스템의 44,960개보다 1.9배 높았고, DeepSeek R1 670B와 Kimi K2.5 1T 비교에서도 각각 1.7배와 1.5배의 우위를 기록했습니다. 칩의 정격 전력은 700W지만 테스트 실행에서는 550W 이하로 동작했다는 설명이 더해져, 추론 인프라의 핵심 지표가 절대 성능에서 운영 효율로 이동하고 있음을 뒷받침합니다.
Jalapeño와 기존 최고 시스템의 플랫폼별 와트당 혼합 토큰 처리량을 비교한 막대그래프입니다.
Chart그래프는 GPT-OSS 120B에서 Jalapeño가 85,448 mixed tokens/second/kW로 기존 최고 시스템의 44,960보다 1.9배 높은 처리량을 보이는 점을 가장 크게 보여줍니다. DeepSeek R1 670B에서는 19,641 대 11,781로 1.7배, Kimi K2.5 1T에서는 18,195 대 11,862로 1.5배의 차이가 나타납니다. 본문이 강조한 추론 성능의 기준 이동, 즉 절대 처리량보다 전력당 처리량을 중시하는 흐름을 직접 뒷받침하는 자료입니다.
02
Jalapeño의 차별점은 처리량을 높이는 대신 대화형 지연 시간을 희생하던 전형적인 추론 구조의 균형을 다시 맞추려는 데 있습니다. 일부 비교에서는 공격적인 Prefill·Decode 분리나 speculative decoding 같은 최적화 없이도 해당 기법을 사용한 시스템을 앞선 것으로 평가됐으며, OpenAI는 높은 처리량과 낮은 종단 간 지연을 한 아키텍처에서 동시에 달성했다고 밝혔습니다. 자체 인프라 배치는 연말부터 시작되고 Gen 2는 개발 중이며 Gen 3도 진행 중이라는 로드맵은 OpenAI가 추론 비용과 하드웨어 설계를 직접 통제하려는 흐름으로 이어집니다.
03
모델이 애플리케이션 코드를 넘어 컴파일러와 저수준 Kernel 최적화에 개입하는 사례도 부각됐습니다. OpenAI의 설명에 따르면 GPT-Astra와 Codex가 Jalapeño용 Kernel을 작성하고 최적화해, 계획에 없던 오픈 모델 3개를 약 두 달 만에 높은 성능으로 구동했으며 일부 Attention과 MoE 블록은 기존 인간 전문가 코드보다 1.5~1.8배 빠르게 실행됐습니다. 이는 모델 개선 루프에 하드웨어별 코드 생성과 성능 튜닝이 결합되면서 추론 시스템의 최적화 방식 자체가 바뀌고 있음을 의미합니다.
04
에이전트 성능은 모델 선택만으로 결정되지 않고 Prompt, Tool 설정, 제어 로직, 상태 관리가 묶인 Harness의 품질에 크게 좌우됩니다. Microsoft가 주도한 AutoSaddler는 실패 기록을 바탕으로 오프라인에서 Harness 코드를 수정해 GAIA2에서 9.0점, SWE-Bench Pro에서 9.6점, Terminal-Bench 2.0에서 10.0점의 향상을 보고했으며, 별도 연구는 Harness를 바꾸는 편이 모델을 바꾸는 것보다 점수에 더 큰 영향을 줄 수 있다고 측정했습니다. 이에 따라 모델 이름과 함께 실행 구조를 공개하는 Harness Card 같은 평가 표준이 필요해지고 있습니다.
05
장기 소프트웨어 작업과 에이전트 메모리는 아직 강한 버그 수정 수치만으로 판단하기 어려운 수준입니다. SWE Refactor Bench는 C에서 Rust, Maven에서 Gradle, POSIX에서 WebAssembly로 전체 저장소를 이전하는 작업을 평가했는데, 520회 실행 중 세 단계를 모두 통과한 경우는 28회로 생존율 5.4%에 그쳤고 20개 과제 중 13개는 아무도 해결하지 못했습니다. 메모리 연구에서는 대화 기록을 계속 압축하는 대신 Append-only 이벤트 로그와 영속 Python Kernel에 도구 결과와 파생 상태를 타입 변수로 저장하는 구조가 제안됐으며, 단순 압축이 안전 규칙의 90%를 잃게 만들 수 있는 반면 타입 인지 보존 정책은 2~4배 더 많은 규칙을 유지했습니다.
06
Perplexity의 Portable Computer는 오케스트레이터 LLM, 하위 에이전트 LLM, Agent Harness를 모두 NVIDIA DGX Spark에서 실행하는 로컬 우선 제품으로 소개됐습니다. 초기 구성은 post-trained PPLX 27B를 사용하고 Qwen 3.8 27B도 선택할 수 있으며 Nemotron 3.5 Lightning 지원이 예정돼 있어, 클라우드 의존성을 줄인 개인용 에이전트 스택을 지향합니다. 다만 약 5,000달러 수준의 DGX Spark를 로컬 우선 컴퓨팅의 기준으로 삼는 것이 적절한지를 두고 프라이버시와 통제권을 중시하는 의견과 일반 소비자 기기를 요구하는 비판이 엇갈렸습니다.
07
Qwen3.8은 Fine-tuning, 추론, 애플리케이션 평가 전반에서 반복적으로 등장하며 오픈 모델 생태계의 활용 범위를 넓혔습니다. Together는 Qwen3.8-27B 전용 Fine-tuning과 추론을 제공하고 Unsloth는 최적화 Kernel을 사용해 무료 2× Tesla T4 Kaggle 환경에서 QLoRA 학습이 가능하다고 밝혔으며, Image-to-WebDev Arena에서는 오픈 모델 1위이자 전체 7위를 기록했습니다. 입력 토큰 100만 개당 0.40달러, 출력 토큰 100만 개당 3달러라는 가격도 모델 선택에서 성능뿐 아니라 배포 비용을 함께 비교하게 만드는 요소입니다.
08
검색 인프라는 PostgreSQL과 pgvector, Qwen 3 Embedding 0.6B, Hybrid Retrieval, NVIDIA L4 기반 Embedding 생성, Inference Endpoints를 결합하는 형태로 구체화되고 있습니다. Hugging Face의 Papers with Code 검색 시스템은 문서와 논문 관련 항목을 이 조합으로 검색하며, Keenable은 에이전트 규모의 웹 검색을 겨냥해 Web Search API와 Web Query Language를 공개했습니다. Late interaction과 Multivector Retrieval에 관한 논의도 이어지면서 저장 형식만이 아니라 Retrieval Model과 Database를 함께 설계하는 접근이 중요해지고 있습니다.
09
로봇 분야에서는 대규모 시연 데이터와 물리 세계 모델을 확보하려는 경쟁이 아키텍처 연구와 병행되고 있습니다. Figure의 Index는 초당 30분 분량의 동영상 업로드, 1,600만 건의 동영상 업로드, 데이터 제공자에게 지급한 1,500만 달러, 26만 4,000건의 다운로드를 내세웠고 향후 12개월 동안 데이터와 컴퓨팅에 10억 달러를 투자한다고 밝혔습니다. Accelerated Understanding은 물리 시뮬레이션을 위해 사전 학습 1T 파라미터, 학습 중 1T Context, 추론 중 5T 초과 Context를 주장했으며, S1과 AgentHands는 각각 단일 시연 기반 조작 일반화와 물리 작업용 동기화 손동작을 겨냥합니다.

용어 해설

와트당 성능(Performance per watt)
소비 전력 1W로 처리하는 작업량을 나타내는 지표입니다. AI 추론에서는 처리량과 전력 효율을 함께 평가해 데이터센터 운영비와 확장성을 판단하는 데 활용합니다.
Prefill·Decode 분리(Prefill/decode disaggregation)
입력 프롬프트를 처리하는 Prefill 단계와 새 토큰을 생성하는 Decode 단계를 서로 다른 자원이나 장치에서 실행하는 방식입니다. 처리량과 지연 시간을 조정하는 데 쓰입니다.
에이전트 하네스(Agent harness)
에이전트가 모델 호출, 도구 사용, 프롬프트 구성, 상태 관리, 제어 로직을 수행하도록 감싸는 실행 시스템입니다. 같은 모델도 하네스에 따라 평가 점수가 크게 달라질 수 있습니다.
Late interaction 검색(Late interaction retrieval)
문서와 질의를 단일 벡터로 압축하지 않고 여러 토큰 벡터를 유지한 뒤 검색 단계에서 세밀하게 비교하는 방식입니다. 검색 정확도와 저장·계산 비용 사이의 균형이 핵심입니다.
QLoRA
양자화한 모델을 유지하면서 저순위 어댑터만 학습하는 Fine-tuning 방식입니다. 원문에서는 Qwen3.8-27B를 무료 Kaggle 환경의 2개 Tesla T4에서 학습할 수 있다는 사례와 함께 등장합니다.

기술

  • Jalapeño
  • GPT-Astra
  • Codex
  • GB200
  • GB300
  • Blackwell
  • Rubin
  • AutoSaddler
  • GAIA2
  • SWE-Bench Pro
  • Terminal-Bench 2.0
  • SWE Refactor Bench
  • LongMemEval_S
  • BEAM_10M
  • LOCA_256K
  • Qwen3.8
  • QLoRA
  • Tesla T4
  • PostgreSQL
  • pgvector
  • Qwen 3 Embedding 0.6B
  • NVIDIA L4
  • Hugging Face Jobs
  • Inference Endpoints
  • Web Search API
  • Web Query Language
  • Index
  • Accelerated Understanding
  • S1
  • AgentHands
  • Ollama
  • Claude Desktop
  • OpenCode v2
  • Cloudflare Durable Object
  • RDMA
  • Thunderbolt 5
  • Kimi K3
  • GLM-5.3
  • M5 Ultra
  • M6
  • M5 Pro Mac Mini
  • ANE

활용 사례

  • 대규모 LLM 추론 인프라
  • 대화형 에이전트의 저지연 실행
  • 저수준 Kernel과 컴파일러 최적화
  • 장기 소프트웨어 저장소 마이그레이션
  • 로컬 하드웨어 기반 개인용 에이전트
  • 에이전트 메모리와 상태 관리
  • 검색 증강 생성과 웹 검색
  • 로봇 시연 데이터 수집
  • 물리 시뮬레이션과 Embodied AI
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 27.수집 2026. 08. 27.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.