TL;DR
이번 Latent Space 주간 정리는 OpenAI의 자체 추론 칩 Jalapeño를 중심으로 AI 인프라의 경쟁 기준이 절대 처리량에서 와트당 성능과 지연 시간의 균형으로 이동하는 흐름을 짚습니다. Jalapeño는 GPT-OSS 120B 비교에서 1.9배, DeepSeek R1 670B에서 1.7배, Kimi K2.5 1T에서 1.5배 높은 와트당 처리량을 기록했으며 GPT-Astra와 Codex가 저수준 Kernel 최적화에도 참여했습니다. 동시에 Agent Harness, 메모리 시스템, 평가 설계가 모델 자체만큼 중요한 요소로 부상했고, SWE Refactor Bench의 5.4% 생존율은 장기 코딩 작업의 난도를 드러냈습니다. Portable Computer와 Qwen3.8, Papers with Code 검색 인프라는 로컬 실행과 저비용 모델 배포의 확장을 보여주며, Figure의 Index와 물리 시뮬레이션 모델은 데이터와 Context 규모가 로봇·Embodied AI의 다음 병목이 될 가능성을 시사합니다.
섹션별 상세

용어 해설
- 와트당 성능(Performance per watt)
- — 소비 전력 1W로 처리하는 작업량을 나타내는 지표입니다. AI 추론에서는 처리량과 전력 효율을 함께 평가해 데이터센터 운영비와 확장성을 판단하는 데 활용합니다.
- Prefill·Decode 분리(Prefill/decode disaggregation)
- — 입력 프롬프트를 처리하는 Prefill 단계와 새 토큰을 생성하는 Decode 단계를 서로 다른 자원이나 장치에서 실행하는 방식입니다. 처리량과 지연 시간을 조정하는 데 쓰입니다.
- 에이전트 하네스(Agent harness)
- — 에이전트가 모델 호출, 도구 사용, 프롬프트 구성, 상태 관리, 제어 로직을 수행하도록 감싸는 실행 시스템입니다. 같은 모델도 하네스에 따라 평가 점수가 크게 달라질 수 있습니다.
- Late interaction 검색(Late interaction retrieval)
- — 문서와 질의를 단일 벡터로 압축하지 않고 여러 토큰 벡터를 유지한 뒤 검색 단계에서 세밀하게 비교하는 방식입니다. 검색 정확도와 저장·계산 비용 사이의 균형이 핵심입니다.
- QLoRA
- — 양자화한 모델을 유지하면서 저순위 어댑터만 학습하는 Fine-tuning 방식입니다. 원문에서는 Qwen3.8-27B를 무료 Kaggle 환경의 2개 Tesla T4에서 학습할 수 있다는 사례와 함께 등장합니다.
기술
- Jalapeño
- GPT-Astra
- Codex
- GB200
- GB300
- Blackwell
- Rubin
- AutoSaddler
- GAIA2
- SWE-Bench Pro
- Terminal-Bench 2.0
- SWE Refactor Bench
- LongMemEval_S
- BEAM_10M
- LOCA_256K
- Qwen3.8
- QLoRA
- Tesla T4
- PostgreSQL
- pgvector
- Qwen 3 Embedding 0.6B
- NVIDIA L4
- Hugging Face Jobs
- Inference Endpoints
- Web Search API
- Web Query Language
- Index
- Accelerated Understanding
- S1
- AgentHands
- Ollama
- Claude Desktop
- OpenCode v2
- Cloudflare Durable Object
- RDMA
- Thunderbolt 5
- Kimi K3
- GLM-5.3
- M5 Ultra
- M6
- M5 Pro Mac Mini
- ANE
활용 사례
- 대규모 LLM 추론 인프라
- 대화형 에이전트의 저지연 실행
- 저수준 Kernel과 컴파일러 최적화
- 장기 소프트웨어 저장소 마이그레이션
- 로컬 하드웨어 기반 개인용 에이전트
- 에이전트 메모리와 상태 관리
- 검색 증강 생성과 웹 검색
- 로봇 시연 데이터 수집
- 물리 시뮬레이션과 Embodied AI
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.