본문으로 건너뛰기
OpenAI조회 1

풍부한 지능을 만드는 전체 스택

OpenAI가 Jalapeño 추론 칩과 다중 Compute 공급망을 결합해 AI 처리량·지연시간·전력 효율·서비스 비용을 함께 최적화하는 전략을 공개했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

OpenAI는 데이터센터와 칩, 모델, Serving Software, 제품을 함께 개선하는 통합 Compute 전략을 제시했습니다. 첫 자체 추론 칩 Jalapeño는 InferenceX에서 GPT‑OSS 120B를 실행할 때 비교 상용 시스템보다 와트당 최고 처리량이 높고 토큰 지연시간이 낮았으며, DeepSeek R1과 Kimi K2에서도 강한 성능을 기록했습니다. OpenAI는 자체 실리콘과 Microsoft·NVIDIA·AWS·AMD 등 다중 공급자 포트폴리오를 작업별로 배분해 성능과 비용을 조정합니다. GPT‑5.6 Sol이 출력 토큰을 54% 줄인 사례처럼 효율 향상은 성공 작업당 비용을 낮추고 더 많은 AI 활용과 후속 연구·인프라 투자를 가능하게 하는 순환으로 이어집니다.

빠른 이해

새로운 점

OpenAI가 자체 추론 칩 Jalapeño의 공개 벤치마크 측정 결과를 바탕으로 모델·소프트웨어·하드웨어·데이터센터를 함께 최적화하는 Compute 전략을 구체화했습니다.

핵심 메커니즘

OpenAI는 모델을 데이터센터와 칩 위에서 실행하고 그 결과로 얻은 처리량·지연시간·전력 효율·비용 신호를 다시 모델과 Serving Software 설계에 반영하는 통합 구조를 구축합니다. Jalapeño는 GPT‑OSS 120B 같은 모델의 요청을 전용 하드웨어와 메모리·네트워크 조합으로 처리해 출력 속도와 와트당 처리량을 높이고, 공급자별 시스템은 작업 특성에 따라 배치됩니다. 그 결과 단위 Compute에서 더 많은 유용한 작업을 완료하고, 낮아진 성공 작업당 비용을 제품 사용 확대와 연구·인프라·Safety 투자로 연결하는 순환이 형성됩니다.

핵심 수치

  • Jalapeño InferenceX 성능: GPT‑OSS 120B에서 비교 상용 시스템보다 높은 와트당 최고 처리량과 낮은 토큰 지연시간- DeepSeek R1과 Kimi K2에서도 강한 성능 기록
  • GPT‑5.6 Sol 출력 토큰: 다른 선도 모델보다 54% 적은 출력 토큰- Artificial Analysis Coding Agent Index, Max Reasoning 설정

섹션별 상세

01

AI 전체 스택 통합 전략

OpenAI는 데이터센터와 칩, Frontier Model, Developer Platform, 소비자·기업용 제품, AI 전용 디바이스를 하나의 연결된 시스템으로 운영하는 Compute 전략을 제시했습니다. 소프트웨어가 하드웨어 생산성을 높이면 전용 하드웨어가 속도와 효율을 개선하고, 더 강력한 모델은 제품 사용량과 학습 신호를 늘리는 순환 구조입니다. 이 흐름에서 데이터센터의 연산 자원은 모델 실행뿐 아니라 제품 수요와 개선 신호를 다시 연구·인프라 투자로 연결하는 기반이 됩니다. 따라서 개별 부품의 최고 성능보다 전체 시스템에서 단위 Compute가 만들어내는 유용한 지능의 양이 핵심 기준이 됩니다.
02

Jalapeño의 첫 추론 성능 결과

OpenAI는 첫 자체 추론 칩 Jalapeño의 측정 결과를 공개하고, 공개 벤치마크 InferenceX에서 GPT‑OSS 120B를 실행한 결과를 상용 비교 시스템과 대조했습니다. Jalapeño는 와트당 최고 처리량이 더 높았고 토큰 지연시간은 더 낮았으며, DeepSeek R1과 Kimi K2에서도 강한 성능을 기록해 한 모델에만 국한되지 않은 결과를 냈습니다. 칩만 따로 설계하지 않고 모델·Serving Software·메모리·네트워크를 함께 조정하면 처리량, 지연시간, 에너지 효율, 비용을 하나의 최적화 문제로 다룰 수 있습니다. 실제 측정값을 확보한 First-Party Silicon이 작동 단계에 들어섰고 후속 세대 개발도 진행 중이라는 점에서, OpenAI가 추론 인프라 선택지를 넓힌 결과입니다.
03

다중 공급망과 데이터센터 운영

Frontier Training, 대규모 Inference, 상시 실행 Agent는 칩·소프트웨어·네트워크·전력·지연시간에서 서로 다른 요구를 가지므로 단일 공급자만으로 모든 작업을 최적화하기 어렵습니다. OpenAI는 Microsoft의 Compute와 NVIDIA의 칩을 비롯해 AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy, SoftBank를 포트폴리오에 포함하고 작업별로 성능과 비용을 배분합니다. 역량이 중요한 작업에는 고성능 시스템을 쓰고 규모와 비용이 중요한 작업에는 효율 중심 구성을 적용해 달러당 성능을 관리합니다. 조지아의 Project Camellia는 고객 작업에 맞춘 시설 설계, 지역 일자리와 인프라·에너지 비용 부담, 물 절약형 폐쇄 순환 시스템, 연례 독립 공개 감사를 결합한 데이터센터 사례입니다.
04

효율을 유용한 지능으로 전환

AI 시스템의 경제적 가치는 같은 연산량으로 얼마나 많은 유용한 작업을 끝내는지에 따라 결정되며, 더 나은 모델은 적은 시도로 정답에 도달하고 지능형 Routing과 Context Management는 불필요한 계산을 줄입니다. 최적화된 소프트웨어와 작업 전용 하드웨어가 처리 속도와 에너지 효율을 함께 높이면 사용자는 더 빠른 결과, 적은 재시도, 긴 Agent Workflow 완료, 낮은 성공 작업당 총비용을 얻습니다. Artificial Analysis Coding Agent Index에서 GPT‑5.6 Sol은 Max Reasoning 설정으로 높은 점수를 기록하면서 다른 선도 모델보다 출력 토큰을 54% 적게 사용했습니다. OpenAI는 이런 효율 향상이 모든 고객 대상 맞춤형 분석, 전체 계약 검토, 실시간 금융 시나리오, 더 많은 엔지니어링 실험처럼 기존에 비용 부담이 컸던 작업을 경제적으로 만든다고 연결합니다.
05

효율 향상과 재투자의 순환

더 생산적인 Compute와 경쟁적인 공급 기반은 OpenAI가 더 많은 고객에게 낮은 비용으로 서비스를 제공하게 하고, 절감된 효율을 사용자에게 전달할 여지를 만듭니다. 사용 가능한 지능의 가격이 내려가면 기업은 더 많은 업무를 AI에 맡기게 되므로 효율 상승이 총수요 감소로만 이어지지 않고 처리 작업과 경제 활동의 확대를 부를 수 있습니다. OpenAI는 이 현상을 Jevons Paradox와 연결하며, 더 나은 경제성이 연구·인프라·Safety에 대한 추가 투자를 뒷받침한다고 설명합니다. 기술 개선이 비용 구조를 바꾸고 그 수익성이 다음 연구와 인프라 투자를 지원하는 순환이 OpenAI가 말하는 누적 우위입니다.

용어 해설

추론 칩(Inference Chip)
학습이 끝난 AI 모델의 응답을 계산하는 전용 반도체입니다. 모델 실행에 필요한 메모리·연산·통신을 특정 작업에 맞게 설계해 상용 가속기보다 지연시간, 처리량, 전력 효율, 서비스 비용을 개선하는 데 쓰입니다.
토큰 지연시간(Token Latency)
AI 모델이 출력 토큰을 생성하는 데 걸리는 시간입니다. 같은 요청에서 토큰이 사용자에게 도착하는 속도를 나타내므로, 대화형 서비스와 실시간 Agent의 반응성을 평가하는 핵심 지표로 사용됩니다.
파레토 프론티어(Pareto Frontier)
성능·속도·신뢰성·전력 효율·비용처럼 서로 충돌할 수 있는 여러 기준을 동시에 고려할 때, 어느 한 기준을 개선하려면 다른 기준을 희생해야 하는 최적의 선택 범위입니다.
제번스 역설(Jevons Paradox)
기술 효율이 높아져 단위 작업의 비용이 낮아지면 전체 사용량이 오히려 늘어나는 현상입니다. AI 추론 비용이 내려가면 기존에는 경제성이 낮던 맞춤형 분석이나 반복 검토까지 활용 범위가 넓어질 수 있습니다.
폐쇄형 물 순환 시스템(Closed-Loop Water System)
데이터센터에서 사용한 물을 외부로 바로 배출하지 않고 정화·순환해 냉각에 다시 쓰는 운영 방식입니다. Project Camellia는 이 방식을 시설 설계에 포함하고 연례 독립 공개 감사를 받도록 했습니다.

기술

  • Jalapeño
  • InferenceX
  • GPT‑OSS 120B
  • DeepSeek R1
  • Kimi K2
  • GPT‑5.6 Sol
  • Artificial Analysis Coding Agent Index
  • Frontier Training
  • Inference
  • Serving Software
  • Context Management

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 08. 26.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.