본문으로 건너뛰기
TechCrunch AI조회 7

아마존 AWS 오스틴 칩 연구소 탐방: NVIDIA에 도전하는 Trainium의 심장부

아마존 AWS의 커스텀 AI 칩 개발 거점인 오스틴 연구소를 통해 Trainium3의 기술적 혁신과 OpenAI 및 Anthropic과의 전략적 협력 관계를 조명한다.

섹션별 상세

Trainium3는 기존 공랭식의 한계를 극복하기 위해 수냉식 쿨링 시스템과 TSMC 3nm 공정을 도입했다. Neuron 스위치를 통한 메쉬 구조로 칩 간 통신 지연을 최소화하여 전력 대비 성능 기록을 경신 중이다. 이를 통해 대규모 토큰 처리 시 발생하는 인프라 비용을 획기적으로 낮췄다.
아마존의 최신 AI 가속기인 Trainium3 칩의 근접 촬영 사진이다.
PhotoTSMC 3nm 공정으로 제작된 Trainium3의 실물을 보여준다. 이전 세대보다 집적도가 높아졌으며 수냉식 쿨링 시스템과 결합되어 전력 효율을 극대화하도록 설계되었다.
AWS re:Invent에서 공개된 Trainium3 전용 서버 슬레드 유닛이다.
Photo실제 데이터 센터 랙에 장착되는 기본 단위인 슬레드의 최종 형태를 보여준다. 수냉식 배관 연결부와 고속 통신을 위한 커넥터 배치를 확인할 수 있다.
하드웨어 전환 비용을 낮추기 위해 PyTorch와 같은 오픈소스 프레임워크 지원을 강화했다. 개발자는 코드 한 줄 수정과 재컴파일만으로 기존 NVIDIA 기반 모델을 Trainium에서 실행할 수 있다. 이는 Hugging Face의 수많은 모델을 아마존 인프라로 유입시키는 핵심 전략이다.
아마존은 OpenAI에 2GW 규모의 Trainium 컴퓨팅 용량을 제공하기로 합의했다. 이미 Anthropic은 100만 개 이상의 Trainium2 칩을 사용하여 Claude 모델을 서비스하고 있다. 이러한 대형 AI 랩들과의 협력은 Trainium의 기술적 신뢰성을 입증하는 동시에 AWS Bedrock 서비스의 성장을 견인한다.
2015년 인수한 Annapurna Labs를 중심으로 10년 이상 칩 설계 노하우를 축적해왔다. 칩뿐만 아니라 서버 슬레드, 가상화 기술인 Nitro, 네트워크 스위치까지 직접 설계하여 전체 시스템 최적화를 달성했다. 오스틴 연구소에서는 18개월의 개발 주기 끝에 24/7 브링업 과정을 거쳐 칩의 완성도를 검증한다.
Trainium 칩과 각종 컴포넌트가 장착된 서버 슬레드의 내부 모습이다.
Photo칩이 단독으로 작동하는 것이 아니라 Nitro 시스템, 네트워크 스위치, 메모리 등과 어떻게 물리적으로 통합되는지 보여준다. 아마존이 칩뿐만 아니라 서버 아키텍처 전체를 직접 설계함을 입증한다.

용어 해설

트레이니움(Trainium)
아마존 AWS가 AI 모델의 대규모 학습 및 추론을 위해 자체 설계한 전용 가속기 칩이다. NVIDIA GPU에 대한 의존도를 낮추고 클라우드 환경에서 비용 효율적인 AI 연산을 제공하는 것이 핵심 목적이다.
브링업(Bring-up)
설계된 반도체 칩의 첫 시제품이 생산된 후, 처음으로 전원을 켜서 하드웨어와 소프트웨어가 의도대로 작동하는지 검증하는 초기 가동 단계다. 18개월 이상의 설계 노력이 결실을 맺는 가장 중요한 시점이다.
니트로(Nitro)
AWS 서버의 가상화 기능을 전용 하드웨어로 분리하여 처리하는 시스템이다. 메인 CPU의 부하를 줄여 성능을 극대화하고 보안을 강화하며, Trainium과 같은 커스텀 칩이 서버 내에서 효율적으로 작동하도록 돕는다.
뉴런 스위치(Neuron Switch)
Trainium 칩 간의 고속 통신을 가능하게 하는 전용 네트워크 구성 요소다. 칩들을 메쉬 구조로 연결하여 데이터 전송 지연을 최소화함으로써 대규모 클러스터에서 분산 학습 성능을 높이는 역할을 한다.
3나노 공정(3nm Process)
반도체 회로의 선폭을 3나노미터 수준으로 구현하는 최첨단 제조 공정이다. 선폭이 좁을수록 동일 면적에 더 많은 트랜지스터를 집적할 수 있어 전력 효율이 높아지고 연산 속도가 비약적으로 향상된다.

기술

  • Trainium3
  • Graviton
  • AWS Nitro
  • PyTorch
  • Neuron SDK
  • Liquid Cooling

활용 사례

  • 대규모 LLM 추론 서비스
  • 비용 효율적인 AI 모델 학습
  • 저지연 AI 에이전트 구동

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 22.수집 2026. 03. 23.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.