학습보다 어려운 추론? AI 모델의 핵심 원리와 실행의 비밀
AI 모델이 데이터를 통해 가중치를 학습하는 원리와 실제 서비스 단계인 추론이 왜 기술적으로 더 어려운지 설명한다.
엔비디아 GPU 이외의 대안 하드웨어(RDU)를 통한 고성능 AI 추론 및 오픈소스 모델 최적화 전략
AI 모델이 데이터를 통해 가중치를 학습하는 원리와 실제 서비스 단계인 추론이 왜 기술적으로 더 어려운지 설명한다.
LLM이 텍스트를 토큰으로 처리하고 트랜스포머 아키텍처를 통해 다음 토큰을 예측하며 응답을 생성하는 기본 원리와 추론 과정의 공학적 과제를 다룬다.
LLM 추론 시 토큰 생성 과정을 데이터플로우 그래프의 노드와 의존성 관계로 정의하고 병렬 실행이 성능에 미치는 영향을 설명한다.
Nvidia B200과 SambaNova SN40을 결합하여 기존 대비 2배 빠른 추론 속도를 구현한 하이브리드 아키텍처 데모이다.
AI 인프라가 학습에서 추론 중심으로 이동함에 따라, 삼바노바는 고전력 GPU 대신 저전력·고효율 추론 전용 하드웨어로 데이터센터 병목 현상을 해결한다.
AI 추론 워크로드가 에이전트 기반으로 복잡해짐에 따라 CPU, GPU, RDU를 조합한 이기종 인프라가 추론 효율과 속도를 최적화한다.
Gradio 6의 새로운 기능과 SambaNova의 고성능 추론 인프라를 결합하여 실무급 AI 애플리케이션을 신속하게 개발하고 배포하는 방법을 다룹니다.