섹션별 상세
FriendliAI는 기존 인프라를 vLLM에서 자사 플랫폼으로 전환할 경우 최대 3배의 처리량 향상과 50~90%의 비용 절감이 가능함을 강조한다. 특히 대규모 트래픽 환경에서 발생하는 지연 시간 변동성과 처리량 한계 문제를 해결하기 위해 설계되었다.
Qwen3 235B 모델을 4개의 H100 GPU에서 벤치마킹한 결과, FriendliAI는 vLLM 8-bit 대비 8-bit 설정에서 1.33배~2.11배, 4-bit 설정에서 최대 3.26배 높은 상대적 처리량을 기록했다. 이는 긴 출력 시나리오에서 특히 두드러진 성능 차이를 보인다.

플랫폼은 OpenAI API와 호환되도록 설계되어 기존 코드를 거의 수정하지 않고도 마이그레이션할 수 있다. 사용자는 단 3줄의 코드 변경만으로 50만 개 이상의 Hugging Face 모델 및 커스텀 모델을 즉시 배포하고 트래픽 기반 오토스케일링 기능을 활용할 수 있다.
LG AI Research의 EXAONE 모델 사례를 통해, FriendliAI 도입 후 모델 테스트 및 평가 기간을 수주 단축하고 사용자 만족도를 높인 실질적인 비즈니스 임팩트를 입증했다. 다른 고객사는 월간 수조 개의 토큰을 처리하면서 GPU 자원을 50% 절감하는 성과를 거두었다.
용어 해설
- 추론 엔진(Inference Engine)
- — 학습된 AI 모델을 실제 서비스 환경에서 실행하기 위해 최적화된 소프트웨어 스택이다. 모델의 연산 과정을 효율적으로 관리하여 응답 속도를 높이고 서버 자원 사용을 최적화하는 역할을 수행한다.
- 처리량(Throughput)
- — 단위 시간당 시스템이 처리할 수 있는 데이터나 요청의 양을 의미한다. LLM 환경에서는 보통 초당 처리되는 토큰 수(TPS)로 측정하며, 시스템의 확장성과 효율성을 판단하는 핵심 지표이다.
- 전문가 혼합(MoE)
- — Mixture of Experts의 약자로, 모델의 전체 파라미터 중 입력값에 적합한 일부 전문가 네트워크만 활성화하여 계산하는 아키텍처이다. 모델 크기를 키우면서도 추론 비용을 낮게 유지할 수 있는 장점이 있다.
- 양자화(Quantization)
- — 모델의 가중치를 높은 정밀도(예: 16비트)에서 낮은 정밀도(예: 4비트, 8비트)로 변환하는 기법이다. 메모리 사용량을 획기적으로 줄이고 연산 속도를 높여 저사양 하드웨어에서도 대형 모델을 구동할 수 있게 한다.
- 자동 확장(Autoscaling)
- — 실시간 트래픽 수요에 맞춰 컴퓨팅 자원을 자동으로 늘리거나 줄이는 기술이다. 사용자가 많을 때는 서버를 추가하여 성능을 유지하고, 사용자가 적을 때는 자원을 회수하여 비용을 절감한다.
기술
- FriendliAI
- vLLM
- Qwen3 235B
- H100 GPU
- OpenAI API
- Hugging Face
활용 사례
- 대규모 트래픽을 처리하는 챗봇 서비스
- 긴 문맥 처리가 필요한 에이전트 애플리케이션
- 오픈 소스 모델 기반의 비용 효율적 API 서버 구축
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 02. 26.수집 2026. 03. 06.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.