본문으로 건너뛰기
TLDR AI Feed조회 1

FriendliAI로 전환하고 최대 5만 달러의 추론 크레딧 혜택 받기

FriendliAI는 vLLM 대비 최대 3배의 처리량과 90%의 비용 절감을 제공하는 고성능 추론 플랫폼으로, 타 플랫폼 사용자를 위한 대규모 크레딧 지원 프로그램을 발표했다.

섹션별 상세

01
FriendliAI는 기존 인프라를 vLLM에서 자사 플랫폼으로 전환할 경우 최대 3배의 처리량 향상과 50~90%의 비용 절감이 가능함을 강조한다. 특히 대규모 트래픽 환경에서 발생하는 지연 시간 변동성과 처리량 한계 문제를 해결하기 위해 설계되었다.
02
Qwen3 235B 모델을 4개의 H100 GPU에서 벤치마킹한 결과, FriendliAI는 vLLM 8-bit 대비 8-bit 설정에서 1.33배~2.11배, 4-bit 설정에서 최대 3.26배 높은 상대적 처리량을 기록했다. 이는 긴 출력 시나리오에서 특히 두드러진 성능 차이를 보인다.
Qwen3 235B 모델을 4개의 H100 GPU에서 구동했을 때 vLLM과 FriendliAI의 상대적 처리량을 비교한 차트이다.
ChartvLLM 8-bit를 기준(1.0)으로 잡았을 때, Friendli 4-bit는 입력/출력 길이에 따라 최대 3.26배 높은 처리량을 보여준다. 특히 출력 길이가 긴 시나리오(500/4000)에서 FriendliAI의 최적화 효율이 더 극대화됨을 시각적으로 증명한다.
03
플랫폼은 OpenAI API와 호환되도록 설계되어 기존 코드를 거의 수정하지 않고도 마이그레이션할 수 있다. 사용자는 단 3줄의 코드 변경만으로 50만 개 이상의 Hugging Face 모델 및 커스텀 모델을 즉시 배포하고 트래픽 기반 오토스케일링 기능을 활용할 수 있다.
04
LG AI Research의 EXAONE 모델 사례를 통해, FriendliAI 도입 후 모델 테스트 및 평가 기간을 수주 단축하고 사용자 만족도를 높인 실질적인 비즈니스 임팩트를 입증했다. 다른 고객사는 월간 수조 개의 토큰을 처리하면서 GPU 자원을 50% 절감하는 성과를 거두었다.

용어 해설

추론 엔진(Inference Engine)
학습된 AI 모델을 실제 서비스 환경에서 실행하기 위해 최적화된 소프트웨어 스택이다. 모델의 연산 과정을 효율적으로 관리하여 응답 속도를 높이고 서버 자원 사용을 최적화하는 역할을 수행한다.
처리량(Throughput)
단위 시간당 시스템이 처리할 수 있는 데이터나 요청의 양을 의미한다. LLM 환경에서는 보통 초당 처리되는 토큰 수(TPS)로 측정하며, 시스템의 확장성과 효율성을 판단하는 핵심 지표이다.
전문가 혼합(MoE)
Mixture of Experts의 약자로, 모델의 전체 파라미터 중 입력값에 적합한 일부 전문가 네트워크만 활성화하여 계산하는 아키텍처이다. 모델 크기를 키우면서도 추론 비용을 낮게 유지할 수 있는 장점이 있다.
양자화(Quantization)
모델의 가중치를 높은 정밀도(예: 16비트)에서 낮은 정밀도(예: 4비트, 8비트)로 변환하는 기법이다. 메모리 사용량을 획기적으로 줄이고 연산 속도를 높여 저사양 하드웨어에서도 대형 모델을 구동할 수 있게 한다.
자동 확장(Autoscaling)
실시간 트래픽 수요에 맞춰 컴퓨팅 자원을 자동으로 늘리거나 줄이는 기술이다. 사용자가 많을 때는 서버를 추가하여 성능을 유지하고, 사용자가 적을 때는 자원을 회수하여 비용을 절감한다.

기술

  • FriendliAI
  • vLLM
  • Qwen3 235B
  • H100 GPU
  • OpenAI API
  • Hugging Face

활용 사례

  • 대규모 트래픽을 처리하는 챗봇 서비스
  • 긴 문맥 처리가 필요한 에이전트 애플리케이션
  • 오픈 소스 모델 기반의 비용 효율적 API 서버 구축

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 26.수집 2026. 03. 06.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.