본문으로 건너뛰기

Together AI, 주요 오픈소스 모델에 대해 업계 최고 수준의 추론 속도 달성

Together AI가 하드웨어 최적화와 Speculative Decoding 기술을 통해 GPT-OSS, Qwen3, DeepSeek 등 주요 오픈소스 모델의 추론 속도에서 업계 1위를 기록했다.

섹션별 상세

01
Together AI는 NVIDIA Blackwell 아키텍처와 GB200 NVL72에 최적화된 차세대 추론 엔진을 구축했다. 단순한 레이어 최적화를 넘어 연산 커널, 메모리 레이아웃, 실행 그래프 및 스케줄링을 통합 시스템으로 재설계하여 하드웨어 성능을 극대화했다. 특히 FP8 및 FP4 저정밀도 연산 경로를 최적화하여 실제 워크로드에서 높은 활용률을 달성했다.
gpt-oss-20B 모델의 제공업체별 출력 속도 비교 차트
ChartTogether AI가 892 tokens/sec를 기록하며 2위인 Google Vertex(456 tokens/sec) 대비 약 2배 빠른 성능을 보여주고 있음을 입증한다.
02
자체 개발한 Together Kernels를 통해 대역폭 활용 능력을 획기적으로 높였다. 여기에는 Blackwell 아키텍처 전용 FlashAttention-4 커널과 라우팅 및 Expert FFN을 결합한 Fused MoE 커널이 포함된다. 이러한 하드웨어 인식 커널은 대규모 모델의 처리량을 직접적으로 개선하는 핵심 동력으로 작용한다.
03
FP8 및 FP4 포맷을 활용한 Near-lossless 양자화 기술을 적용했다. 아키텍처 인식 캘리브레이션과 블록 단위 스케일링, 민감한 경로에 대한 선택적 혼합 정밀도 기법을 통해 모델 품질 저하 없이 극단적인 압축을 실현했다. 런타임 수준에서 Fused FP4/FP8 커널과 양자화된 KV-Cache를 지원하여 대규모 모델의 지연 시간을 줄이고 처리량을 높였다.
gpt-oss-120B 모델의 제공업체별 출력 속도 비교 차트
Chart120B 규모의 대형 모델에서도 Together AI가 898 tokens/sec로 1위를 차지하며 대규모 파라미터 모델에 대한 최적화 성능을 보여준다.
04
실제 서비스 환경에서 신뢰할 수 있는 Speculative Decoding 알고리즘을 구현했다. 각 타겟 모델에 최적화된 고정밀 Draft Model을 학습시키고, 출력 품질을 유지하면서 속도를 극대화하는 적응형 수락 전략을 도입했다. 이를 통해 Kimi나 Qwen3와 같은 모델에서 출력 속도를 거의 두 배로 높이는 성과를 거두었다.
Qwen3 235B 모델의 제공업체별 출력 속도 비교 차트
ChartTogether AI(FP8)가 254 tokens/sec를 기록하여 2위인 Amazon(92 tokens/sec)보다 2.75배 이상 빠른 압도적인 격차를 시각화한다.
Kimi K2 0905 모델의 제공업체별 출력 속도 비교 차트
ChartKimi K2 모델에서 Together AI가 216 tokens/sec를 기록하며 경쟁사 대비 65% 이상 빠른 성능을 유지하고 있음을 확인시킨다.
05
최대 1T 파라미터 이상의 모델을 지원하는 대규모 Speculator 학습 파이프라인을 구축했다. 커리큘럼 기반 학습과 데이터 믹싱 전략을 통해 Draft Model이 타겟 모델의 문체와 구조적 출력을 정확히 모방하도록 설계했다. 고성능 아키텍처와 사전 학습된 베이스 모델을 활용하여 다양한 타겟 모델에 신속하게 적응할 수 있는 체계를 갖췄다.
Qwen3 Coder 480B 모델의 제공업체별 출력 속도 비교 차트
Chart480B에 달하는 초거대 코딩 모델에서도 Together AI가 153 tokens/sec로 가장 빠른 추론 속도를 제공함을 보여준다.

기술

  • NVIDIA Blackwell
  • GB200 NVL72
  • FlashAttention-4
  • FP4/FP8 Quantization
  • Speculative Decoding

활용 사례

  • 실시간 대화형 챗봇
  • 고속 코드 생성 에이전트
  • 대규모 텍스트 분석 및 요약
  • 저지연 RAG 시스템
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2025. 12. 01.수집 2026. 02. 21.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.