섹션별 상세
Together AI는 NVIDIA Blackwell 아키텍처와 GB200 NVL72에 최적화된 차세대 추론 엔진을 구축했다. 단순한 레이어 최적화를 넘어 연산 커널, 메모리 레이아웃, 실행 그래프 및 스케줄링을 통합 시스템으로 재설계하여 하드웨어 성능을 극대화했다. 특히 FP8 및 FP4 저정밀도 연산 경로를 최적화하여 실제 워크로드에서 높은 활용률을 달성했다.

자체 개발한 Together Kernels를 통해 대역폭 활용 능력을 획기적으로 높였다. 여기에는 Blackwell 아키텍처 전용 FlashAttention-4 커널과 라우팅 및 Expert FFN을 결합한 Fused MoE 커널이 포함된다. 이러한 하드웨어 인식 커널은 대규모 모델의 처리량을 직접적으로 개선하는 핵심 동력으로 작용한다.
FP8 및 FP4 포맷을 활용한 Near-lossless 양자화 기술을 적용했다. 아키텍처 인식 캘리브레이션과 블록 단위 스케일링, 민감한 경로에 대한 선택적 혼합 정밀도 기법을 통해 모델 품질 저하 없이 극단적인 압축을 실현했다. 런타임 수준에서 Fused FP4/FP8 커널과 양자화된 KV-Cache를 지원하여 대규모 모델의 지연 시간을 줄이고 처리량을 높였다.

실제 서비스 환경에서 신뢰할 수 있는 Speculative Decoding 알고리즘을 구현했다. 각 타겟 모델에 최적화된 고정밀 Draft Model을 학습시키고, 출력 품질을 유지하면서 속도를 극대화하는 적응형 수락 전략을 도입했다. 이를 통해 Kimi나 Qwen3와 같은 모델에서 출력 속도를 거의 두 배로 높이는 성과를 거두었다.


최대 1T 파라미터 이상의 모델을 지원하는 대규모 Speculator 학습 파이프라인을 구축했다. 커리큘럼 기반 학습과 데이터 믹싱 전략을 통해 Draft Model이 타겟 모델의 문체와 구조적 출력을 정확히 모방하도록 설계했다. 고성능 아키텍처와 사전 학습된 베이스 모델을 활용하여 다양한 타겟 모델에 신속하게 적응할 수 있는 체계를 갖췄다.

기술
- NVIDIA Blackwell
- GB200 NVL72
- FlashAttention-4
- FP4/FP8 Quantization
- Speculative Decoding
활용 사례
- 실시간 대화형 챗봇
- 고속 코드 생성 에이전트
- 대규모 텍스트 분석 및 요약
- 저지연 RAG 시스템
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2025. 12. 01.수집 2026. 02. 21.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
