Together AI가 Blackwell GPU 성능을 일주일 만에 2배 끌어올린 비결
Together AI의 커널 연구팀이 FlashAttention과 ThunderKittens를 통해 GPU 하드웨어 성능을 극대화하고 AI 추론 비용과 지연 시간을 혁신적으로 단축한 성과를 공유했다.
최신 추론 최적화 기술(CPD, FlashAttention 등)과 대규모 GPU 인프라 운영에 관한 독보적인 엔지니어링 인사이트를 제공합니다.
Together AI의 커널 연구팀이 FlashAttention과 ThunderKittens를 통해 GPU 하드웨어 성능을 극대화하고 AI 추론 비용과 지연 시간을 혁신적으로 단축한 성과를 공유했다.
Together AI가 Deepgram의 최신 STT 및 TTS 모델을 자사 플랫폼에 통합하여 지연 시간을 최소화한 실시간 음성 에이전트 구축 환경을 제공한다.
Together AI 연구팀은 소형 모델이 분할 정복 프레임워크를 통해 긴 컨텍스트 작업에서 GPT-4o의 성능을 능가할 수 있음을 입증했다.
Together AI는 일관성 기반의 다중 토큰 확정 기법과 블록 단위 KV 캐싱을 결합하여 확산 언어 모델의 추론 속도를 최대 14.5배 향상시킨 CDLM을 발표했습니다.
Together AI가 커스텀 Docker 컨테이너를 기반으로 생성형 미디어 모델의 배포, 오토스케일링, 큐잉을 자동화하는 전용 컨테이너 추론 서비스를 출시했다.
Together AI는 캐시 히트율에 따라 워크로드를 분리하고 분산 KV 캐시를 활용하여 긴 컨텍스트 추론의 처리량을 40% 향상시킨 CPD 아키텍처를 공개했다.
Together AI는 최소한의 프롬프트만 주어졌을 때 LLM이 보이는 고유한 주제 선호도와 퇴행 패턴을 분석하여 모델별 지식 편향과 안전성 위험을 확인했다.
Together AI가 문장 중간의 언어 전환을 자연스럽게 처리하고 120ms의 빠른 응답 속도를 제공하는 Rime Arcana V3 음성 합성 모델을 도입했다.
Together AI가 글로벌 인프라 전문가 Alon Gavrielov를 영입하고 대규모 AI 팩토리 구축을 통해 AI 네이티브 앱을 위한 고성능 인프라 확장에 나선다.
Together AI는 데이터 과학 에이전트의 실제 분석 능력을 공정하게 평가하고 학습시키기 위한 통합 벤치마크 프레임워크인 DSGym을 공개했다.
Together AI는 양자화, 증류, 투기적 디코딩 및 하드웨어 병렬화 전략을 통해 LLM 추론 지연 시간을 단축하고 비용 효율성을 극대화하는 실무 가이드를 제시한다.
수백 대의 GPU를 연결하여 대규모 언어 모델을 효율적으로 학습시키기 위한 인프라 구성, 병렬화 전략 및 장애 대응 방안을 상세히 설명한다.
Cursor는 Together AI와 협력하여 NVIDIA Blackwell 아키텍처 기반의 초저지연 추론 인프라를 구축하고, FP4 양자화를 통해 실시간 AI 코딩 경험을 최적화했습니다.
기업의 워크로드 특성에 맞춰 비용, 속도, 품질의 트레이드오프를 고려하여 최적의 오픈 소스 AI 모델을 선택하는 체계적인 가이드를 제공한다.
Together AI는 250ms 미만의 지연 시간과 40개 이상의 언어 지원, 자동 감정 인식을 갖춘 MiniMax Speech 2.6 Turbo를 전용 인프라에서 제공한다.
Together AI는 Rime의 고성능 TTS 모델인 Arcana v2와 Mist v2를 도입하여 LLM 및 STT와 통합된 저지연성 음성 AI 파이프라인을 제공한다.
Together AI의 Dan Fu는 현재 하드웨어 활용도가 매우 낮으며 소프트웨어 최적화를 통해 AGI를 향한 성능 도약이 충분히 가능하다고 분석했다.
Together AI가 OpenAPI 기반의 현대적 아키텍처와 강력한 타입 안전성을 갖춘 Python SDK v2.0 RC 버전을 출시했다.
AutoJudge는 최종 결과에 영향이 없는 사소한 토큰 불일치를 허용하는 자가 학습 분류기를 도입하여 추측 디코딩의 수용률을 높이고 추론 속도를 최대 2배 가속한다.
Together AI가 하드웨어 최적화와 Speculative Decoding 기술을 통해 GPT-OSS, Qwen3, DeepSeek 등 주요 오픈소스 모델의 추론 속도에서 업계 1위를 기록했다.