본문으로 건너뛰기

d-Matrix와 Infinity의 협업으로 Corsair 플랫폼에서 Qwen3의 상태 유지형 완전 추론 지원

d-Matrix와 Infinity가 Corsair 플랫폼에서 tensor-parallel 단계에서 출발해 Qwen3의 상태 유지형 다중 토큰 추론을 완전 구현하며 전체 모델 실행의 중요성을 확인했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

대형 모델의 실제 추론 성능은 개별 커널 최적화만으로는 충족되지 않으며 attention·정규화·통신·메모리 이동·토큰 샘플링과 같은 여러 구성 요소가 연속적으로 조율되어야 한다는 문제가 제기되었다. d-Matrix와 Infinity는 Corsair라는 목적 설계된 추론 플랫폼에서 초기 텐서 병렬 연산을 출발점으로 삼아 Qwen3의 상태 유지형 다중 토큰 생성을 지원하는 완전한 추론 구현까지 확장함으로써 전체 모델 실행 능력을 입증했다. Infinity의 소프트웨어 계층은 자동화된 커널 생성과 모델 구현, 풀스택 최적화를 결합해 하드웨어별 적응을 가속했으며 Corsair의 고유한 아키텍처는 기존 GPU 대상 접근법과 다른 구현 난제를 야기했다. 이 협업은 하드웨어·런타임·모델 간 긴밀한 조율이 실서비스 레이턴시와 처리량을 결정하며, 신속한 모델 지원을 위해 자동화된 최적화 도구의 필요성을 확증했다.

섹션별 상세

01
대부분의 가속기 성능 평가는 개별 커널이나 단일 연산 중심으로 측정되며 이 접근은 실제 프로덕션 추론 워크로드의 전체 요구를 포착하지 못한다. 전체 모델 수준에서는 attention, normalization, 통신, 메모리 이동, 토큰 샘플링 및 연속 토큰에 대한 상태 관리가 입력에서 출력까지의 처리 흐름에 모두 영향을 미친다. 문단은 이러한 구성 요소가 함께 작동하지 않으면 레이턴시와 처리량이 하락한다고 지적하며, 단일 연산 가속만으로는 실사용 성능을 보장하기 어렵다는 점을 근거로 든다. 이 관점은 하드웨어와 런타임, 모델 구현 간의 조율이 실서비스 품질에 직접 연결된다는 점을 시사한다.
02
생성형 AI 추론은 이전 토큰의 맥락과 모델 상태를 보존하여 이후 토큰 생성에 재사용해야 하므로 본질적으로 상태 유지형 아키텍처를 요구한다. 상태 유지형 처리를 효율화하려면 컴퓨트 자원 간 통신, 메모리 배치, 런타임 캡처 및 모델 내 상태 표현 방식이 입력 프롬프트 처리에서 출력 생성까지 유기적으로 연결되어야 한다. d-Matrix와 Infinity의 협업은 Corsair의 컴퓨트 자원에서 초기 텐서 병렬 연산에서 출발해 다중 토큰 생성에 필요한 상태를 유지하는 완전 추론 구현으로 확장된 사례를 근거로 제시한다. 이 구현은 단편적 연산 가속이 아닌 전체 모델 실행을 지원할 수 있음을 확인해 주며 대화형·에이전트형 워크로드에서 실질적 응답 품질과 지속성을 확보할 수 있다는 의미를 가진다.
03
빠르게 변화하는 모델 생태계에서는 인프라 공급자가 새로운 연산자와 아키텍처에 신속히 적응해야 모델을 배포할 수 있으므로 모델 준비 시간 단축이 핵심 과제가 되었다. Infinity는 자동화된 커널 개발, 모델 구현, 풀스택 최적화를 결합한 소프트웨어 계층을 구축하여 다양한 하드웨어에 대해 inference-ready 상태로 만드는 작업을 진행해 왔다. Corsair는 목적 설계된 추론 플랫폼으로 고유한 아키텍처·메모리-컴퓨트 접근법·명령어 집합을 가지고 있어 기존 GPU 대상의 라이브러리와는 다른 구현 난제를 제시했다. d-Matrix와 함께 Infinity는 텐서 병렬 행렬 연산에서 출발해 여러 최전선 모델의 엔드투엔드 구현으로 진행함으로써 하드웨어 특화 최적화와 소프트웨어 자동화의 결합이 배포 속도를 높인다는 점을 입증했다.

용어 해설

텐서 병렬(Tensor Parallel)
여러 연산 장치에 모델의 텐서 연산을 분산하여 병렬로 실행하는 방식으로, 입력 텐서를 분할해 각 장치가 일부 행렬 곱셈을 처리하고 통신으로 결과를 결합하여 전체 연산을 완성한다. 이 방식은 대형 모델의 메모리·컴퓨팅 요구를 분산시켜 대규모 파라미터를 가진 모델을 여러 장치에서 실행 가능하게 만든다. 인프라에서 통신 비용과 동기화가 병목이 될 수 있어 하드웨어 특성에 맞춘 최적화가 필수적이다.
상태 유지형 추론(Stateful Inference)
모델이 이전에 생성한 토큰과 중간 상태를 보존하여 이후 토큰 생성에 재사용하는 추론 방식으로, 입력 프롬프트의 문맥을 점진적으로 누적해 대화 흐름이나 장기 의존성을 처리한다. 상태를 효율적으로 관리하려면 메모리 배치, 캐시 관리, 토큰 샘플링과의 연계가 필요하다. 실시간 대화형 애플리케이션에서는 상태 저장·전달 비용이 전체 지연과 처리량에 직접적인 영향을 준다.
자동화된 커널 개발(Automated Kernel Development)
하드웨어 특성에 맞춰 행렬 연산 등 핵심 연산 루틴을 자동 생성하고 최적화하는 소프트웨어 계층으로, 컴파일러 수준의 변환과 템플릿화된 연산으로 특정 아키텍처에서 최대 성능을 끌어낸다. 자동화는 새로운 모델 연산자나 하드웨어가 등장했을 때 도입 속도를 높여 모델 준비 시간을 줄인다. 다만 생성된 커널의 효율성은 하드웨어 메모리 모델과 통신 패턴에 따라 달라진다.

기술

  • tensor-parallel
  • attention
  • memory movement
  • runtime coordination
  • automated kernel development
  • full-stack optimization

활용 사례

  • conversational AI
  • agentic applications
  • code generation
  • interactive workloads
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 22.수집 2026. 07. 22.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.