본문으로 건너뛰기

Mixture‑of‑Kittens 공개와 Rubin의 미세 커널 오버랩

Cursor의 Mixture‑of‑Kittens가 NVL72에서 공개 기준 최대 2.37× 속도 향상을 보고했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Cursor가 NVL72 타깃의 MoE 트레이닝 megakernel인 Mixture‑of‑Kittens를 공개하면서 공개 기준 최대 2.37× MXFP8 전방 처리량 향상과 전체 토큰 처리량 약 41% 증가를 보고했습니다. 동시에 NVIDIA의 Rubin은 타일 수준 의존성 트리거로 finer‑grained kernel overlap을 가능하게 해 커널 퓨전 없이도 런치 오버헤드를 해소할 수 있음을 제시했습니다. 결과적으로 메가커널은 특정 하드웨어에서 큰 이득을 줄 수 있지만, 하드웨어 지원·운영 복잡성·디버깅 비용을 함께 고려해 도입 여부를 판단해야 합니다.

섹션별 상세

메가커널을 둘러싼 엔지니어링 논쟁이 다시 부상했습니다. 논쟁의 핵심은 커널 퓨전으로 런치 오버헤드와 커널 간 비효율을 줄이는 접근과, 하드웨어 수준의 finer‑grained 의존성 트리거(Rubin)로 같은 이득을 얻는 접근 사이의 현실적 우위입니다. 발표자들과 트윗 인용은 Megakernel 구현이 연구 관점에서는 효과적일 수 있으나 운영 환경에서는 복잡성 때문에 널리 채택되지 않는 현실적 제약을 지적합니다.
근거
  • 메가커널을 실제 운영에 도입하는 팀은 연구 성과와 달리 유지보수성과 하드웨어 적합성 문제로 인해 프로덕션에서는 드물다는 실무 의견이 제시되었다. 팟캐스트 발언과 여러 엔지니어 인터뷰·코멘트를 교차 검토해 실제 운영 사례와 포기 사례를 확인해야 합니다.
Cursor가 공개한 Mixture‑of‑Kittens(MoK)는 NVL72 하드웨어용 MoE 트레이닝 megakernel로, 커뮤니케이션과 계산을 하나의 결정론적 커널로 결합해 공개 기준 최대 2.37×의 MXFP8 전방 처리량 향상을 보고했습니다. 글은 MoK 수치(2.37×)와 전반적 토큰 처리량 약 41% 증가라는 결과를 중심으로 MoE 트레이닝 파이프라인에서 커널 수준 최적화가 비용 구조에 미치는 직접적 영향을 연결합니다. 해당 결과는 특정 하드웨어(NVL72계열)와 데이터형(MXFP8)에 국한된 벤치마크라는 점을 명시해, 일반화의 범위를 제한하면서도 실무적 비용 개선의 가능성을 강조합니다.
막대그래프 형태의 벤치마크로, 여러 모델(Kimi K2.7, GLM 5.2, Qwen 3.5-397B-A17B, DeepSeek V4 Pro)에서 Mixture‑of‑Kittens의 MXFP8 전방 처리량이 다른 조합보다 높게 표시되어 있습니다.
Chart그래프는 Mixture‑of‑Kittens가 선택된 공개 베이스라인보다 최대 2.37× 높은 MXFP8 전방 처리량을 달성했다고 시각적으로 보여 줍니다. 각 모델별로 NCCL+PyTorch, DeepEP+PyTorch, DeepEP+TransformerEngine, HybridEP+Megatron 등 대비군이 표시되어 있고 MoK 막대가 유의미하게 높게 나타납니다. 이 차트는 MoK가 특정 하드웨어와 데이터형 조건에서 일관된 처리량 우위를 보였다는 근거를 제공하지만, 그래프 자체는 사용된 정확한 측정 조건(배치 크기, 프로파일 등)을 상세히 기재하고 있지 않아 외부 일반화에는 추가 정보가 필요합니다.
근거
  • Cursor가 공개한 Mixture‑of‑Kittens가 NVL72 환경에서 공개된 강력한 벤치마크 대비 MXFP8 전방 처리량을 최대 2.37× 향상시켰다. Cursor의 공개 트윗/릴리스와 함께 제공된 벤치마크 차트 및 발표문(미세 측정치, 비교 대상 목록, 하드웨어 조건)을 확인해야 합니다.
NVIDIA의 Rubin 설계는 타일 수준의 의존성 트리거를 도입해 커널 퓨전 없이도 미세한 오버랩을 달성할 수 있음을 시사합니다. Rubin 쪽 메커니즘은 부분 데이터가 준비되는 즉시 해당 타일 작업을 시작하게 하여 멀티‑GPU 환경의 통신 대기 시간을 줄이는 방식으로 작동합니다. 이 때문에 일부 엔지니어는 megakernel이 하드웨어 지원이 발전하면 연구적 흥미를 넘어서 널리 필요하지 않을 수 있다고 보고 있습니다.
다수의 스레드블록 타임라인을 비교한 다이어그램으로, 상단은 Blackwell(기존 접근)과 하단은 Rubin(세분화된 오버랩) 구성의 시간축을 보여 줍니다.
Diagram그림은 커널 단위를 더 크게 묶어 실행하는 Blackwell식 접근과 타일/블록 단위의 세밀한 의존성 트리거로 오버랩을 달성하는 Rubin식 접근을 나란히 대비합니다. Blackwell 쪽에서는 큰 커널 런치 간에 기다림이 발생하는 반면 Rubin 쪽은 타일 단위로 부분 결과가 준비되는 즉시 다음 연산을 시작하도록 스케줄이 촘촘하게 연결되어 있습니다. 이 도식은 소프트웨어 수준에서 megakernel로 런치 오버헤드를 줄이는 방법과 하드웨어/런타임 수준에서 finer‑grained 트리거로 같은 목표를 달성하는 방법을 시각적으로 구분해 줍니다.
근거
  • Rubin은 타일 수준 의존성 트리거를 지원해 커널 퓨전 없이도 finer‑grained kernel overlap을 가능하게 한다고 발표되었다. Kyle Kranen의 트윗 스레드에서 Rubin의 'tile-level dependency triggers' 문구와 동작 원리 요약을 찾아야 합니다.
인프라와 상업적 관점에서 커널 설계는 가격·성능·유지보수성 사이의 트레이드오프 문제로 귀결됩니다. 글은 Cursor의 MoK가 특정 벤치마크에서 큰 성능 향상을 보였지만, 다른 글과 트윗 인용을 통해 하드웨어 기능(Rubin)과 모듈식 커널의 병렬화가 실전에서는 더 나은 선택이 될 수 있음을 함께 제시합니다. 결과적으로 엔지니어는 커널 수준의 연구 성과를 실무 배포의 하드웨어·운영·디버깅 요구와 대조해 판단해야 합니다.

용어 해설

메가커널(Megakernel)
여러 연산 단계를 하나의 거대한 GPU 커널로 합쳐 런치 오버헤드와 커널 간 병목을 줄이는 기법으로, 커널 내에서 통신과 계산을 일괄 처리해 데이터 이동을 최소화하는 방식입니다. 구현은 복잡하고 디버깅과 최적화 비용이 크며, 통상적으로 Mixture‑of‑Experts 같은 대규모 통신 패턴에서 성능을 노리는 연구적 시도가 많았습니다. 실전 배포에서는 런타임 유연성이나 하드웨어 지원 때문에 모듈식 커널 쪽이 더 자주 선택되는 환경적 제약이 있습니다.
커널 오버랩(Kernel Overlap)
서로 다른 GPU 커널이 동시에 실행되도록 스케줄링해 연산 자원을 겹치게 사용하는 기법으로, 개별 커널의 런치 지연을 숨기고 전체 처리량을 높이는 목적입니다. 세부적으로는 블록/타일 수준의 의존성을 관리해 어느 시점에 어떤 타일을 실행할지 동적으로 결정하는 방식이 핵심입니다. 하드웨어가 finer‑grained 의존성 트리거를 지원하면 오버랩으로 인한 이득이 커집니다.
타일 수준 의존성 트리거(Tile-level Dependency Trigger)
연산을 더 작은 타일 단위로 쪼갠 뒤 각 타일의 입력이 준비되는 즉시 해당 타일을 시작시키는 메커니즘으로, 부분 결과를 기다리는 동안 발생하는 유휴 시간을 줄입니다. Rubin 발표에서 이 개념은 커널 퓨전으로 해결하려 했던 런치 오버헤드 문제의 대안으로 제시되었습니다. 타일 단위로 트리거를 열면 멀티‑GPU 환경에서 통신·계산을 더 촘촘하게 오버랩할 수 있습니다.
Mixture of Experts
모델의 일부 전문가(Experts)를 샤딩해 각 입력마다 일부 전문가만 활성화하는 구조로, 전체 파라미터는 크지만 실제 계산량은 활성화된 전문가에 한정해 효율을 얻는 접근법입니다. MoE는 대규모 트레이닝과 통신 패턴에서 강한 네트워크 요구를 만들며, megakernel은 이런 통신-계산 혼재 상황에서 성능을 겨냥한 기법입니다. 통신과 계산을 한 커널에 모으면 결정론성이나 동기화 방식이 설계 이슈가 됩니다.

기술

  • Mixture‑of‑Kittens는 NVL72 대상 MoE 트레이닝 megakernel로 발표되었습니다. 해당 커널은 MoE의 통신과 계산을 한 프로세스로 결합해 MXFP8 전방 처리량을 공개 비교 기준에서 최대 2.37×까지 끌어올렸다고 보고되었습니다. 이 구현은 주로 트레이닝 단계의 커널 최적화 관점에서 읽을 수 있습니다.
  • Rubin은 타일 수준 의존성 트리거를 포함하는 GPU 설계 변경으로 소개되었습니다. 이 메커니즘은 데이터 일부가 준비되는 즉시 해당 타일의 작업을 시작하게 함으로써 멀티‑GPU 환경에서 통신 대기 시간을 줄이는 구조적 개선을 제공합니다. 결과적으로 일부 엔지니어는 Rubin 지원 하에서는 대규모 megakernel의 필요성이 감소할 수 있다고 판단합니다.
  • NVL72 계열 하드웨어와 MXFP8 같은 데이터형은 발표된 벤치마크의 맥락을 결정합니다. 성능 상대치는 특정 하드웨어·데이터형·라이브러리 조합에 따라 크게 달라질 수 있으므로, 발표 수치의 적용 범위를 판단할 때 이들 요소를 반드시 일치시켜야 합니다. 공개 결과는 동일 플랫폼에서의 비교 우위를 보여 주지만 다른 환경으로 일반화하기 위한 추가 검증이 필요합니다.

활용 사례

  • 대규모 MoE 모델의 트레이닝 파이프라인에서 통신‑계산 병목을 줄여 비용을 절감하는 데 직접 적용할 수 있습니다. Megakernel 방식은 통신과 계산을 단일 커널로 결합해 런치 오버헤드와 데이터 이동을 감소시키므로, NVL72처럼 특정 하드웨어에서 큰 성능 이득을 낼 수 있습니다. 다만 하드웨어 지원과 유지보수성, 디버깅 비용을 함께 계산해 도입 여부를 결정해야 합니다.
  • 하드웨어가 tile‑level trigger 같은 미세 오버랩 기능을 제공할 때는 모듈식 커널과 하드웨어 기능을 조합해 시스템 복잡도를 낮출 수 있습니다. 이 경우 러닝타임 스케줄러와 커널 런처가 더 작은 단위의 작업을 동적으로 시작해 전체 처리율을 끌어올립니다. 따라서 서비스형 인프라에서는 하드웨어 기능을 우선 검토한 뒤 소프트웨어 최적화를 선택하는 접근이 실무적으로 유리할 수 있습니다.
  • 연구·프로토타입 단계에서는 megakernel이 새로운 통신·계산 결합 전략을 실험하는 용도로 가치가 있습니다. 결정론성 확보와 벤치마크 우수성은 학술적·연구적 기여를 만들고, 성능 병목의 근원을 탐색하는 데 도움을 줍니다. 그러나 제품화 단계로 옮길 때는 운영 조건과 하드웨어 호환성을 검증해야 실제 비용 절감으로 이어집니다.

언급된 리소스

GitHubMixture-of-Kittens (Cursor) GitHub
문서Cursor 트윗: Mixture‑of‑Kittens 공개 발표
문서Kyle Kranen 트윗: Rubin의 Improved Kernel Overlap 및 tile‑level dependency triggers
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 05.수집 2026. 08. 05.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.