TL;DR
Nebius는 오픈 가중치 공개만으로는 충분하지 않다고 보고 주변 인프라와 최적화층을 함께 구축해 오픈 생태계의 경쟁력을 유지하려고 합니다. 회사는 LK losses라는 훈련 목적과 그에 연계된 초안 모델·데이터를 공개했으며 Kvax와 Soperator 같은 오픈 엔지니어링 산출물로 실무 적용 장벽을 낮추고 있습니다. 또한 MLPerf 제출로 최신 하드웨어에서의 최적화 성과를 입증해 오픈 기술이 실무에서 경쟁력을 가질 수 있음을 보이려 합니다.
빠른 이해
새로운 점
오픈 훈련 목표(LK losses)와 함께 초안 모델·데이터를 동시 공개해 speculative decoding 성능을 직접 개선하려는 시도가 눈에 띕니다.
핵심 메커니즘
오픈 모델의 실무 경쟁력은 주변 인프라 최적화(커널 튜닝·저정밀도 품질 보존·지연 제어)와 연구 성과의 즉시 적용(예: LK losses로 draft 모델의 acceptance rate 개선), 그리고 오픈 최적화 구현(Kvax, Soperator)으로 확보합니다.
핵심 수치
- MLPerf Inference v6.0: NVIDIA Blackwell 및 Blackwell Ultra 플랫폼에서 제출해 상위권 성능을 보고함
섹션별 상세
오픈 소스가 Nebius 전략의 출발점
모델 공개는 시작에 불과하다
연구를 오픈으로 확장하는 성과

- LK losses는 추측 디코딩의 수용률을 직접 최적화하며 8B에서 685B 모델에 걸쳐 일관된 추론 처리량 개선을 제공한다고 밝혔다. — 본문의 'Open research compounds' 섹션과 'See also' 링크, LK losses 관련 문단과 공개 자료(훈련 데이터·초안 모델) 참조.
오픈 엔지니어링 산출물들

- Kvax는 JAX 기반의 open-source flash-attention 구현으로 Nebius가 기여한 최적화이다. — 본문의 'An open model is only one part of the stack' 및 'Building in the open' 문단에 Kvax 언급.
- Managed Soperator는 Slurm-on-Kubernetes를 셀프서비스로 제공해 즉시 ML 훈련을 시작할 수 있게 한다고 발표되었다. — 목차 하단의 기사 목록 'Introducing Managed Soperator' 항목과 관련 단락.
더 많은 손이 문제를 해결하게 한다

향후 방향과 리스크
용어 해설
- 오픈 가중치(Open weights)
- — 오픈 가중치는 모델의 학습된 파라미터를 공개해 누구나 다운로드하고 검토·재현할 수 있게 하는 접근 방식입니다. Nebius는 오픈 가중치가 모델 자체만큼 중요한 것은 아니며, 이를 실무에 쓰기 위해서는 주위 인프라와 최적화층이 필요하다고 주장합니다. 공개된 가중치는 커뮤니티 검증과 개선을 촉진하는 출발점으로 기능합니다.
- 추측 디코딩(Speculative decoding)
- — 추측 디코딩은 빠른 draft 모델로 여러 토큰을 미리 생성하고, 더 큰 target 모델의 계산을 줄이며 전체 추론 처리량을 높이는 방법입니다. Nebius는 LK losses를 통해 draft 모델의 수용률(acceptance rate)을 직접 최적화해 추측 디코딩 효율을 개선했다고 밝힙니다. 이 방식은 draft와 target 모델의 상호작용을 훈련 목표에 포함시켜 실제 추론 이득을 늘립니다.
- FlashAttention
- — FlashAttention은 어텐션 계산을 메모리와 대역폭 관점에서 최적화해 속도와 메모리 효율을 개선하는 알고리즘 계열입니다. Nebius는 JAX 구현인 Kvax를 공개해 특정 환경에서 attention 계산 성능을 끌어올리는 데 기여했습니다. 이런 최적화는 대형 모델을 낮은 지연과 합리적 비용으로 제공하는 데 핵심적입니다.
- Kubernetes 위의 Slurm(Slurm on Kubernetes)
- — Kubernetes 클러스터 위에 Slurm을 올려 ML 훈련 워크로드를 관리하면 클라우드 네이티브 운영과 기존 HPC 스케줄러의 장점을 결합할 수 있습니다. Nebius의 Managed Soperator는 이 조합을 서비스 형태로 제공해 즉시 훈련을 시작할 수 있게 합니다. 운영자는 사전 설치된 드라이버·라이브러리로 설정 시간을 줄이고 하드웨어를 곧바로 활용할 수 있습니다.
- MLPerf Inference
- — MLPerf Inference는 추론 성능을 표준화해 하드웨어·소프트웨어 조합의 실측 성능을 비교하는 벤치마크입니다. Nebius는 Blackwell · Blackwell Ultra 플랫폼에서 제출한 결과로 상위권 성능을 입증했다고 밝혔습니다. 공개된 벤치마크는 최적화가 실제 워크로드에서 어떤 이득을 내는지 객관적으로 보여줍니다.
기술
- Linux
- Kubernetes
- PyTorch
- vLLM
- SGLang
- JAX
- Slurm
- NVIDIA Nemotron
- MLPerf
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


