본문으로 건너뛰기

오픈 모델을 핵심으로 하는 Nebius의 전략

Nebius는 오픈 연구·코드·인프라를 통합해 오픈 모델의 실무 경쟁력을 확보하려 합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Nebius는 오픈 가중치 공개만으로는 충분하지 않다고 보고 주변 인프라와 최적화층을 함께 구축해 오픈 생태계의 경쟁력을 유지하려고 합니다. 회사는 LK losses라는 훈련 목적과 그에 연계된 초안 모델·데이터를 공개했으며 Kvax와 Soperator 같은 오픈 엔지니어링 산출물로 실무 적용 장벽을 낮추고 있습니다. 또한 MLPerf 제출로 최신 하드웨어에서의 최적화 성과를 입증해 오픈 기술이 실무에서 경쟁력을 가질 수 있음을 보이려 합니다.

빠른 이해

새로운 점

오픈 훈련 목표(LK losses)와 함께 초안 모델·데이터를 동시 공개해 speculative decoding 성능을 직접 개선하려는 시도가 눈에 띕니다.

핵심 메커니즘

오픈 모델의 실무 경쟁력은 주변 인프라 최적화(커널 튜닝·저정밀도 품질 보존·지연 제어)와 연구 성과의 즉시 적용(예: LK losses로 draft 모델의 acceptance rate 개선), 그리고 오픈 최적화 구현(Kvax, Soperator)으로 확보합니다.

핵심 수치

  • MLPerf Inference v6.0: NVIDIA Blackwell 및 Blackwell Ultra 플랫폼에서 제출해 상위권 성능을 보고함

섹션별 상세

오픈 소스가 Nebius 전략의 출발점

Nebius는 AI 생태계가 소수의 대형 모델에 집중되는 것을 가장 큰 위협으로 보고 오픈 소스를 전략적 우선순위로 삼고 있습니다. 이 회사는 Linux·Kubernetes·PyTorch 같은 오픈 인프라가 현대 AI를 떠받친다는 전제로, 모델 가중치 공개뿐 아니라 인프라·연구·하드웨어 설계까지 공개적 작업을 통해 경쟁성과 다양성을 유지하려 한다고 밝힙니다. 그렇게 하면 연구 결과와 최적화가 공개 리포지토리와 벤치마크를 통해 검증되고, 다른 연구자나 개발자가 개선을 가져오는 선순환이 가능하다고 주장합니다.

모델 공개는 시작에 불과하다

Nebius는 '오픈 모델이 실제로 유용하려면 주변 스택이 뒷받침되어야 한다'고 말합니다; 즉 커널 튜닝, 저정밀도에서 품질 보존, 반복 호출 시 지연 예측성 확보 같은 엔지니어링 작업이 배포 경쟁력을 결정합니다. 회사는 자체적으로 모델을 편애하지 않고 고객이 오픈·클로즈드 모델을 모두 선택하도록 플랫폼상에서 빠르게 새 모델을 테스트하고 전환할 수 있게 한다고 설명합니다. 이 접근은 오픈 가중치가 공개된 순간부터 실무에서 쓸 수 있는 수준으로 만드는 데 필요한 입력·처리·출력 단계를 명확히 합니다.

연구를 오픈으로 확장하는 성과

Nebius 연구팀은 LK losses라는 훈련 목적을 공개해 추측 디코딩의 수용률을 직접 최적화하는 방법을 내놓았고, 관련 훈련 데이터셋(Infinity-Instruct-Completions)과 초안 모델(LK-Speculators)도 함께 공개했습니다. 회사는 이 방법이 8B에서 685B에 이르는 모델 규모에서 일관된 추론 처리량 개선을 제공한다고 주장하며, 다른 팀이 같은 목적을 가져다 자신들의 draft 모델에 적용한 사례를 근거로 제시합니다. 공개된 연구와 도구가 곧바로 다른 연구·제품으로 옮겨가는 흐름을 의도적으로 만들려는 전략임이 분명합니다.
LK losses 관련 프리뷰 이미지로, 훈련 목적과 초안 모델 공개를 알리는 배너 역할을 합니다.
Infographic이미지는 LK losses 연구 공개를 홍보하는 시각 자료로 보이며 본문에서 말하는 '훈련 데이터와 초안 모델 공개'를 시각적 근거로 보강합니다. 연구 아티팩트(예: LK-Speculators, Infinity-Instruct-Completions)를 공개했다는 서술과 직접 연결되므로 독자가 연구 산출물이 공개되어 있음을 빠르게 파악하게 돕습니다.
근거
  • LK losses는 추측 디코딩의 수용률을 직접 최적화하며 8B에서 685B 모델에 걸쳐 일관된 추론 처리량 개선을 제공한다고 밝혔다. 본문의 'Open research compounds' 섹션과 'See also' 링크, LK losses 관련 문단과 공개 자료(훈련 데이터·초안 모델) 참조.

오픈 엔지니어링 산출물들

Nebius는 Kvax라는 JAX 기반의 open-source flash-attention 구현과 Soperator라는 Kubernetes용 Slurm 오퍼레이터 같은 인프라 산출물을 공개해 실무 적용 장벽을 낮추고 있습니다. 또한 서버 하드웨어 설계를 Open Compute Project에 기여하고 SWE-Rebench 같은 리더보드와 데이터셋을 유지해 AI 소프트웨어 엔지니어링의 공개 비교를 가능하게 합니다. 이러한 산출물은 단순한 코드 공개를 넘어 실제 운영·훈련·검증 루프에서 오픈 구성요소가 경쟁력을 갖추도록 하는 데 중점을 둡니다.
Soperator(Managed Soperator) 홍보용 이미지로, Slurm-on-Kubernetes 제품을 시각적으로 표시합니다.
Infographic이 이미지는 Managed Soperator의 제품 페이지나 안내문에서 사용하는 배너로 보이며, 본문에서 밝힌 '셀프서비스로 제공되는 Slurm 클러스터'라는 제품 주장과 일치합니다. 제품 가시성 차원에서 즉시 훈련 가능한 환경을 제공한다는 메시지를 전달하므로 인프라 서비스 항목의 증거 자료로 유효합니다.
근거
  • Kvax는 JAX 기반의 open-source flash-attention 구현으로 Nebius가 기여한 최적화이다. 본문의 'An open model is only one part of the stack' 및 'Building in the open' 문단에 Kvax 언급.
  • Managed Soperator는 Slurm-on-Kubernetes를 셀프서비스로 제공해 즉시 ML 훈련을 시작할 수 있게 한다고 발표되었다. 목차 하단의 기사 목록 'Introducing Managed Soperator' 항목과 관련 단락.

더 많은 손이 문제를 해결하게 한다

Nebius는 열린 시스템이 자동으로 더 안전하거나 더 우수하지는 않지만 더 많은 사람이 실패를 재현하고 완화책을 검증할 수 있게 한다고 주장합니다. 공개된 방법과 구현은 독립적인 검증과 개선을 촉진하며, 결과적으로 독점적 접근 방식에서도 동일한 오픈 프레임워크와 방법을 채택해 업계 전체의 진보를 가속화한다고 봅니다. 이 관점은 연구의 투명성·이식성·상호검증 가능성을 중시하는 실무적 관점에서 나온 것입니다.
MLPerf Inference v6.0 제출 결과를 알리는 이미지로, Blackwell 플랫폼 상의 성능을 강조합니다.
Infographic이 이미지는 Nebius의 MLPerf 제출 사실과 'Blackwell 및 Blackwell Ultra에서 상위권 성능' 주장을 시각적으로 보조합니다. 다만 이미지 자체는 수치나 비교표를 포함하지 않으므로 벤치마크의 정량적 근거는 본문이나 제출 자료를 통해 확인해야 합니다. 그래도 벤치마크 제출 사실을 독자에게 빠르게 인지시키는 용도로 적절합니다.

향후 방향과 리스크

Nebius는 오픈 모델이 독점 모델을 완전히 대체하리라 예상하지 않으며, 기업들은 여전히 오픈과 클로즈드 모델을 혼합해 쓸 것이라고 전망합니다. 핵심 목표는 선택권을 유지하는 것이며, 이를 위해 오픈 스택의 각 계층을 꾸준히 구축·유지해야 한다고 강조합니다. 회사는 오픈 생태계가 과학적 주장 검증과 아이디어의 확산을 가능하게 해 장기적으로 산업 구조와 연구 방향에 영향을 준다고 결론지었습니다.

용어 해설

오픈 가중치(Open weights)
오픈 가중치는 모델의 학습된 파라미터를 공개해 누구나 다운로드하고 검토·재현할 수 있게 하는 접근 방식입니다. Nebius는 오픈 가중치가 모델 자체만큼 중요한 것은 아니며, 이를 실무에 쓰기 위해서는 주위 인프라와 최적화층이 필요하다고 주장합니다. 공개된 가중치는 커뮤니티 검증과 개선을 촉진하는 출발점으로 기능합니다.
추측 디코딩(Speculative decoding)
추측 디코딩은 빠른 draft 모델로 여러 토큰을 미리 생성하고, 더 큰 target 모델의 계산을 줄이며 전체 추론 처리량을 높이는 방법입니다. Nebius는 LK losses를 통해 draft 모델의 수용률(acceptance rate)을 직접 최적화해 추측 디코딩 효율을 개선했다고 밝힙니다. 이 방식은 draft와 target 모델의 상호작용을 훈련 목표에 포함시켜 실제 추론 이득을 늘립니다.
FlashAttention
FlashAttention은 어텐션 계산을 메모리와 대역폭 관점에서 최적화해 속도와 메모리 효율을 개선하는 알고리즘 계열입니다. Nebius는 JAX 구현인 Kvax를 공개해 특정 환경에서 attention 계산 성능을 끌어올리는 데 기여했습니다. 이런 최적화는 대형 모델을 낮은 지연과 합리적 비용으로 제공하는 데 핵심적입니다.
Kubernetes 위의 Slurm(Slurm on Kubernetes)
Kubernetes 클러스터 위에 Slurm을 올려 ML 훈련 워크로드를 관리하면 클라우드 네이티브 운영과 기존 HPC 스케줄러의 장점을 결합할 수 있습니다. Nebius의 Managed Soperator는 이 조합을 서비스 형태로 제공해 즉시 훈련을 시작할 수 있게 합니다. 운영자는 사전 설치된 드라이버·라이브러리로 설정 시간을 줄이고 하드웨어를 곧바로 활용할 수 있습니다.
MLPerf Inference
MLPerf Inference는 추론 성능을 표준화해 하드웨어·소프트웨어 조합의 실측 성능을 비교하는 벤치마크입니다. Nebius는 Blackwell · Blackwell Ultra 플랫폼에서 제출한 결과로 상위권 성능을 입증했다고 밝혔습니다. 공개된 벤치마크는 최적화가 실제 워크로드에서 어떤 이득을 내는지 객관적으로 보여줍니다.

기술

  • Linux
  • Kubernetes
  • PyTorch
  • vLLM
  • SGLang
  • JAX
  • Slurm
  • NVIDIA Nemotron
  • MLPerf

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 08. 11.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.