본문으로 건너뛰기

Nebius Serverless AI 챌린지 수상작과 실측 결과

Nebius 챌린지 수상작들이 LoRA 학습부터 에이전트 장애 실험까지 서버리스 AI의 비용과 성능을 측정했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Nebius Serverless AI Builders Challenge에는 35개 프로젝트가 참여했고, 수상작은 의료 문서 Fine-tuning, 사용자 데이터 기반 모델 평가, 다중 에이전트 장애 실험에서 Serverless AI의 실제 활용 방식을 입증했다. 1위 MediSimplifier는 7–8B 모델에 LoRA를 적용하고 일곱 개의 ablation 작업을 20분에 병렬 처리했으며 전체 청구액은 320달러였다. 2위 평가 대시보드는 호스팅 모델과 vLLM 자체 호스팅 모델을 같은 데이터로 비교했고, 3위 Balagan은 225회 장애 실험을 63초에 수행해 3.64달러를 지불했다. 결과는 serverless 방식이 일회성 학습·평가·실험에서 유휴 자원 비용과 운영 부담을 줄이는 동시에, 평가자 불일치와 에이전트 장애 같은 실제 문제를 수치로 드러낼 수 있음을 보여준다.

빠른 이해

새로운 점

Serverless AI의 유휴 GPU 비용 절감 효과를 의료 Fine-tuning, 자체 데이터 평가, 다중 에이전트 장애 실험의 실제 청구액과 실행 시간으로 비교했다.

핵심 메커니즘

Serverless AI Jobs가 학습·오케스트레이션 작업을 제출 시점에 실행하고, Serverless AI Endpoints가 모델이 서비스되는 동안만 GPU를 유지하며, Object Storage가 체크포인트를 보관한다. 입력 작업은 모델 학습·평가·장애 주입 실험이고, 처리 과정은 필요한 자원을 만들고 작업을 실행한 뒤 자원을 종료하거나 중단 지점에서 복구하는 방식이며, 출력은 Fine-tuned 모델·모델 비교 결과·다중 에이전트 안정성 측정값이다.

핵심 수치

  • 챌린지 자격 프로젝트: 35개- AI & ML, Scientific AI & Healthcare, robotics 분야
  • MediSimplifier 병렬 ablation: 7개 작업, 20분- 순차 실행 기준 3시간
  • MediSimplifier 전체 청구액: $320- 실패한 작업 포함
  • LLM 평가자 일치도: Cohen’s κ = 0.11- 서로 다른 계열 LLM 두 개가 동일 출력 채점
  • Balagan 전체 sweep: 63초- 단일 NVIDIA L40S 사용
  • Balagan 측정 청구액: $3.64- 두 번째 전체 sweep과 종료·복구 시연 포함

섹션별 상세

01

챌린지와 심사 기준

Nebius Serverless AI Builders Challenge에는 AI & ML, Scientific AI & Healthcare, robotics 분야에서 모두 35개 프로젝트가 자격을 얻었다. 참가자는 Serverless AI Jobs, Serverless AI Endpoints 또는 두 서비스를 사용해 실제 작동하는 결과물을 만들고, 공개 저장소와 기술 블로그에 구현 방식과 코드를 남겼다. Nebius 전문가와 엔지니어로 구성된 심사단은 기술 구현, 재현성, 교육 콘텐츠 품질, 제품 사용 깊이, 실제 유용성, 독창성의 여섯 기준으로 유효한 제출물을 평가했다. 모든 수상 프로젝트가 공개되어 독자는 접근 방식과 코드를 확인하고 직접 실행할 수 있는 구조다.
02

의료 문서 단순화

1위 MediSimplifier는 환자가 이해하기 어려운 병원 퇴원 요약문을 임상 사실을 유지한 평이한 문장으로 바꾸는 프로젝트다. Shmulik Avraham은 7–8B 모델에 LoRA를 적용해 전체 모델 가중치 대신 저순위 파라미터를 조정했고, Serverless AI Endpoint에서 최종 모델을 서비스했다. 단일 GPU 작업을 제출할 때마다 H100을 즉시 사용할 수 있었으며, 일곱 개의 ablation 작업을 병렬로 실행해 순차 처리 기준 세 시간 대신 20분에 끝냈다. 실패한 작업을 포함한 전체 실제 청구액은 320달러였다. 같은 출력을 채점한 서로 다른 계열의 LLM 평가자 두 개는 Cohen’s κ = 0.11의 낮은 일치도를 기록했고, chain-of-thought prompting이 불일치를 줄이지 않고 오히려 키웠기 때문에 대규모 LLM 평가에는 교차 계열 평가자 두 개 이상이 필요하다는 판단으로 이어졌다.
03

자체 데이터 모델 평가

2위 평가 대시보드는 사용자의 데이터를 기준으로 최대 세 개 모델을 품질, 지연 시간, 비용 측면에서 비교한다. 대시보드는 Nebius Token Factory의 호스팅 모델과 vLLM Serverless AI Endpoint에 직접 배포한 모델을 하나의 순위표에 넣고, 배포 비용과 평가 비용을 분리해 비교 조건을 맞췄다. 평가가 시작되면 GPU 엔드포인트를 만들고 테스트를 실행한 뒤 종료하므로, 테스트 사이에 유휴 상태로 남는 장비를 계속 빌릴 필요 없이 비교마다 GPU를 사용한 분량만 지불한다. 실험에서는 자체 호스팅이 높은 사용률에서만 비용 우위를 얻었고, reasoning model의 출력에서 관련 블록을 제거하지 않으면 정답을 맞혀도 파싱 결과가 0%가 되는 문제가 확인됐다.
04

다중 에이전트 장애 실험

3위 Balagan은 다중 에이전트 시스템에 장애를 주입해 여러 에이전트가 내린 집단 결정의 품질 변화를 측정하는 chaos-engineering harness다. 225회의 짧고 독립적인 실험을 위해 Serverless AI Endpoint는 모델이 응답하는 동안만 GPU를 유지했고, CPU 전용 Serverless AI Job은 오케스트레이션을 처리했으며, Object Storage는 체크포인트를 1센트 미만으로 보관했다. 실행 중간에 작업을 강제로 종료한 뒤 다시 제출해 중단 지점부터 복구되는 동작도 확인했고, NVIDIA L40S 한 장에서 전체 sweep이 63초 만에 끝났다. 두 번째 전체 sweep과 여러 종료·복구 시연을 포함한 측정 청구액은 3.64달러였으며, 결과 heatmap에서는 장애의 개수보다 장애 유형이 더 큰 영향을 미쳤다. 단순 다수결은 충돌한 에이전트와 거짓 지시를 받은 에이전트가 있는 상황에서도 100% 정확도를 유지했지만, hierarchy 방식보다 토큰을 약 2.8배 사용했고, hierarchy는 집계 에이전트가 사라진 경우 다섯 번 중 한 번을 놓쳤다.
05

특별상과 공개 프로젝트

특별상은 Fine-tuning 모델을 Git push부터 운영 환경까지 연결한 Piotr Janik의 프로젝트, 법률 copilot용 KYC 문서 인식을 다룬 Team Lity의 프로젝트, robotics·Agents·학생 작업·CPU 활용 사례 등에 돌아갔다. Best CPU Example은 수영 훈련을 위한 grounded LLM planner였고, Community Choice는 8월 25일 Serverless AI office hours에서 참가자 투표로 정해질 예정이었다. 본문은 각 수상작의 GitHub 저장소와 기술 블로그를 공개해 독자가 코드를 복제하고 실행할 수 있게 했다. Nebius는 Serverless AI Jobs 또는 Endpoints를 이용해 첫 작업을 몇 분 안에 실행할 수 있다고 안내하며, 프로젝트 결과를 실제 사용 가능한 공개 산출물로 연결했다.

용어 해설

Serverless AI 작업(Serverless AI Jobs)
GPU나 CPU를 상시 대여하지 않고 작업을 제출할 때만 실행 자원을 할당받는 방식이다. Nebius 사례에서는 학습·오케스트레이션 작업이 끝나면 자원이 해제되어 유휴 장비 비용을 줄이고, 중단된 작업을 다시 제출해 중단 지점부터 이어갈 수 있었다.
Serverless AI 엔드포인트(Serverless AI Endpoints)
모델 추론 요청이 들어오는 동안에만 서버 자원을 유지하는 배포 방식이다. MediSimplifier는 이 엔드포인트에 LoRA로 조정한 모델을 올렸고, 모델 평가 대시보드는 비교가 끝난 뒤 GPU 엔드포인트를 종료해 사용한 시간만 비용에 반영했다.
LoRA
기존 모델의 전체 가중치를 갱신하지 않고 저순위 행렬을 추가로 학습하는 Fine-tuning 기법이다. 이번 우승 프로젝트는 7–8B 모델에 LoRA를 적용해 병원 퇴원 요약문을 임상 사실의 손실 없이 쉬운 문장으로 바꾸도록 조정했다.
LLM 평가자(LLM-as-judge)
LLM이 다른 모델의 출력 품질을 채점하도록 구성하는 평가 방식이다. MediSimplifier의 실험에서는 동일한 출력을 채점한 서로 다른 계열의 LLM 두 개가 거의 일치하지 않았고, Cohen’s κ가 0.11에 그쳐 교차 계열 평가자 두 개 이상이 필요하다는 결론으로 이어졌다.
카오스 엔지니어링(chaos engineering)
운영 중 발생할 수 있는 장애나 공격 조건을 의도적으로 주입해 시스템의 취약점을 측정하는 방법이다. Balagan은 다중 에이전트 시스템에 에이전트 충돌과 거짓 지시를 넣고 집단 의사결정 품질이 어떻게 변하는지 225회의 독립 실험으로 측정했다.
Cohen의 카파(Cohen’s κ)
두 평가자의 판정 일치도를 우연히 같은 판정을 내릴 가능성까지 고려해 측정하는 통계량이다. 기사에서는 동일 출력에 대한 두 LLM 평가자의 일치도가 Cohen’s κ = 0.11로 나타났으며, 값이 낮을수록 평가 결과를 단일 평가자에게 의존하기 어렵다는 뜻이다.

기술

  • Nebius Serverless AI
  • Serverless AI Jobs
  • Serverless AI Endpoints
  • LoRA
  • LLM-as-judge
  • Cohen’s κ
  • chain-of-thought prompting
  • Nebius Token Factory
  • vLLM
  • Object Storage
  • NVIDIA L40S
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 08. 18.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.