본문으로 건너뛰기
TechCrunch AI조회 6

Multiverse Computing, 오프라인 실행 가능한 초소형 AI 모델 및 API 포털 출시

스페인 스타트업 Multiverse Computing이 양자 기반 압축 기술을 활용해 모바일 기기에서 오프라인으로 작동하는 초소형 모델 Gilda와 기업용 API 포털을 공개했다.

섹션별 상세

Multiverse Computing은 양자 역학에서 영감을 얻은 CompactifAI 압축 기술을 통해 OpenAI, Meta, Mistral 등의 대형 모델을 획기적으로 줄여 로컬 실행이 가능하도록 만들었다.
새로 출시된 CompactifAI 앱은 초소형 모델 Gilda를 내장하여 인터넷 연결 없이도 기기 내부에서 추론을 수행하며 이를 통해 데이터 유출 위험을 원천 차단하는 프라이버시 이점을 제공한다.
CompactifAI 앱의 사용자 인터페이스를 보여주는 4개의 스마트폰 스크린샷이다.
Screenshot앱이 로컬에서 처리 중임을 알리는 'Processing locally' 알림과 양자 역학, 마이크로서비스 아키텍처 등 복잡한 주제에 대해 답변하는 모습을 보여준다. 기기 사양에 따라 로컬 모델(Gilda)과 클라우드 모델 간의 라우팅이 어떻게 시각적으로 표현되는지 확인할 수 있다.
기기의 하드웨어 사양(RAM, 저장공간)이 부족할 경우 Ash Nazg 시스템이 자동으로 클라우드 API로 요청을 전환하여 사용자 경험의 연속성을 보장하지만 이 과정에서 로컬 처리의 보안 이점은 일부 희석된다.
기업용 시장을 겨냥해 출시된 API 포털은 개발자들이 압축된 모델을 직접 제어하고 실시간 사용량을 모니터링할 수 있게 하며 이는 기존 LLM 대비 운영 비용을 대폭 절감하는 효과를 가져온다.
최신 압축 모델인 HyperNova 60B 2602는 오픈소스 기반의 gpt-oss-120b를 모태로 하며 원본 모델보다 빠른 응답 속도와 낮은 비용을 구현하여 자율 코딩 에이전트와 같은 복잡한 작업에 최적화되었다.

용어 해설

모델 압축(Model Compression)
대형 언어 모델의 파라미터 수를 줄이거나 연산 정밀도를 조정하여 모델의 크기를 줄이는 기술이다. 이를 통해 메모리 사용량을 낮추고 추론 속도를 높여 모바일 기기나 엣지 환경에서 AI를 실행할 수 있게 한다.
엣지 AI(Edge AI)
데이터 센터나 클라우드 서버가 아닌 스마트폰, 드론, 센서 등 데이터가 생성되는 현장의 기기(엣지)에서 직접 AI 연산을 수행하는 방식이다. 지연 시간을 줄이고 오프라인 작동이 가능하며 데이터 프라이버시를 강화할 수 있다.
양자 영감(Quantum-inspired)
양자 컴퓨팅의 수학적 원리나 알고리즘을 고전적인 디지털 컴퓨터에서 실행 가능하도록 모사한 방식이다. Multiverse Computing은 이 원리를 활용해 기존 방식보다 효율적인 모델 압축 및 최적화 솔루션을 구현했다.

기술

  • CompactifAI
  • Gilda
  • HyperNova 60B 2602
  • Ash Nazg
  • gpt-oss-120b

활용 사례

  • 오프라인 모바일 AI 채팅
  • 드론 및 위성용 임베디드 AI
  • 프라이버시 중심의 기업용 로컬 AI
  • 비용 최적화된 자율 코딩 에이전트

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 19.수집 2026. 03. 19.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.