본문으로 건너뛰기

Nvidia, Hugging Face 130억 달러 인수

GLM-5.3-Flash가 100만 토큰 문맥과 작업당 0.09달러 비용으로 오픈 모델 경쟁의 기준을 넓혔습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

AINews는 Nvidia가 Hugging Face를 약 130억 달러에 인수한다는 소식과 함께 GLM-5.3-Flash 출시 반응을 오픈소스 AI 경쟁의 핵심 흐름으로 묶었습니다. GLM-5.3-Flash는 3,200억 개 전체 파라미터 중 180억 개를 활성화하고 100만 토큰 문맥과 MIT License를 제공하며, Linear Attention과 Sparse Attention을 결합해 긴 문맥 추론 비용을 낮추는 구조를 택했습니다. Artificial Analysis는 57점의 Intelligence Index와 작업당 0.09달러 비용을 기록했지만, 약 90%의 출력 토큰이 추론 토큰이어서 낮은 가격이 비용 효율의 주요 원천으로 남습니다. 중국산 AI 칩에서 대규모 트래픽을 처리한다는 주장과 Cline의 빠른 채택은 모델 성능뿐 아니라 서빙 인프라와 배포 속도도 경쟁의 기준이 되고 있음을 드러냅니다.

섹션별 상세

01
Nvidia가 오픈소스 AI 모델 저장소인 Hugging Face를 130억 달러에 인수한다는 소식이 AINews의 최상위 뉴스로 정리됐으며, 이는 2026년 1월 제시한 70억 달러보다 거의 두 배 큰 거래입니다. Hugging Face는 GitHub와 비슷한 방식으로 오픈소스 모델을 배포하는 저장소와 개발자 생태계를 보유하고 있으며, 기사에는 2026년 고객 기반이 두 배로 늘고 연간 반복 매출이 1억 5,000만 달러였다는 수치가 실렸습니다. Nvidia 경영진은 오픈 모델의 확산이 Anthropic과 OpenAI 같은 비공개 모델 개발사에 대한 균형추가 되어 Nvidia의 AI 하드웨어 지배력을 지키는 데 도움이 된다고 판단했습니다.
The Information 기사 화면에 Nvidia가 오픈소스 모델 저장소 Hugging Face를 129억 달러에 인수한다는 제목과 도입 문장이 표시돼 있습니다.
Screenshot이미지는 AINews가 최상위 뉴스로 삼은 Nvidia와 Hugging Face의 인수 보도를 뒷받침하는 스크린샷입니다. 기사 본문은 거래 규모를 130억 달러로 반올림해 전하며, 인수가 오픈 모델 생태계와 Nvidia의 AI 하드웨어 전략에 미칠 영향을 연결합니다.
02
GLM-5.3-Flash는 이전에 “Ox Alpha”라는 이름으로 미리 공개됐던 모델의 공식 정체로, 3,200억 개의 전체 파라미터 중 180억 개만 활성화하고 100만 토큰 문맥을 지원하는 네이티브 멀티모달 모델입니다. Z.ai는 MIT License로 가중치, API, ChatZ, Coding plan, AutoClaw를 제공했으며, 중국산 AI 칩에서 전부 실행된다고 밝혔습니다. Z.ai 자체 Code Bench에서는 모든 노력 수준에서 GLM-5.2를 앞서고 Claude Opus 4.8과 코딩 성능이 비슷하다고 발표했지만, 해당 수치는 자체 벤치마크이므로 독립 평가보다 신중하게 읽어야 합니다.
03
Artificial Analysis는 GLM-5.3-Flash에 Intelligence Index 57점을 부여하고 작업당 비용을 0.09달러로 산정했으며, 입력 100만 토큰당 0.15달러와 출력 100만 토큰당 0.50달러의 API 가격을 기록했습니다. 같은 57점인 GPT-5.6 Terra와 Muse Spark 1.2보다 작업당 비용이 낮았고, GLM-5.3 최대 설정의 작업당 0.68달러와 비교하면 약 7.5배 저렴했습니다. 다만 지능 지수 계산에 1억 4,900만 출력 토큰을 사용했고 그중 약 90%가 추론 토큰이어서, 비용 우위는 토큰 사용량보다 매우 낮은 토큰 가격에서 주로 발생한다는 한계가 있습니다.
04
GLM-5.3-Flash의 구조는 GLM-5.2의 744B-A40B 백본에서 320B-A18B 구성으로 바뀌고, Kimi Linear 방식의 3대1 하이브리드 어텐션과 34개 KDA 레이어, 11개 MLA·DSA 레이어를 결합한 형태로 정리됐습니다. 여기에 DeepSeek V4 방식의 mHC 잔차 경로, 네 개의 병렬 스트림, 네이티브 비전 인코더가 포함되며, 활성 파라미터는 320억 개에서 180억 개로, 레이어 수는 92개에서 45개로 줄었습니다. 이러한 선형·희소 어텐션과 작은 KV cache 구조는 긴 문맥에서 어텐션 계산과 추론 비용을 누적해서 낮추는 효율화 전략으로 해석됐습니다.
05
중국산 AI 칩에서 GLM-5.3-Flash의 모든 트래픽을 처리한다는 Z.ai의 발표는 모델 구조뿐 아니라 서빙 인프라 측면에서도 큰 반응을 낳았습니다. SemiAnalysis는 하루 100조 토큰을 중국산 칩에서 처리한다는 주장을 부각했고, 한 비공식 계산은 칩당 초당 1만 토큰을 가정할 때 하루 100조 토큰에 약 11만 6,000개의 칩이 필요하다고 추산했습니다. 이 계산은 확인된 수치가 아닌 추정이지만, 해당 발표가 대규모 국내 가속기 클러스터와 추론 최적화 수준을 둘러싼 논쟁으로 이어진 이유를 설명합니다.
06
GLM-5.3-Flash는 공개 직후 Cline, CoreWeave, Baseten 등 개발자·추론 인프라에 빠르게 편입됐고, Cline은 출시 후 일주일이 지나기 전에 전체 트래픽의 11%를 차지한 역대 가장 빠른 성장 모델이라고 밝혔습니다. Baseten은 당일 제공을 시작했고 CoreWeave는 Serverless Inference 지원을 예고했으며 Dell은 GLM-5.3-Flash와 Qwen 3.8 Flash를 온프레미스 배포 가능한 오픈 모델로 묶었습니다. 반면 네이티브 비전 성능에 대해서는 일부 객체 탐지 작업에서 약하다는 반론이 나와, 멀티모달 명목과 실제 작업별 성능을 구분할 필요가 생겼습니다.

용어 해설

Linear Attention
전체 토큰 쌍의 상호작용을 모두 계산하는 대신 누적 가능한 형태로 어텐션 연산을 바꿔 긴 문맥에서 계산량을 줄이는 구조입니다. GLM-5.3-Flash는 Kimi Linear 계열의 구성과 결합해 긴 입력 처리 비용을 낮추는 방향을 택했습니다.
Sparse Attention
모든 토큰을 서로 연결하지 않고 선택된 토큰이나 인덱스만 참조해 어텐션 계산을 줄이는 방식입니다. 기사에서는 DeepSeek Sparse Attention과 인덱서 압축 설계가 중국 오픈 모델의 공통적인 효율화 흐름으로 거론됩니다.
KV Cache
생성 과정에서 이미 계산한 Key와 Value를 저장해 이전 토큰의 어텐션 연산을 반복하지 않게 하는 메모리 구조입니다. 레이어당 평균 KV cache가 작아지면 긴 문맥에서 추론 메모리와 어텐션 비용을 함께 낮출 수 있습니다.
추론 토큰(Reasoning Tokens)
모델이 최종 답변을 만들기 전에 내부 추론 과정에 사용하는 출력 토큰입니다. GLM-5.3-Flash는 Artificial Analysis Intelligence Index 계산에 사용한 1억 4,900만 토큰 중 약 90%가 추론 토큰이어서, 낮은 가격이 비용 효율의 핵심이라는 해석과 연결됩니다.
에이전트 작업(Agentic Tasks)
모델이 단순 질의응답을 넘어 도구 사용, 코드 실행, 장기 계획 같은 여러 단계를 수행하는 작업입니다. GLM-5.3-Flash는 GDPval-AA v2와 Terminal-Bench v2.1에서 강한 결과를 기록해 일반 지식 점수보다 실제 코드·에이전트 흐름에서 상대적으로 높은 평가를 받았습니다.

기술

  • GLM-5.3-Flash
  • Hugging Face
  • Z.ai API
  • ChatZ
  • AutoClaw
  • Cline
  • CoreWeave Serverless Inference
  • Baseten
  • Artificial Analysis Intelligence Index
  • Kimi Linear
  • Kimi Delta Attention
  • Multi-head Latent Attention
  • DeepSeek Sparse Attention
  • mHC
  • Muon

활용 사례

  • 코드 생성
  • 에이전트형 장기 작업
  • 비전·언어 이해
  • Cline을 통한 코드 작업
  • 중국산 AI 칩 기반 대규모 모델 서빙
  • 온프레미스 오픈 모델 배포
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 27.수집 2026. 08. 27.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.