챕터별 상세
Hugging Face Storage Buckets 소개
Hugging Face Hub에 새롭게 추가된 네 번째 저장소 유형인 Storage Buckets이다. 기존의 Models, Datasets, Spaces와 달리 가변적인 ML 아티팩트를 저장하기 위해 설계된 AI 네이티브 객체 스토리지이다. Git의 제약 사항인 커밋 오버헤드 없이 대용량 파일을 자유롭게 수정하고 저장할 수 있는 것이 특징이다.
AI 팀을 위한 스토리지 설계 특징
AI 워크플로에 최적화된 기능을 제공한다. 테라바이트(TB) 단위의 투명한 가격 정책을 채택했으며, 내장된 CDN과 Xet 중복 제거 기술을 통해 전송 속도를 높였다. Git 커밋 과정이 필요 없는 'Commit-free' 동기화를 지원하여 빠른 객체 업데이트가 가능하다.
Xet 기술을 통한 차세대 중복 제거
Xet 기술은 파일을 바이트 단위 청크로 분할하여 버킷 전체에서 중복을 제거한다. 예를 들어 모델을 재학습하여 가중치의 5%만 변경된 경우, 전체 파일을 다시 올리는 대신 변경된 5%만 업로드한다. 이를 통해 실제 업로드 데이터양을 4배 이상 줄이고 전송 시간을 획기적으로 단축했다.
투명한 가격 정책 및 인프라
AWS S3와 비교했을 때 비용 효율성이 뛰어나다. 월 $8-12/TB의 기본 요금에 데이터 송출(Egress) 비용과 CDN 이용료가 추가 비용 없이 포함되어 있다. 특히 총 저장 용량 대비 8:1 비율의 넉넉한 Egress를 제공하여 대규모 모델 배포 시 비용 부담을 줄였다.
AI 에이전트를 위한 영구 저장소
휘발성 환경에서 실행되는 AI 에이전트에게 영구적인 저장 공간을 제공한다. CLI 도구를 통해 에이전트가 직접 버킷을 생성하고 실험 결과나 벤치마크 데이터를 동기화할 수 있다. `hf sync` 명령어를 에이전트의 Bash 툴에 통합하여 모든 실행 이력을 자동으로 기록하는 것이 가능하다.
버킷 생성 및 CLI 활용 데모
웹 GUI와 CLI를 통한 버킷 생성 과정을 시연했다. GUI에서 버킷 이름과 CDN 지역을 설정하여 즉시 생성할 수 있으며, CLI에서는 `hf buckets create` 명령어를 사용한다. `hf sync` 명령어를 통해 138개의 로컬 파일을 버킷과 동기화하는 과정을 보여주었으며, 중복 제거가 적용되어 빠르게 완료됨을 확인했다.
bash
# 스토리지 버킷 생성
hf buckets create acme-corp/training-data
# 로컬 체크포인트를 버킷과 동기화
hf sync ./checkpoints/ hf://buckets/acme-corp/training-dataHugging Face CLI를 사용하여 버킷을 생성하고 로컬 데이터를 동기화하는 예시
용어 해설
- 객체 스토리지(Object Storage)
- — 데이터를 '객체'라는 단위로 관리하는 스토리지 아키텍처이다. 계층 구조 없이 평면적인 주소 공간에 데이터를 저장하며, 대규모 비정형 데이터를 확장성 있게 관리하는 데 필수적이다.
- 중복 제거(Deduplication)
- — 데이터 세트 내에서 중복되는 부분을 식별하고 제거하여 저장 공간과 전송 대역폭을 절약하는 기술이다. 모델 가중치처럼 유사한 데이터가 반복되는 ML 워크플로에서 효율성을 극대화한다.
- 데이터 송출(Egress)
- — 네트워크 내부에서 외부로 데이터가 나가는 과정을 의미한다. 클라우드 스토리지 서비스에서는 보통 이 과정에서 발생하는 비용(Egress Fee)이 큰 비중을 차지한다.
- 콘텐츠 전송 네트워크(CDN)
- — 지리적으로 분산된 서버 네트워크를 통해 사용자에게 콘텐츠를 빠르게 전달하는 시스템이다. 전 세계 어디서든 낮은 지연 시간으로 대용량 모델 파일을 다운로드할 수 있게 돕는다.
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 04. 07.수집 2026. 04. 07.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.