TL;DR
2026년 6월 미국 단일 GPU 기준으로 주요 마켓플레이스와 클라우드의 스팟(인터럽티블) 요금을 조사한 결과 H100 80GB는 RunPod이 시간당 약 1.80–2.40달러, Vast.ai가 1.47–2.00달러(공급 부족 시 1.03달러 관찰), AWS P5는 목록상 2.50–3.10달러이나 실용적 가용성이 낮았고 A100 80GB는 RunPod의 최저가가 0.20–0.40달러로 집계되었으나 그 구간에서 호스트 신뢰도가 급격히 떨어지는 경향이 관찰되었다. 동일한 시간당 가격이라도 플랫폼·호스트·가용성 창과 신뢰도에 따라 실제 운영 성능과 중단 위험이 크게 달라지므로 장기 학습 파이프라인에서는 체크포인팅·재시도·호스트 평판을 함께 설계해 총비용을 평가해야 한다. 최종적으로 원문 작성자는 광고성 온디맨드 비교와 달리 스팟 계층은 운영적 차이를 반드시 고려해야 한다고 결론 내렸고, 실제 관찰되는 중단 비율에 대한 추가 경험 공유를 요청했다.
섹션별 상세
용어 해설
- Spot Instance
- — 스팟 인스턴스는 클라우드/마켓플레이스에서 남는 용량을 저렴한 가격에 제공하는 일시적 가상머신으로, 공급 변화에 따라 인스턴스가 강제 종료될 수 있다. 가격은 수요·공급·호스트 정책에 따라 실시간 변동하며, 장시간 학습 작업에서는 중단 가능성을 고려해 체크포인팅과 재시도 로직을 설계하는 것이 필수적이다.
- Checkpointing
- — 체크포인팅은 장기 학습 작업에서 중간 모델 상태를 주기적으로 저장해 스팟 인스턴스 중단 시 저장된 지점부터 학습을 재개할 수 있게 하는 기법으로, 저장 빈도·저장 매체·복구 절차 설계가 비용·복구 시간·데이터 무결성의 핵심 트레이드오프를 결정한다.
- Host Reliability
- — 호스트 신뢰도는 마켓플레이스 내 개별 물리 호스트 또는 제공자별로 인스턴스가 유지되는 평균 시간과 강제 종료 빈도를 합친 개념으로, 동일한 시간대의 동일한 가격이라도 호스트 신뢰도 차이에 따라 실제 사용 가능 시간과 작업 성공률이 크게 달라진다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.