본문으로 건너뛰기

Hexagon, Amazon SageMaker HyperPod로 AI 모델 학습 시간 95% 단축

측정 기술 리더 Hexagon이 Amazon SageMaker HyperPod를 도입하여 3D 포인트 클라우드 세그멘테이션 모델의 학습 시간을 80일에서 4일로 단축하고 모델 정확도를 향상시킨 사례를 소개합니다.

섹션별 상세

01
Hexagon은 항공우주 및 자율주행 분야에서 수집되는 방대한 3D 포인트 클라우드 데이터를 정밀하게 분류하고 정제하기 위해 도메인 특화 AI 모델을 개발한다. 이 모델들은 센서 노이즈 제거, 지형 분류, 이동 객체 감지 등 특정 작업에 최적화되어 일반적인 범용 모델보다 높은 정확도를 제공한다.
도시 도로의 3D 포인트 클라우드 세그멘테이션 결과물
ScreenshotHexagon의 AI 모델이 모바일 매핑 데이터를 통해 도시 전체의 디지털 트윈을 생성하는 실제 사례를 보여준다. 도로, 건물, 식생 등이 색상별로 정밀하게 분류되어 있다.
건설 현장의 3D 포인트 클라우드 분석 화면
Screenshot중장비와 지형이 분류된 데이터를 통해 건설 현장에서의 실시간 의사결정을 지원하는 모델의 활용도를 나타낸다. 현장의 고도차와 객체 배치를 시각적으로 확인할 수 있다.
02
Amazon SageMaker HyperPod는 대규모 클러스터의 상태를 실시간으로 모니터링하고 장애가 발생한 노드를 자동으로 감지하여 교체하는 복원력을 갖추고 있다. 학습 중단 시 가장 최근의 체크포인트에서 자동으로 작업을 재개하므로 수주 이상 소요되는 장기 학습 프로젝트의 안정성을 보장한다.
03
데이터 관리 시스템은 Amazon S3와 Amazon FSx for Lustre를 결합하여 구축되었으며, Data Repository Association 기능을 통해 테라바이트급 데이터를 GPU 노드로 지연 없이 스트리밍한다. 이를 통해 데이터 전송 병목 현상을 제거하고 초당 수 기가바이트의 처리량을 유지하며 학습 효율을 높였다.
Hexagon의 AWS 기반 AI 학습 아키텍처 다이어그램
DiagramS3, FSx for Lustre, HyperPod 클러스터, 그리고 모니터링 도구들이 어떻게 연결되어 데이터 파이프라인과 MLOps를 구성하는지 상세히 설명한다. 계정 간 EFA 연결 구조가 명시되어 있다.
04
인프라 구성에는 NVIDIA H100 GPU가 탑재된 ml.p5.48xlarge 인스턴스 6대가 사용되었으며, Elastic Fabric Adapter(EFA)를 통한 저지연 네트워킹으로 분산 학습 성능을 극대화했다. 결과적으로 기존 온프레미스 환경에서 80일이 걸리던 학습 시간을 4일로 단축하는 성과를 거두었다.
05
MLOps 체계는 Amazon Managed Service for Prometheus와 Grafana를 연동하여 GPU 메모리 및 연산 성능을 실시간으로 시각화한다. 또한 MLflow를 통합하여 실험 파라미터와 모델 아티팩트의 이력을 체계적으로 관리함으로써 연구의 재현성을 확보했다.

기술

  • Amazon SageMaker HyperPod
  • NVIDIA H100
  • Amazon FSx for Lustre
  • Amazon S3
  • EFA
  • MLflow
  • Prometheus
  • Grafana

활용 사례

  • 3D 포인트 클라우드 세그멘테이션
  • 자율주행 데이터 정제
  • 디지털 트윈 구축
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 24.수집 2026. 02. 24.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.