본문으로 건너뛰기
AWS ML Blog조회 1

BoltzGen을 Amazon SageMaker AI에 배포해 단백질 바인더 설계 워크플로의 GPU 인프라를 자동화하는 사례 연구

BoltzGen을 SageMaker AI에 배포해 GPU 프로비저닝, S3 캐시, 멀티-GPU와 멀티-인스턴스 확장으로 단백질 바인더 설계 워크플로를 자동화하고 반복 실험 비용을 절감한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

BoltzGen은 확산 기반의 원자 단위 생성 모델로 단백질 바인더 설계에 백본 생성, 역접힘, 구조 검증, 후보 순위 매김의 연속적 GPU 집약 단계를 사용하며 리포지토리 벤치마크 기준 ml.g5.12xlarge 4-GPU에서 1,000 샘플에 약 375시간이 소요된다. Amazon SageMaker AI는 작업 제출 시 GPU 인스턴스 프로비저닝과 컨테이너 실행, 결과 저장을 자동화하며 초 단위 요금과 S3 기반 단계별 캐시(7일 만료)를 통해 반복 실험의 비용을 낮춘다. 구현은 단일 인스턴스 내 멀티-GPU와 파이프라인 모드의 멀티-인스턴스 확장을 모두 지원하고, 예시로 ml.g4dn.xlarge에서 2시간 실행 비용이 약 1.50달러로 제시되어 짧은 검증과 대규모 배치 모두에 대응할 수 있다. 배포를 위해 리포지토리의 설정 스크립트가 컨테이너를 빌드해 Amazon ECR에 푸시하도록 구성되어 있어 동일 구성으로 소규모 검증부터 대규모 캠페인까지 파라미터만 조정해 확장할 수 있다.

섹션별 상세

01
BoltzGen은 확산 기반의 원자 단위 생성 모델로서 표적 분자에 결합할 수 있는 단백질과 펩타이드를 설계하기 위해 백본 생성, 역접힘(inverse folding), 구조 검증, 후보 순위 매김의 연쇄적 단계를 수행한다. 각 단계는 GPU에서 개별 설계 사양을 처리하므로 수백에서 수백만 후보를 다룰 때 계산 부하가 급증한다. 리포지토리 벤치마크에 따르면 ml.g5.12xlarge 4-GPU 인스턴스에서 1,000 샘플 캠페인은 약 375시간이 소요된다. 설계 생성 단계가 전체 계산 비용에서 지배적이라는 점은 워크플로 최적화의 우선순위를 명확히 한다.
02
Amazon SageMaker AI는 작업 제출 시 컨테이너 실행을 위해 GPU 인스턴스를 자동으로 프로비저닝하고 완료 시 인스턴스를 해제하면서 결과를 Amazon S3에 기록해 장시간 실행 작업의 인프라 운영 부담과 유휴 비용을 감소시킨다. 요금은 초 단위로 청구되며, 예시로 ml.g4dn.xlarge에서 2시간 디자인 실행 비용이 온디맨드 기준 약 1.50달러로 제시되어 단기 검증에 적합한 저비용 옵션을 제공한다. 구현은 단일 인스턴스 내 멀티-GPU 병렬화와 파이프라인 모드에서의 멀티-인스턴스 확장을 모두 지원하며, 각 단계의 출력은 기본적으로 S3에 7일 만료 캐시로 저장되어 반복 실험 시 비용이 큰 설계 생성 단계의 재실행을 회피한다.
03
배포 측면에서 저장소의 설정 스크립트가 컨테이너 이미지를 빌드해 Amazon ECR에 푸시하도록 구성되어 있어 즉시 디자인 작업을 제출할 수 있는 예제가 제공된다. 동일한 구성으로 10개 후보를 검증하는 짧은 실행부터 대규모 배치 캠페인까지 파라미터 값만 바꿔 확장할 수 있으며, ml.g4dn 계열의 T4 기반 인스턴스부터 ml.g6e의 L40S 기반 인스턴스까지 인스턴스 선택으로 처리량과 비용을 조율할 수 있다. 연구 검증 단계와 프로덕션 배치 처리를 구분하는 두 가지 실행 모드를 제공해 개발 초기의 빠른 반복과 대규모 처리 요구를 모두 만족시킨다.

용어 해설

확산 기반 생성 모델(Diffusion Model)
확산 기반 생성 모델은 노이즈를 점진적으로 제거하는 역과정을 학습해 복잡한 분포에서 샘플을 생성한다. 입력으로 랜덤 노이즈를 받고 여러 단계의 역확산 과정을 통해 단백질 좌표나 서열을 생성하며, 샘플링 단계가 많을수록 세밀한 구조를 얻을 수 있다. 단백질 설계에서는 물리적 제약을 만족시키는 원자 수준 출력을 얻기 위해 사용된다.
역접힘(Inverse Folding)
역접힘은 주어진 단백질 백본 구조로부터 이를 만들 수 있는 서열을 예측하는 과정이다. 모델은 3차원 좌표를 입력으로 받아 가능한 아미노산 조합을 산출하며, 구조와 서열 간의 일관성을 확보하는 데 사용된다. 단백질 설계 파이프라인에서 구조 생성 후에 서열을 결정하는 핵심 단계로서 검증과 최적화에 중요하다.
원자 단위 생성 모델(All-Atom Generative Model)
원자 단위 생성 모델은 원자 수준의 좌표를 직접 생성하여 단백질의 물리적 정합성을 유지하도록 설계된다. 원자 간 상호작용과 결합 길이·각도 등의 물리적 제약을 고려해 출력 구조의 정확도를 높이며, 후속 구조 검증 단계의 부담을 줄인다. 단백질 바인더 설계에서는 결합부 환경을 세밀하게 재현할 수 있어 성능 영향이 크다.
단계별 캐싱(Step-Level Caching)
단계별 캐싱은 파이프라인의 각 처리 단계 결과를 외부 저장소에 보관해 동일 입력에 대해 이후 단계에서 재실행을 피하는 기법이다. 캐시 만료 시간을 설정해 반복 실험에서 비용이 큰 단계의 중복 수행을 줄이며, I/O를 통해 파이프라인을 연결한다. 설계 반복이 잦은 워크플로에서 전체 컴퓨팅 비용을 크게 낮춘다.

기술

  • BoltzGen
  • Amazon SageMaker AI
  • Amazon S3
  • Amazon ECR
  • ml.g4dn.xlarge
  • ml.g5.12xlarge
  • ml.g6e

활용 사례

  • protein binder design
  • therapeutic protein engineering
  • de novo protein architecture
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 02.수집 2026. 07. 02.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.