TL;DR
생성형 AI 비용은 프로비저닝된 용량보다 사용자의 호출 행동과 토큰 소비에 따라 빠르게 달라져, 조직이 AI 접근을 넓히려면 개인별 지출과 예산 통제가 필요합니다. Jamf는 Amazon Bedrock 호출 로그를 Amazon S3에 저장하고 Amazon Athena 뷰로 사용자별 당일 비용을 계산한 뒤, 15분마다 실행되는 AWS Lambda가 임계값에 따라 Customer Managed Policy 버전을 갱신하는 서버리스 구조를 구축했습니다. 일일 예산의 80%에서는 Anthropic Claude Opus, 100%에서는 Anthropic Claude Sonnet을 차단하면서 Anthropic Claude Haiku는 계속 허용하고, 제한은 재인증 없이 다음 호출부터 적용되며 일일 리셋 뒤 자동으로 해제됩니다. 수백 명 규모에서 Lambda·DynamoDB·S3 비용은 월 10달러 미만이었지만 Athena는 JSON 스캔량에 따라 비용이 커질 수 있어, 쿼리 통합이나 Parquet 변환과 함께 운영해야 합니다.
섹션별 상세

용어 해설
- AI 비용 운영·관리(AI FinOps)
- — AI 서비스 사용량과 비용을 사용자·팀·프로젝트 단위로 측정하고, 예산 한도·예외 승인·감사 기록을 운영하는 체계입니다. 생성형 AI에서는 토큰 사용량이 호출 방식과 모델 선택에 따라 달라지므로, 기존 인프라 비용 관리보다 세밀한 관찰과 통제가 필요합니다.
- 고객 관리형 정책(Customer Managed Policy)
- — AWS 계정 사용자가 직접 생성하고 버전과 권한 규칙을 관리하는 IAM 정책입니다. 이 글에서는 Lambda가 사용자별 임계값에 따라 정책 버전을 갱신하고, IAM Identity Center 권한 집합에 연결된 정책이 다음 Bedrock 호출의 허용 여부를 결정하도록 사용합니다.
- SAML 주체 식별자(saml:sub)
- — SAML 기반 인증에서 특정 사용자를 식별하는 조건 키 값입니다. Jamf의 정책은 이 값을 기준으로 특정 엔지니어에게만 모델 접근 제한을 적용하므로, 공통 권한 집합을 유지하면서 사용자별 통제가 가능합니다.
- 멱등형 적용(Idempotent Enforcement)
- — 같은 작업을 여러 번 실행하거나 일부 실행을 놓쳐도 최종 상태가 동일하게 수렴하는 처리 방식입니다. Lambda가 증분 변경을 누적하지 않고 당일 누적 지출에서 전체 제한 사용자 목록을 매번 다시 계산하므로, 중복 적용이나 별도 롤백 경로가 필요하지 않습니다.
- 컬럼형 데이터 형식(Columnar Format)
- — 행 전체가 아니라 열 단위로 데이터를 저장해 필요한 열만 읽을 수 있도록 만든 형식입니다. 원본 JSON 로그는 필터링한 열과 관계없이 행을 역직렬화해야 하지만, Parquet 같은 컬럼형 형식으로 변환하면 Athena 쿼리의 스캔 비용과 처리량을 개선할 여지가 있습니다.
기술
- Amazon Bedrock
- AWS Identity and Access Management (IAM)
- IAM Customer Managed Policies (CMPs)
- AWS IAM Identity Center
- Amazon S3
- Amazon Athena
- AWS Lambda
- Amazon EventBridge
- Amazon DynamoDB
- Slack
- AWS CLI
- Parquet
활용 사례
- 엔지니어별 Amazon Bedrock 일일 지출 한도 적용
- AI 코딩 도구의 모델별 접근 제한
- 대규모 생성형 AI 도입을 위한 비용 거버넌스
- 예외 승인과 만료를 포함한 모델 사용량 관리
- 저비용 모델을 남겨 둔 단계적 서비스 제한
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.