본문으로 건너뛰기
AWS ML Blog조회 1

호주에서 Amazon Bedrock으로 GPT-5.6 쓰기

Sydney와 Melbourne에서 GPT-5.6 글로벌 추론 프로파일을 호출하고 Codex 사용량을 CloudWatch로 추적하는 방법

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

호주 팀은 Asia Pacific (Sydney)와 Asia Pacific (Melbourne)의 Amazon Bedrock Runtime 엔드포인트를 통해 OpenAI GPT-5.6 Sol, Terra, Luna 글로벌 추론 프로파일을 사용할 수 있다. Amazon Bedrock은 요청을 지원되는 상업용 AWS 리전으로 자동 라우팅해 애플리케이션이 목적지 리전을 직접 관리하지 않도록 하며, OpenAI Responses API, Chat Completions API, Amazon Bedrock Converse API를 제공한다. 예제는 Python과 AWS CLI로 프로파일을 확인하고, 단기 API 키 또는 AWS SigV4로 모델을 호출하며, GPT-5.6의 암시적·명시적 Prompt Caching을 적용하는 흐름을 담고 있다. Codex는 OIDC 기반 임시 AWS 자격 증명과 Amazon Bedrock Runtime 공급자를 사용하고, CloudWatch Coding Agent Insights는 OTel을 통해 토큰 사용량, 요청 활동, 캐시 적중률 등을 모니터링한다. 운영 전에는 소스 리전별 RPM·TPM 할당량, 출력 토큰의 버다운 비율, 동시성, 피크 트래픽을 점검하고 필요한 할당량 증액을 요청해야 한다.

섹션별 상세

01
호주 AWS 계정은 Asia Pacific (Sydney)의 ap-southeast-2 또는 Asia Pacific (Melbourne)의 ap-southeast-4를 소스 리전으로 삼아 Amazon Bedrock의 GPT-5.6 글로벌 추론 프로파일에 접근할 수 있다. global.openai.gpt-5.6-sol, global.openai.gpt-5.6-terra, global.openai.gpt-5.6-luna 프로파일은 요청을 지원되는 상업용 AWS 리전으로 라우팅하므로 애플리케이션이 목적지 리전 선택과 용량 관리를 직접 수행하지 않는다. 다만 프로파일 구성원과 모델 가용성은 바뀔 수 있어 배포 전에 Cross-Region inference 지원 현황을 확인해야 한다.
bash
aws bedrock list-inference-profiles \
 --region ap-southeast-2 \
 --type-equals SYSTEM_DEFINED \
 --query "inferenceProfileSummaries[?contains(inferenceProfileId, 'openai.gpt-5.6')].[inferenceProfileId,status]" \
 --output table
aws bedrock get-inference-profile \
 --region ap-southeast-2 \
 --inference-profile-identifier global.openai.gpt-5.6-terra

Sydney 소스 리전에서 활성화된 GPT-5.6 글로벌 추론 프로파일을 조회하고 Terra 프로파일의 세부 정보를 확인한다.

Amazon Bedrock 콘솔의 Inference profiles 화면에서 Asia Pacific (Sydney)가 선택되어 있고 Global OpenAI GPT-5.6 Terra 프로파일이 필터링되어 있다.
Screenshot화면은 system-defined inference profiles 목록에서 Global OpenAI GPT-5.6 Terra를 선택한 상태를 담고 있다. 모델명, inference profile ID, ARN, 요청을 라우팅할 AWS Regions 열이 함께 표시되어 글에서 안내한 Sydney 소스 리전의 프로파일 확인 절차와 직접 연결된다.
02
Amazon Bedrock Runtime은 OpenAI Responses API, OpenAI Chat Completions API, Amazon Bedrock Converse API라는 세 가지 호출 경로를 제공한다. OpenAI SDK를 유지하는 애플리케이션은 /openai/v1 엔드포인트에 단기 모델 API 키를 연결하고, AWS SDK 기반 애플리케이션은 Boto3의 표준 자격 증명 체인과 Converse API를 사용하면 된다. Responses API와 Converse API 모두 스트리밍 경로를 제공해 응답 이벤트에서 텍스트 조각을 순차적으로 출력할 수 있다.
python
from aws_bedrock_token_generator import provide_token
from openai import OpenAI
region = "ap-southeast-2" # Use "ap-southeast-4" for Melbourne.
model_id = "global.openai.gpt-5.6-terra"
prompt = ( "In three short bullet points, explain how Availability Zones " "help make an AWS application highly available." )
openai_client = OpenAI(
    base_url=f"https://bedrock-runtime.{region}.amazonaws.com/openai/v1",
    api_key=provide_token(region=region),
)
responses_result = openai_client.responses.create(
    model=model_id,
    input=prompt,
    max_output_tokens=300,
)
print(responses_result.output_text)

현재 AWS 자격 증명으로 단기 Amazon Bedrock 모델 API 키를 만든 뒤 OpenAI SDK의 Responses API를 Regional Amazon Bedrock Runtime 엔드포인트에 연결한다.

python
import boto3
region = "ap-southeast-2" # Use "ap-southeast-4" for Melbourne.
model_id = "global.openai.gpt-5.6-terra"
prompt = ( "In three short bullet points, explain how Availability Zones " "help make an AWS application highly available." )
messages = [
    {
        "role": "user",
        "content": [{"text": prompt}],
    }
]
bedrock_client = boto3.client("bedrock-runtime", region_name=region)
converse_result = bedrock_client.converse(
    modelId=model_id,
    messages=messages,
    inferenceConfig={"maxTokens": 300},
)
print(converse_result["output"]["message"]["content"][0]["text"])

AWS SDK와 Boto3의 표준 자격 증명 체인을 사용해 Amazon Bedrock Converse API로 동일한 글로벌 프로파일을 호출한다.

03
GPT-5.6의 추론 비용은 반복 입력을 어떻게 처리하느냐에 따라 달라지므로 Prompt Caching을 활용할 수 있다. 암시적 캐싱은 기본 활성화되어 코드 변경 없이 동작하고, 명시적 캐싱은 재사용할 prefix와 캐시 경계, 캐시 키를 애플리케이션이 지정한다. 따라서 동일한 긴 입력을 반복하는 호출에서는 캐시 쓰기 입력 토큰과 일반 입력 토큰이 할당량에 반영되는 방식을 함께 점검해야 한다.
04
Codex는 Amazon Bedrock Runtime의 동일한 글로벌 추론 프로파일을 사용하도록 구성할 수 있으며, 글에서는 codex-cli 0.149.1과 GPT-5.6 Sol 조합을 검증했다. AWS OIDC Auth Helper는 Okta, Auth0, Microsoft Entra ID, Amazon Cognito, AWS IAM Identity Center 같은 Identity Provider의 OIDC 토큰을 임시 AWS 자격 증명으로 교환하고, credential_process를 통해 Codex에 전달한다. 이후 Codex는 AWS SigV4로 요청을 서명하므로 추론 경로에 정적 API 키를 저장하지 않는다.
toml
model = "global.openai.gpt-5.6-sol"
model_provider = "amazon-bedrock-runtime"
model_reasoning_effort = "high"
[model_providers.amazon-bedrock-runtime.aws]
profile = ""
region = "ap-southeast-2"

Codex가 Amazon Bedrock Runtime을 모델 공급자로 사용하고 AWS 프로파일과 Sydney 리전을 통해 GPT-5.6 Sol을 호출하도록 설정한다.

05
GPT-5.6 온디맨드 할당량은 RPM과 TPM으로 관리되며, TPM 소비량은 입력 토큰과 캐시 쓰기 입력 토큰, 출력 토큰에 모델별 버다운 비율을 적용해 계산한다. 이 글의 예시에서는 GPT-5.6의 입력 토큰과 캐시 쓰기 입력 토큰이 각각 1 대 1로 계산되고 출력 토큰 하나가 할당량에서 10토큰을 소비한다. 운영 전에는 애플리케이션이 사용하는 소스 리전의 Service Quotas에서 현재 값을 확인하고, 대표 프롬프트와 출력 길이, 스트리밍, 동시성, 피크 트래픽으로 부하를 검증해야 한다.
toml
[otel]
environment = "production"
[otel.metrics_exporter]
otlp-http = { endpoint = "https://monitoring.ap-southeast-2.amazonaws.com/v1/metrics", protocol = "binary", headers = { "Authorization" = "Bearer YOUR_CLOUDWATCH_METRICS_API_KEY" } }

Codex의 OTel 메트릭을 Sydney의 CloudWatch OTLP/HTTP 엔드포인트로 전송하기 위해 Bearer 인증과 운영 환경을 설정한다.

06
Amazon Bedrock Runtime 요청은 글로벌 추론 프로파일을 사용하더라도 일반 온디맨드 요청처럼 모델 호출 로깅에 기록된다. Codex는 OpenTelemetry와 OTLP/HTTP를 통해 메트릭을 내보내며, CloudWatch Coding Agent Insights는 토큰 사용량, API 요청, 활성 사용자, 대화 턴, 캐시 적중률과 조직 차원의 필터를 제공한다. Bearer 방식은 CloudWatch 메트릭 API 키를 config.toml에 저장해야 하므로 장기 자격 증명으로 취급해야 하고, 기업 SSO 환경에서는 개발자의 연합 자격 증명으로 SigV4 서명하는 Enterprise rollout이 토큰 배포를 피하는 경로가 된다.
Asia Pacific (Sydney)의 CloudWatch Coding Agent Insights에서 Codex의 총 토큰, API 요청, 활성 사용자, 대화 턴, 캐시 적중률을 보여준다.
Screenshot대시보드는 Codex 탭에서 총 토큰 1.16M, API Requests 6, Active Users 1, Conversation Turns 12, Cache Hit Rate 98.3을 요약 카드로 표시한다. 하단에는 시간별 토큰 사용량, 부서별 사용량, 입력·출력·캐시 입력·추론 출력 유형별 사용량, API 요청 결과와 도구 호출 활동이 나타나 글의 OTel 기반 Codex 관측성 구성을 시각적으로 뒷받침한다.

용어 해설

글로벌 교차 리전 추론(Global Cross-Region Inference)
애플리케이션이 특정 AWS 리전의 Amazon Bedrock Runtime 엔드포인트를 호출하면 Amazon Bedrock이 지원되는 상업용 AWS 리전으로 추론 요청을 라우팅하는 방식이다. 애플리케이션이 목적지 리전을 직접 관리하지 않아도 더 넓은 용량 풀을 활용할 수 있다는 점이 핵심이다.
추론 프로파일(Inference Profile)
모델과 추론 요청을 처리할 AWS 리전 정보를 묶은 Amazon Bedrock의 시스템 정의 식별자다. 이 글에서는 global.openai.gpt-5.6-sol, global.openai.gpt-5.6-terra, global.openai.gpt-5.6-luna 프로파일을 사용해 호주 소스 리전에서 요청을 전송한다.
프롬프트 캐싱(Prompt Caching)
반복되는 프롬프트 일부를 캐시에 저장해 이후 요청에서 동일한 입력을 다시 처리하는 비용을 줄이는 기능이다. GPT-5.6은 기본 활성화되는 암시적 캐싱과 재사용 prefix, 캐시 경계, 캐시 키를 직접 지정하는 명시적 캐싱을 지원한다.
토큰 버다운(Token Burndown)
요청이 분당 토큰 한도 TPM을 얼마나 소비하는지 계산하는 방식이다. GPT-5.6에서는 입력 토큰과 캐시 쓰기 입력 토큰이 각각 1 대 1로 계산되고, 출력 토큰은 모델의 버다운 비율에 따라 더 큰 할당량을 차감한다.
OpenID Connect
외부 Identity Provider의 인증 결과를 AWS 임시 자격 증명으로 교환하는 연합 인증 방식이다. Codex 구성에서는 AWS OIDC Auth Helper가 OIDC 토큰을 임시 AWS 자격 증명으로 바꾸고, Codex가 표준 AWS 자격 증명 체인을 통해 이를 사용한다.
OpenTelemetry
애플리케이션의 메트릭과 추적 데이터를 표준 형식으로 수집하고 전송하는 관측성 프레임워크다. Codex는 OTel을 사용해 OTLP/HTTP로 메트릭을 내보내며, CloudWatch Coding Agent Insights가 토큰 사용량과 요청 활동을 시각화한다.

기술

  • Amazon Bedrock Runtime
  • OpenAI Responses API
  • OpenAI Chat Completions API
  • Amazon Bedrock Converse API
  • AWS CLI
  • Python
  • Boto3
  • Codex CLI
  • OpenTelemetry
  • OTLP/HTTP
  • AWS IAM Identity Center

활용 사례

  • 호주 리전에서 GPT-5.6 기반 reasoning 애플리케이션 운영
  • GPT-5.6을 활용한 coding workload와 agentic workload
  • 긴 공통 prefix를 반복하는 호출의 Prompt Caching
  • Codex를 Amazon Bedrock Runtime에 연결한 개발 환경
  • CloudWatch Coding Agent Insights를 이용한 Codex 토큰·요청 사용량 모니터링
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 03.수집 2026. 09. 03.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.