TL;DR
호주 팀은 Asia Pacific (Sydney)와 Asia Pacific (Melbourne)의 Amazon Bedrock Runtime 엔드포인트를 통해 OpenAI GPT-5.6 Sol, Terra, Luna 글로벌 추론 프로파일을 사용할 수 있다. Amazon Bedrock은 요청을 지원되는 상업용 AWS 리전으로 자동 라우팅해 애플리케이션이 목적지 리전을 직접 관리하지 않도록 하며, OpenAI Responses API, Chat Completions API, Amazon Bedrock Converse API를 제공한다. 예제는 Python과 AWS CLI로 프로파일을 확인하고, 단기 API 키 또는 AWS SigV4로 모델을 호출하며, GPT-5.6의 암시적·명시적 Prompt Caching을 적용하는 흐름을 담고 있다. Codex는 OIDC 기반 임시 AWS 자격 증명과 Amazon Bedrock Runtime 공급자를 사용하고, CloudWatch Coding Agent Insights는 OTel을 통해 토큰 사용량, 요청 활동, 캐시 적중률 등을 모니터링한다. 운영 전에는 소스 리전별 RPM·TPM 할당량, 출력 토큰의 버다운 비율, 동시성, 피크 트래픽을 점검하고 필요한 할당량 증액을 요청해야 한다.
섹션별 상세
aws bedrock list-inference-profiles \
--region ap-southeast-2 \
--type-equals SYSTEM_DEFINED \
--query "inferenceProfileSummaries[?contains(inferenceProfileId, 'openai.gpt-5.6')].[inferenceProfileId,status]" \
--output table
aws bedrock get-inference-profile \
--region ap-southeast-2 \
--inference-profile-identifier global.openai.gpt-5.6-terraSydney 소스 리전에서 활성화된 GPT-5.6 글로벌 추론 프로파일을 조회하고 Terra 프로파일의 세부 정보를 확인한다.

from aws_bedrock_token_generator import provide_token
from openai import OpenAI
region = "ap-southeast-2" # Use "ap-southeast-4" for Melbourne.
model_id = "global.openai.gpt-5.6-terra"
prompt = ( "In three short bullet points, explain how Availability Zones " "help make an AWS application highly available." )
openai_client = OpenAI(
base_url=f"https://bedrock-runtime.{region}.amazonaws.com/openai/v1",
api_key=provide_token(region=region),
)
responses_result = openai_client.responses.create(
model=model_id,
input=prompt,
max_output_tokens=300,
)
print(responses_result.output_text)현재 AWS 자격 증명으로 단기 Amazon Bedrock 모델 API 키를 만든 뒤 OpenAI SDK의 Responses API를 Regional Amazon Bedrock Runtime 엔드포인트에 연결한다.
import boto3
region = "ap-southeast-2" # Use "ap-southeast-4" for Melbourne.
model_id = "global.openai.gpt-5.6-terra"
prompt = ( "In three short bullet points, explain how Availability Zones " "help make an AWS application highly available." )
messages = [
{
"role": "user",
"content": [{"text": prompt}],
}
]
bedrock_client = boto3.client("bedrock-runtime", region_name=region)
converse_result = bedrock_client.converse(
modelId=model_id,
messages=messages,
inferenceConfig={"maxTokens": 300},
)
print(converse_result["output"]["message"]["content"][0]["text"])AWS SDK와 Boto3의 표준 자격 증명 체인을 사용해 Amazon Bedrock Converse API로 동일한 글로벌 프로파일을 호출한다.
model = "global.openai.gpt-5.6-sol"
model_provider = "amazon-bedrock-runtime"
model_reasoning_effort = "high"
[model_providers.amazon-bedrock-runtime.aws]
profile = ""
region = "ap-southeast-2"Codex가 Amazon Bedrock Runtime을 모델 공급자로 사용하고 AWS 프로파일과 Sydney 리전을 통해 GPT-5.6 Sol을 호출하도록 설정한다.
[otel]
environment = "production"
[otel.metrics_exporter]
otlp-http = { endpoint = "https://monitoring.ap-southeast-2.amazonaws.com/v1/metrics", protocol = "binary", headers = { "Authorization" = "Bearer YOUR_CLOUDWATCH_METRICS_API_KEY" } }Codex의 OTel 메트릭을 Sydney의 CloudWatch OTLP/HTTP 엔드포인트로 전송하기 위해 Bearer 인증과 운영 환경을 설정한다.

용어 해설
- 글로벌 교차 리전 추론(Global Cross-Region Inference)
- — 애플리케이션이 특정 AWS 리전의 Amazon Bedrock Runtime 엔드포인트를 호출하면 Amazon Bedrock이 지원되는 상업용 AWS 리전으로 추론 요청을 라우팅하는 방식이다. 애플리케이션이 목적지 리전을 직접 관리하지 않아도 더 넓은 용량 풀을 활용할 수 있다는 점이 핵심이다.
- 추론 프로파일(Inference Profile)
- — 모델과 추론 요청을 처리할 AWS 리전 정보를 묶은 Amazon Bedrock의 시스템 정의 식별자다. 이 글에서는 global.openai.gpt-5.6-sol, global.openai.gpt-5.6-terra, global.openai.gpt-5.6-luna 프로파일을 사용해 호주 소스 리전에서 요청을 전송한다.
- 프롬프트 캐싱(Prompt Caching)
- — 반복되는 프롬프트 일부를 캐시에 저장해 이후 요청에서 동일한 입력을 다시 처리하는 비용을 줄이는 기능이다. GPT-5.6은 기본 활성화되는 암시적 캐싱과 재사용 prefix, 캐시 경계, 캐시 키를 직접 지정하는 명시적 캐싱을 지원한다.
- 토큰 버다운(Token Burndown)
- — 요청이 분당 토큰 한도 TPM을 얼마나 소비하는지 계산하는 방식이다. GPT-5.6에서는 입력 토큰과 캐시 쓰기 입력 토큰이 각각 1 대 1로 계산되고, 출력 토큰은 모델의 버다운 비율에 따라 더 큰 할당량을 차감한다.
- OpenID Connect
- — 외부 Identity Provider의 인증 결과를 AWS 임시 자격 증명으로 교환하는 연합 인증 방식이다. Codex 구성에서는 AWS OIDC Auth Helper가 OIDC 토큰을 임시 AWS 자격 증명으로 바꾸고, Codex가 표준 AWS 자격 증명 체인을 통해 이를 사용한다.
- OpenTelemetry
- — 애플리케이션의 메트릭과 추적 데이터를 표준 형식으로 수집하고 전송하는 관측성 프레임워크다. Codex는 OTel을 사용해 OTLP/HTTP로 메트릭을 내보내며, CloudWatch Coding Agent Insights가 토큰 사용량과 요청 활동을 시각화한다.
기술
- Amazon Bedrock Runtime
- OpenAI Responses API
- OpenAI Chat Completions API
- Amazon Bedrock Converse API
- AWS CLI
- Python
- Boto3
- Codex CLI
- OpenTelemetry
- OTLP/HTTP
- AWS IAM Identity Center
활용 사례
- 호주 리전에서 GPT-5.6 기반 reasoning 애플리케이션 운영
- GPT-5.6을 활용한 coding workload와 agentic workload
- 긴 공통 prefix를 반복하는 호출의 Prompt Caching
- Codex를 Amazon Bedrock Runtime에 연결한 개발 환경
- CloudWatch Coding Agent Insights를 이용한 Codex 토큰·요청 사용량 모니터링
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.