본문으로 건너뛰기

Amazon Bedrock의 GPT-5.6 리전 간 추론

Amazon Bedrock에서 GPT-5.6 세 변형을 geographic·global 프로파일로 호출합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Amazon Bedrock은 GPT-5.6의 Sol, Terra, Luna를 25개가 넘는 AWS Region에 제공하고, inference profile을 통해 geographic 또는 global Cross-Region inference를 지원합니다. Geographic profile은 지정된 지리 범위 안에서만 요청을 라우팅하고 global profile은 지원되는 상용 AWS Region 전체의 실시간 용량을 활용하므로, 데이터 처리 경계와 확장 가능한 용량 중 필요한 기준에 따라 선택할 수 있습니다. 모델은 OpenAI Responses API, Chat Completions API, Amazon Bedrock Converse API와 streaming을 지원하며, IAM·SCP 권한, prompt caching, profile별 TPM quota와 10x 출력 burndown rate를 함께 고려해야 합니다.

섹션별 상세

01
Amazon Bedrock에서 OpenAI GPT-5.6의 일반 목적 변형인 Sol, Terra, Luna를 25개가 넘는 AWS Region에서 사용할 수 있게 됐으며 세 모델 모두 Cross-Region inference를 지원합니다. 세 변형은 텍스트와 이미지 입력을 받아 텍스트를 반환하고 1 million token context window, reasoning mode, server-side tool calling, prompt caching을 제공합니다. 따라서 기존 OpenAI 또는 Bedrock 애플리케이션은 모델별 기능과 비용 균형을 비교하면서 동일한 서비스 경로에 통합할 수 있습니다.
02
Cross-Region inference는 inference profile을 통해 요청을 넓은 컴퓨팅 용량 풀로 라우팅해 한 Region의 처리 용량에 묶이지 않도록 합니다. geographic profile인 us.openai.gpt-5.6-terra는 source Region에서 요청을 받은 뒤 미국과 캐나다 등 프로파일에 정의된 지리 범위 안의 destination Region으로만 보낼 수 있고, global.openai.gpt-5.6-terra는 모델이 배포된 지원 상용 AWS Region 전체에서 실시간 용량을 기준으로 목적지를 선택합니다. 데이터 처리 경계를 지켜야 하면 geographic profile을, 가장 넓은 용량 풀을 우선하면 global profile을 선택하는 구조입니다.
03
Amazon Bedrock 콘솔에서는 코딩이나 SDK 설정 없이 Text playground에서 GPT-5.6을 시험할 수 있습니다. 사용자는 모델 선택기에서 OpenAI GPT-5.6 Sol을 검색한 뒤 US OpenAI GPT-5.6 Sol 또는 Global OpenAI GPT-5.6 Sol을 고르고 prompt를 실행해 두 라우팅 방식을 비교할 수 있습니다. 이미지에 표시된 모델 선택기는 US East (N. Virginia)를 source Region으로 사용하며 US 항목과 Global 항목을 각각 geographic profile과 global profile로 구분합니다.
python
from aws_bedrock_token_generator import provide_token
from openai import OpenAI

region = "us-east-1"
# Point the OpenAI SDK at Amazon Bedrock's OpenAI-compatible endpoint for your Region.
provide_token() generates a short-term Amazon Bedrock API key from your current AWS credentials (valid up to 12 hours), so no static key needs to be stored.
client = OpenAI(
    base_url= f"https://bedrock-runtime.{region}.amazonaws.com/openai/v1",
    api_key=provide_token(region=region),
)
# Use the global inference profile ID for GPT-5.6 Terra.
model_id = "global.openai.gpt-5.6-terra"
response = client.responses.create(
    model=model_id,
    input="Summarize the difference between horizontal and vertical scaling in two sentences.",
    max_output_tokens=512,
)
print(response.output_text)

OpenAI SDK를 Amazon Bedrock의 OpenAI 호환 endpoint에 연결하고 global inference profile로 GPT-5.6 Terra를 호출합니다.

python
response = client.chat.completions.create(
    # For US Geo CRIS, use "us.openai.gpt-5.6-terra".
    # Other variants: gpt-5.6-sol, gpt-5.6-luna
    model="global.openai.gpt-5.6-terra",
    messages=[
        {"role": "user", "content": "In one sentence, what is cross-Region inference in Amazon Bedrock?",}
    ],
    max_completion_tokens=2000,
    reasoning_effort="low",
)
print(response.choices[0].message.content)

기존 Chat Completions 형식의 애플리케이션에서 global 또는 US geographic 프로파일을 지정해 요청을 보냅니다.

python
import boto3
client = boto3.client("bedrock-runtime", region_name="us-east-1")
model_id = "global.openai.gpt-5.6-terra"
response = client.converse(
    modelId=model_id,
    messages=[{"role": "user", "content": [{"text": "List three common uses for a message queue."}]}],
    inferenceConfig={"maxTokens": 512},
)
print(response["output"]["message"]["content"][0]["text"])

boto3로 Amazon Bedrock Converse API를 직접 호출해 다른 Bedrock 모델과 유사한 요청 형태로 GPT-5.6 Terra를 실행합니다.

python
stream_response = client.converse_stream(
    modelId=model_id,
    messages=[{"role": "user", "content": [{"text": "List three common uses for a message queue."}]}],
    inferenceConfig={"maxTokens": 512},
)
for event in stream_response["stream"]:
    if "contentBlockDelta" in event:
        print(event["contentBlockDelta"]["delta"]["text"], end="")

ConverseStream의 이벤트 스트림을 순회하면서 생성되는 텍스트 조각을 즉시 출력합니다.

Amazon Bedrock 콘솔의 모델 선택 창에서 OpenAI GPT-5.6 Sol의 US 및 Global inference profile을 선택하는 화면입니다.
Screenshot화면 왼쪽에는 Amazon Bedrock Playground가 열려 있고, 중앙 모델 선택 창에는 검색어 openai의 결과로 US OpenAI GPT-5.6 Terra, Global OpenAI GPT-5.6 Terra, US OpenAI GPT-5.6 Luna, Global OpenAI GPT-5.6 Luna, US OpenAI GPT-5.6 Sol, Global OpenAI GPT-5.6 Sol이 나열되어 있습니다. 이 목록은 같은 GPT-5.6 변형에 대해 지리적 범위를 제한하는 US profile과 지원 Region 전체를 대상으로 하는 Global profile을 콘솔에서 구분해 선택할 수 있다는 본문의 절차와 연결됩니다.
04
기존 OpenAI SDK 애플리케이션은 base_url을 Amazon Bedrock의 OpenAI 호환 endpoint로 바꾸고 model 파라미터에 inference profile ID를 넣어 Responses API와 Chat Completions API를 호출할 수 있습니다. Amazon Bedrock API key는 bearer token으로 전달되며 aws-bedrock-token-generator의 provide_token()은 현재 AWS 자격 증명에서 최대 12시간 유효한 단기 키를 생성합니다. Bedrock을 직접 호출하는 애플리케이션은 boto3의 Converse API를 사용할 수 있고 ConverseStream으로 이벤트 스트림을 순회하며 생성 텍스트를 실시간으로 처리할 수 있습니다.
05
Cross-Region inference에도 직접적인 in-Region 호출과 같은 IAM, VPC endpoint, CloudTrail, data perimeter 통제가 적용됩니다. 호출 기록은 source Region의 CloudTrail에 남고 additionalEventData.inferenceRegion에서 실제 처리 Region을 확인할 수 있으며, model invocation logging을 켜면 payload를 같은 계정과 Region의 Amazon S3 또는 CloudWatch Logs로 보낼 수 있습니다. 다만 GPT-5.6을 포함한 일부 모델은 automated abuse-detection classifier가 표시한 콘텐츠를 offline abuse detection을 위해 최대 30일 보관할 수 있으므로 데이터 보존 설정과 적용 대상을 확인해야 합니다.
06
Inference profile을 호출하려는 IAM role에는 profile 자체와 라우팅 가능한 모든 Region의 foundation model에 대한 권한이 필요합니다. geographic profile 정책은 profile·project/default 접근, source 및 destination Region의 모델 접근, bearer-token 인증을 함께 허용하고, global profile 정책은 여기에 Region-agnostic global ARN을 통한 모델 접근을 추가합니다. ConverseStream을 사용하면 관련 profile과 foundation-model statement에 bedrock:InvokeModelWithResponseStream 권한도 넣어야 하며, 정책 statement 하나라도 빠지면 해당 프로파일의 Cross-Region 접근이 거부됩니다.
07
Region 제한 SCP를 사용하는 조직에서는 global CRIS 요청의 aws:RequestedRegion 값이 특정 Region이 아닌 unspecified로 평가된다는 점이 핵심입니다. 권장 방식은 전체 Region 허용 목록을 넓히지 않고 bedrock:InferenceProfileArn 조건으로 us.와 global. 프로파일을 예외 처리하는 것이며, source Region은 여전히 허용 목록에 있어야 합니다. destination Region과 unspecified를 전역 허용 목록에 직접 추가하면 Amazon Bedrock뿐 아니라 모든 서비스에 해당 Region 접근이 열릴 수 있습니다.
08
GPT-5.6의 prompt caching은 긴 system prompt나 few-shot 예시처럼 반복되는 prefix를 캐시해 후속 요청에서 재처리하지 않도록 합니다. 기본 implicit caching은 최신 user 또는 tool message에 cache breakpoint를 두고, 안정적인 prefix 뒤에 매번 다른 내용이 이어지는 경우에는 explicit breakpoint를 지정하며 두 방식 모두 최소 1,024토큰의 prefix와 선택적 prompt_cache_key를 사용합니다. Cache read tokens는 TPM quota에 포함되지 않으므로 캐시 재사용은 비용과 지연뿐 아니라 quota 소비도 줄입니다.
python
completion = client.chat.completions.create(
    model=model_id,
    messages=[
        {
            "role": "system",
            "content": [
                {
                    "type": "text",
                    "text": support_policy_manual,
                    "prompt_cache_breakpoint": {"mode": "explicit"},
                }
            ],
        },
        {"role": "user", "content": "A customer wants a refund for a damaged laptop. What must I verify first?"},
    ],
    max_completion_tokens=300,
    prompt_cache_key="support-policy-v1",
)

# To confirm that caching is working, check the usage object of each response.
details = completion.usage.prompt_tokens_details
print("Cached tokens:", details.cached_tokens)
print("Written tokens:", details.cache_write_tokens)

반복되는 system prompt의 끝에 명시적 cache breakpoint를 설정하고 응답 사용량에서 캐시된 토큰과 기록된 토큰을 확인합니다.

09
GPT-5.6 on-demand quota는 호출한 inference profile별 TPM으로 관리되며 geographic profile과 global profile은 같은 모델이어도 별도의 할당량을 사용합니다. 할당량 계산은 입력 토큰 수 + cache write input tokens + 출력 토큰 수 × burndown rate이고, GPT-5.6의 출력 burndown rate는 10x이므로 입력 2,000토큰과 출력 1,000토큰 요청은 12,000토큰을 소모합니다. 배포 전 Service Quotas에서 증액을 신청하고, CloudWatch 지표로 프로파일별 사용량을 감시하며, 실제 peak traffic과 production-size prompt를 포함한 부하 테스트를 수행해야 합니다.
10
관측성과 비용 추적은 요청을 받은 source Region을 중심으로 유지되지만 실제 처리 위치와 profile별 차이는 별도로 확인해야 합니다. Amazon CloudWatch에는 inference count, token count, latency, throttle, error 지표가 geographic profile과 global profile별로 기록되고 invocation log는 Amazon S3 또는 CloudWatch Logs로 전달됩니다. destination Region에 따라 요청 지연이 달라질 수 있으므로 Region별 대시보드와 함께 애플리케이션과 quota가 직접 연결된 inference profile ID 기준 집계도 구성하는 편이 적절합니다.

용어 해설

리전 간 추론(Cross-Region inference)
리전 간 추론은 한 AWS Region에서 요청을 받은 뒤 다른 Region의 컴퓨팅 용량으로 모델을 실행하는 방식입니다. Amazon Bedrock에서는 inference profile이 모델과 라우팅 가능한 Region 집합을 묶고, 실시간 용량에 따라 요청을 목적지 Region으로 보냅니다. 단일 Region의 용량 제약을 완화해 처리량과 부하 상황의 성능 일관성을 높이는 데 중요합니다.
추론 프로파일(Inference profile)
Inference profile은 원시 모델 ID 대신 호출에 사용하는 논리적 식별자이며, 특정 모델과 요청을 처리할 AWS Region 집합을 정의합니다. geographic profile은 지정된 지리 범위 안에서만 라우팅하고, global profile은 지원되는 상용 AWS Region 전체를 용량에 따라 선택합니다. 애플리케이션은 하나의 프로파일 ID를 호출하면서 라우팅, 할당량, 관측 정보를 프로파일 단위로 관리할 수 있습니다.
프롬프트 캐싱(Prompt caching)
Prompt caching은 반복 요청에 공통으로 포함되는 긴 프롬프트 접두사를 저장한 뒤 후속 요청에서 다시 처리하지 않는 방식입니다. GPT-5.6에서는 암시적 캐싱과 명시적 cache breakpoint를 지원하며, 공통 접두사가 최소 1,024토큰이어야 합니다. 캐시 읽기 토큰은 TPM 할당량 계산에서 제외되어 입력 비용과 지연뿐 아니라 quota 소모도 줄입니다.
토큰 소모율(Burndown rate)
Burndown rate는 입력·출력 토큰이 TPM 할당량 사용량으로 변환되는 비율입니다. GPT-5.6에서는 입력 토큰이 1:1로 계산되지만 출력 토큰에는 10배 비율이 적용되어, 할당량 사용량은 입력 토큰과 cache write 토큰에 출력 토큰의 10배를 더해 산출됩니다. 따라서 출력이 많은 서비스는 단순한 원시 토큰 수보다 훨씬 빠르게 quota를 소모할 수 있습니다.
서비스 제어 정책(Service control policy)
Service control policy는 AWS 조직에서 계정과 서비스가 사용할 수 있는 Region이나 작업 범위를 제한하는 정책입니다. Global CRIS 요청은 aws:RequestedRegion을 특정 Region명이 아닌 unspecified로 설정하므로 일반적인 Region 허용 목록과 충돌할 수 있습니다. Amazon Bedrock은 bedrock:InferenceProfileArn 조건을 사용해 CRIS 프로파일만 예외로 허용하면서 다른 서비스의 Region 제한은 유지할 수 있습니다.

기술

  • Amazon Bedrock
  • OpenAI GPT-5.6
  • OpenAI Responses API
  • OpenAI Chat Completions API
  • Amazon Bedrock Converse API
  • ConverseStream
  • OpenAI SDK
  • aws-bedrock-token-generator
  • boto3
  • AWS Identity and Access Management (IAM)
  • Amazon S3
  • Amazon CloudWatch Logs
  • AWS CloudTrail
  • Amazon CloudWatch
  • AWS Service Quotas
  • Service control policy

활용 사례

  • 데이터 처리 지리 경계를 유지하면서 여러 Region으로 GPT-5.6 추론을 확장하는 애플리케이션
  • 가장 넓은 AWS 상용 Region 용량 풀을 활용하는 출력 중심 생성 서비스
  • 기존 OpenAI SDK 애플리케이션의 Amazon Bedrock 전환
  • 긴 system prompt와 few-shot 예시를 반복 사용하는 대화형 애플리케이션
  • Amazon Bedrock 콘솔에서 GPT-5.6 Sol, Terra, Luna의 응답을 비교하는 사전 검증
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 21.수집 2026. 08. 21.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.