AWS는 GPT-5.6 Sol·Terra·Luna를 bedrock-runtime 엔드포인트에서 제공하면서 Responses, Converse, Chat Completions API를 지원하고, Geo 및 Global 리전 간 추론 기능을 추가했다.
In-Region 방식은 요청을 선택한 하나의 AWS 리전 안에서 처리한다. 초기 제공 지역은 Sol의 경우 미국 동부(버지니아 북부)와 미국 동부(오하이오)였고, Terra와 Luna는 여기에 미국 서부(오리건)가 추가됐다.
Geo cross-Region inference는 미국, 유럽연합(EU), 일본, 호주처럼 미리 정한 지리적 범위 안에서 여러 리전의 처리 용량을 활용한다. 특정 국가나 권역 밖으로 데이터를 보내지 않아야 하는 조직이 단일 리전에만 고정되지 않고 처리량을 늘릴 수 있는 방식이다.
Global cross-Region inference는 global.로 시작하는 추론 프로파일을 사용해, 모델이 배포된 지원 상업용 AWS 리전 가운데 실시간 용량이 있는 곳으로 요청을 보낸다. 지리적 데이터 처리 제한이 없는 경우 가장 넓은 용량 풀을 활용할 수 있어 수요 급증이나 특정 리전의 혼잡에 대응하기 쉽다.
반대로 데이터가 반드시 정해진 국가나 지리적 범위 안에 남아 있어야 한다면 Global 방식은 적합하지 않을 수 있다. 이 경우 In-Region 또는 Geo 방식을 검토해야 한다.
AWS가 공개한 GPT-5.6 Sol의 리전 간 모델 추론 쿼터는 지원되는 각 리전에서 분당 1,000만 토큰이다. 이 한도는 Converse, ConverseStream, InvokeModel, InvokeModelWithResponseStream 요청의 입력·출력 토큰 합계를 기준으로 계산된다.
Bedrock에서 세 모델은 텍스트와 이미지 입력, 텍스트 출력, 프롬프트 캐싱을 지원하며 최대 100만 토큰 컨텍스트 윈도를 제공한다. AWS 문서에는 27만 2,000토큰 단기 컨텍스트 가격 구간도 별도로 제시돼 있다.
이번 흐름은 최첨단 AI 모델 경쟁이 성능만의 경쟁에서 비용·속도·조달 방식의 경쟁으로 이동하고 있음을 보여준다. OpenAI는 먼저 저가형 Luna와 중간급 Terra의 가격을 크게 낮춘 뒤, 대체 유통 경로에서 Sol 할인 가격이 등장한 상황에서 플래그십 가격도 조정했다.
OpenAI는 앞선 발표에서 시스템 효율 개선이 Luna와 Terra의 가격 인하, Sol의 처리 속도 향상을 가능하게 했다고 설명했다. 즉 추론 과정의 효율 향상을 마진 확대에만 활용하지 않고, 고객 가격 인하와 속도 선택지로 일부 전환한 것이다.
기업 고객에게는 AWS Bedrock 같은 대체 조달 경로가 토큰 가격 외의 이점도 제공한다. AWS 청구·IAM 체계를 그대로 활용할 수 있고, 단일 리전에 고정할지 특정 권역 안에서 라우팅할지, 전 세계 용량을 활용할지를 선택할 수 있다. 리전 혼잡이나 일시적 장애에 대응하는 운영 경로를 마련하기도 수월하다.
다만 최저가 엔드포인트를 고르는 것이 항상 최선은 아니다. 실제 도입 전에는 다음 항목을 함께 확인해야 한다.
결국 GPT-5.6 Sol의 가격 인하는 단순한 할인 소식이라기보다, 프런티어 AI 시장에서 모델 효율, 클라우드 라우팅, API 중개 플랫폼, 기업용 규정 준수가 하나의 구매 판단으로 묶이고 있다는 신호에 가깝다.