工程 / 工程
Amazon Bedrock 为 OpenAI GPT-5.6 系列模型引入跨区域推理能力
Amazon Bedrock 宣布为 OpenAI GPT-5.6 系列的三款通用模型——Sol、Terra 和 Luna——正式引入跨区域推理(CRIS)功能,覆盖超过 25 个 AWS 区域。跨区域推理通过推理配置文件实现,允许请求从源区域发出后,由 Amazon Bedrock 自动路由至具备可用算力的目标区域,从而提升整体吞吐量并在高负载下维持稳定性能。此次上线提供两类推理配置文件:美国地理推理配置文件将请求限定在美国及加拿大境内的多个区域之间路由,适合有数据驻留合规要求的工作负载;全球推理配置文件则可跨越美洲、欧洲、亚太、中东等所有支持的商业区域进行动态调度,适合对地理限制无要求的场景。三款模型均支持文本与图像输入、百万级 Token 上下文窗口、推理模式及提示缓存,可通过 OpenAI Responses API、Chat Completions API 以及 Amazon Bedrock Converse API 调用。
Amazon Bedrock 与 OpenAI 联合推出了针对 GPT-5.6 系列模型的跨区域推理功能。GPT-5.6 家族包含通用型和网络安全专用型两类变体,此次支持跨区域推理的三款通用模型分别为 Sol、Terra 和 Luna,三者在能力与成本之间各有侧重,用户可根据实际业务需求灵活选择。所有三款模型均支持文本和图像输入,上下文窗口达 100 万 Token,并具备推理模式、服务端工具调用和提示缓存等高级功能。
跨区域推理的核心机制是推理配置文件。用户在调用时传入配置文件标识符而非原始模型 ID,Amazon Bedrock 便会依据实时算力情况将请求路由至合适的目标区域。这一机制的本质是容量扩展手段——通过汇聚多个区域的算力资源,避免单一区域算力瓶颈对推理性能造成影响,从而在流量高峰期依然保持稳定的响应速度。
地理推理配置文件(如 us.openai.gpt-5.6-terra)将请求路由范围限定在预定义地理范围内的多个区域之间。以美国地理配置文件为例,源区域可以是美国东部、西部或加拿大,目标区域同样限定在这一地理范围内,确保数据处理全程不跨越地理边界。这对于受 GDPR 或其他数据主权法规约束的企业工作负载尤为重要,既能实现跨区域扩容,又能满足合规要求。
全球推理配置文件(如 global.openai.gpt-5.6-terra)则提供最广泛的算力池,可将请求路由至全球所有支持该模型的 AWS 商业区域,涵盖美洲、欧洲、亚太、中东及南美等地区,共超过 25 个区域。该配置文件基于实时容量动态调度,适合对数据处理地理位置无限制要求的工作负载。需要注意的是,通过全球配置文件处理的数据可能跨越多个区域,有数据驻留需求的用户应选择地理配置文件或直接指定单一区域调用。
在计费与配额管理方面,无论实际请求由哪个后端区域处理,费用和吞吐量配额均统一计入用户账户,保持单一的支出与使用量视图,简化了成本管控。用户可通过 Amazon Bedrock 控制台的文本操场直接体验 GPT-5.6 的跨区域推理功能,无需编写代码即可切换地理配置文件与全球配置文件进行对比测试。
在 API 集成层面,GPT-5.6 的跨区域推理配置文件与 OpenAI Responses API、Chat Completions API 以及 Amazon Bedrock Converse API 完全兼容,流式输出同样受到支持。开发者只需在调用时将模型 ID 替换为对应的推理配置文件标识符,即可无缝接入跨区域推理能力,现有代码改动量极小,迁移成本低。
要点
- GPT-5.6 的 Sol、Terra、Luna 三款模型现已在 Amazon Bedrock 上支持跨区域推理,覆盖超过 25 个 AWS 区域,显著提升高并发场景下的推理吞吐量。
- 地理推理配置文件将数据处理限定在特定地理范围内,适合有数据驻留合规要求的企业;全球推理配置文件则提供最大算力池,适合无地理限制的工作负载。
- 三款模型均支持百万级 Token 上下文窗口、推理模式、提示缓存及服务端工具调用,可通过 OpenAI 和 Bedrock 双套 API 体系调用。
- 计费与配额统一归集至用户账户,不因后端路由区域不同而产生分散的费用记录,便于成本管控与审计。
- 开发者仅需将调用中的模型 ID 替换为推理配置文件标识符,即可以极低的代码改动成本接入跨区域推理能力。
原始标题:Introducing cross-Region inference for OpenAI GPT-5.6 models on Amazon Bedrock
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。