AI资讯 / 工程

工程 / 工程

Amazon Bedrock 正式支持 OpenAI GPT-5.6 显式 Prompt 缓存

AWS Machine Learning

亚马逊云科技宣布 OpenAI GPT-5.6 系列模型(Sol、Terra、Luna)在 Amazon Bedrock 上全面可用,并推出全新的显式 Prompt 缓存功能。通过 Responses API,开发者不仅可以精确控制缓存边界,还能获得高达 90% 的 Prompt 读取价格折扣。缓存内容保留时长为 30 分钟,极大地优化了智能体工作流中重复系统提示词、工具定义与参考文档的推理成本与响应效率。

OpenAI 最新一代 GPT-5.6 旗舰模型族现已登陆 Amazon Bedrock,涵盖 Sol、Terra 和 Luna 三种能力层级。其中 Sol 专注于复杂推理与智能体编程,Terra 适用于均衡的生产环境任务,Luna 则面向分类与摘要等高速大批量场景。用户可基于按 Token 付费模式使用这些模型,同时整合 AWS 的安全与合规控制体系。

除新模型外,Bedrock 还为 GPT-5.6 引入了显式 Prompt 缓存。相比由系统自动设置断点的隐式缓存,显式模式允许开发者主动标记缓存边界。缓存读取享受 90% 的折扣优惠,写入费率为非缓存输入的 1.25 倍。当缓存读取占总 Token 流量约 20% 时,即可实现净成本下降,缓存数据保留时长为 30 分钟。

显式缓存最适合频繁重复系统指令、工具定义和长参考文档的智能体工作流。开发者可通过标准的 OpenAI SDK 配合 aws-bedrock-token-generator 工具包接入 Bedrock 端点。利用 AWS IAM 临时凭证生成 Bearer Token,既简化了身份验证流程,又避免了在代码中硬编码长期密钥的安全风险。

GPT-5.6 还支持从 none 到 xhigh 等多个推理努力等级,默认设置为 medium。对于简单任务,将推理等级调至 none 可实现最低延迟输出,此时还自由支持采样参数调节。模型同步全面兼容原生函数调用与严格 JSON Schema 结构化输出,方便平滑迁移现有的 GPT 任务。

要点

  • GPT-5.6 Sol、Terra 和 Luna 三款模型现已在 Amazon Bedrock 全面可用,通过 Responses API 提供服务。
  • 显式 Prompt 缓存赋予开发者对缓存边界的精准控制,缓存读取费用降低 90%,缓存数据保留 30 分钟。
  • 当缓存读取比例达到约 20% 时即可实现净推理成本节省,特别适用于智能体与多轮对话场景。
  • 开发者可通过 AWS 凭证生成短期令牌,配合标准 OpenAI Python SDK 无缝接入并精细控制推理努力等级。
查看原始来源

原始标题:Introducing explicit prompt caching for OpenAI GPT-5.6 models on Amazon Bedrock

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。