产业 / 媒体
GPT-5.6 Sol 提速 14 倍,每秒最高输出 750 个词元
OpenAI 于 8 月 14 日宣布,以预览形式为其旗舰模型 GPT-5.6 Sol 推出 Ultrafast(超高速)模式,推理速度达到标准模式的 14 倍,最高每秒可输出 750 个词元。该模式由芯片公司 Cerebras 提供底层算力支持,旨在满足对实时响应要求极高的业务场景。OpenAI 指出,过去在模型速度与能力之间往往需要取舍,用户若追求更快的输出速度,通常不得不转向规模更小或更专用的模型。Ultrafast 模式打破了这一惯例,使高能力与高速度得以并存。目前,该模式处于有限预览阶段,仅向一小批客户开放,OpenAI 将通过早期测试评估速度提升在不同业务环节的实际价值,并观察模型能否真正跟上用户的操作节奏。
OpenAI 于 8 月 14 日正式宣布,针对其最强模型 GPT-5.6 Sol 推出 Ultrafast 超高速推理模式,并以预览形式向少量客户开放。该模式的推理速度是标准模式的 14 倍,峰值输出可达每秒 750 个词元,大幅缩短了模型在实时交互场景中的响应延迟,为需要高频、低延迟调用的业务场景提供了新的可能性。
在算力层面,Ultrafast 模式由 Cerebras 提供底层支持。Cerebras 以其晶圆级芯片架构著称,擅长处理大规模并行推理任务,能够在保持模型完整能力的同时显著提升吞吐量。此次 OpenAI 与 Cerebras 的合作,也标志着头部 AI 公司在推理基础设施层面加速向专用硬件寻求突破。
OpenAI 在公告中强调,Ultrafast 模式的核心价值在于打破了速度与能力之间的传统权衡。此前,用户若希望获得更快的响应速度,通常需要选择参数规模更小或功能更专用的模型,以牺牲部分能力为代价。而 Ultrafast 模式让 GPT-5.6 Sol 在保持完整推理能力的同时实现了极速输出,使「每秒完成更多有价值工作」成为新的产品方向。
OpenAI 列举了 Ultrafast 模式的多个早期应用场景,涵盖事故响应与可靠性分析、金融研究与安全分析、客服与语音交互、电商场景中的商品问答与库存查询,以及实时研究和实验等领域。这些场景的共同特点是对响应延迟极为敏感,模型速度的提升可以直接转化为用户体验或业务效率的改善。
目前,Ultrafast 模式仍处于有限预览阶段,OpenAI 表示将通过与早期测试客户的合作,评估速度提升在不同业务环节的实际价值,并观察模型能否真正跟上用户的操作节奏。从 Hacker News 的社区讨论来看,Cerebras 官方博客关于该合作的技术文章获得了超过 540 点赞和 228 条评论,显示出开发者社区对这一推理加速方案的高度关注。
要点
- GPT-5.6 Sol 的 Ultrafast 模式推理速度达标准模式的 14 倍,峰值每秒输出 750 个词元,是 OpenAI 迄今最快的旗舰模型推理速度。
- 该模式由 Cerebras 提供算力支持,首次实现了在不降低模型能力的前提下大幅提升推理速度,打破了速度与能力之间的传统权衡。
- 早期应用场景集中于实时性要求极高的领域,包括金融分析、客服语音交互、电商问答和事故响应等。
- 当前仅向少量客户开放有限预览,OpenAI 将通过测试数据评估速度提升的实际业务价值,后续有望扩大开放范围。
原始标题:最高每秒生成 750 个词元:OpenAI 推 Ultrafast 模式,GPT-5.6 Sol AI 提速 14 倍
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。