AI资讯 / 产业

产业 / 媒体

CPU 效率提升 6 倍,每周服务 10 亿用户

IT之家

OpenAI 近日披露了其在线存储平台 Habitat 的演进历程与技术迁移细节。Habitat 最初是一个连接 Azure Cosmos DB 的 Python 客户端库,负责数据路由、授权、加密和连接池管理,目标是让产品工程师无需直接操作数据库。随着 ChatGPT 用户规模持续扩张,该平台在 2025 年年中暴露出客户端架构的瓶颈:每次修改共享库都需要协调数十个服务同步部署,发布风险显著上升。为此,OpenAI 将 Habitat 改造为独立服务,并在 2026 年第二季度安排 2 名工程师配合 Codex 和 GPT-5.5,将整个服务用 Rust 重写。新版本目前已处理 95% 的生产请求,CPU 效率提升 6 倍,内存效率提升 15 倍,平均延迟和尾延迟均有所下降。该平台目前每秒处理超过 7000 万次请求,管理数据规模超过 500PB。

Habitat 最初诞生于 ChatGPT 早期扩张阶段,是一个与主服务器交互的 Python 库,底层对接 Azure Cosmos DB。它的核心定位是充当数据访问的统一抽象层,承担数据类型识别、路由分发、访问授权、加密处理、序列化以及连接池管理等职责,让产品工程师得以专注业务逻辑,无需直接面对数据库运维的复杂性。

随着 OpenAI 旗下产品线不断扩展,Habitat 的客户端库架构在 2025 年年中开始显现局限。每次对共享库的修改,都需要协调数十个下游服务同步完成部署,发布流程的复杂度和潜在故障风险随之攀升。为解决这一问题,OpenAI 决定将 Habitat 重构为独立的中心化服务,统一管理部署节奏、监控体系和平台级功能,同时在服务层面集中执行访问控制、审计日志和存储资源权限管理,降低未经授权访问用户数据的风险。

在性能优化层面,Python 版 Habitat 面临高并发场景下 CPU 开销大、内存占用高、请求尾延迟难以控制等挑战。工程团队通过限制并发请求数量、增加工作进程数量、优化异步任务调度等手段加以缓解,并调整了功能开关配置的刷新策略,减少大规模 JSON 解析对正常请求处理的干扰。在连接池策略上,团队发现 aiohttp 默认的 LIFO 复用方式会将流量持续集中到响应较慢的进程,改为 FIFO 策略后有效改善了负载均衡。

在数据查询设计上,Habitat 采用受限的 NoSQL API,禁止客户端执行不可控的 SQL 查询、复杂联表操作或大范围数据扫描,从架构层面规避了潜在的性能风险。对于确实需要复杂分析的场景,OpenAI 通过变更数据捕获技术将数据实时或近实时同步至 Rockset,提供离线分析和全文搜索能力,实现在线服务与分析查询的职责分离。

2026 年第二季度,OpenAI 仅调配 2 名工程师,配合 Codex 和 GPT-5.5 的辅助编码能力,在一个季度内完成了 Habitat 的 Rust 全量重写。官方数据显示,新版 Rust 服务目前已承接 95% 的生产请求,CPU 效率较 Python 版本提升 6 倍,内存效率提升 15 倍,平均延迟与尾延迟均有所改善。OpenAI 计划在未来数周内完全停用 Python 实现,并将在后续文章中进一步介绍 Habitat 在 500PB 数据规模和每秒 7000 万次请求压力下的多租户可靠性与读性能优化实践。

要点

  • Habitat 已从 Python 客户端库演进为独立分布式存储服务,每秒处理超 7000 万次请求,每周服务超 10 亿用户,管理数据超 500PB
  • Rust 重写后 CPU 效率提升 6 倍、内存效率提升 15 倍,新服务已承接 95% 生产流量,Python 实现将在数周内完全退役
  • 此次重写仅由 2 名工程师配合 Codex 和 GPT-5.5 完成,展示了 AI 辅助编码在大规模工程迁移中的实际落地能力
  • 将共享库改造为独立服务,不仅解决了部署协调难题,还为访问控制和审计日志提供了统一的安全管控点
  • 连接池策略从 LIFO 改为 FIFO 是 Python 阶段的关键调优之一,有效缓解了高并发下的负载不均衡问题
查看原始来源

原始标题:OpenAI 将 Habitat 从 Python 迁移至 Rust:CPU 效率提升 6 倍,服务 10 亿 ChatGPT 用户

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。