返回岗位列表

智谱AI

高级平台工程师(研发效能与稳定性方向)

地点:北京 薪资:30-60K 日期:2026-09-18

岗位摘要

负责研发效能平台的规划、设计与建设,覆盖需求、开发、构建、测试、发布及运营等研发全生命周期,持续提升研发交付效率和质量;建设和优化CI/CD、质量门禁、自动化测试、环境管理、发布编排及研发度量等平台能力,推动研发流程标准化、自动化和数据化

岗位职责

  • 负责研发效能平台的规划、设计与建设,覆盖需求、开发、构建、测试、发布及运营等研发全生命周期,持续提升研发交付效率和质量
  • 建设和优化CI/CD、质量门禁、自动化测试、环境管理、发布编排及研发度量等平台能力,推动研发流程标准化、自动化和数据化
  • 建立研发效能指标体系,分析研发过程中的等待、返工、失败和瓶颈,推动构建耗时、交付周期、发布频率、变更失败率等关键指标持续改善
  • 负责性能测试与容量治理体系建设,包括压测平台、流量模型、容量评估、全链路压测、性能基线及容量水位管理
  • 针对高并发和复杂业务场景开展性能分析,定位应用、数据库、缓存、消息队列、网络及基础设施等环节的性能瓶颈,并推动优化落地
  • 建设稳定性红队能力,从对抗视角主动发现系统在架构、依赖、容量、配置、数据和应急机制等方面的薄弱环节
  • 规划并实施稳定性红队演练、突袭演练和极端场景验证,检验系统及团队在真实故障条件下的发现、定位、处置和恢复能力
  • 建设故障注入与混沌工程平台,设计进程异常、网络延迟、依赖超时、资源耗尽、节点宕机、缓存失效、消息积压等故障场景
  • 建立故障演练的安全控制机制,包括爆炸半径控制、自动熔断、健康检查、快速回滚和演练审计,保障演练过程安全可控
  • 推动可观测性、容灾、降级、限流、熔断、故障自愈和应急响应体系建设,提升系统可用性及故障恢复能力
  • 参与重大故障复盘,推动问题从个案修复升级为平台能力、工程规范和自动化防线,减少同类故障重复发生
  • 与研发、测试、运维及架构团队协作,推广平台工程、SRE、混沌工程和研发效能实践

任职要求

  • 本科及以上学历,计算机、软件工程或相关专业,5年及以上研发、平台工程、SRE、DevOps或稳定性工程经验
  • 具备扎实的软件工程能力,熟练掌握Java、Go、Python等至少一种主流编程语言,能够独立完成平台及工程工具的设计与开发
  • 熟悉Git、CI/CD、自动化测试、制品管理、发布编排及质量门禁,有研发效能平台或内部开发者平台建设经验
  • 熟悉Linux、容器和Kubernetes,了解微服务、服务治理、云原生基础设施及分布式系统常见故障模式
  • 具备实际性能测试经验,熟悉JMeter、Gatling、Locust、k6等一种或多种工具,能够设计符合真实业务特征的压测模型
  • 能够基于吞吐量、并发数、响应时间、错误率、资源利用率等指标开展容量评估和性能瓶颈分析
  • 具备全链路压测、流量染色、数据隔离、影子库、压测流量清理或类似方案的实践经验
  • 具备稳定性红队或混沌工程实践经验,能够从系统薄弱点出发设计具有对抗性的故障场景,而非仅执行预设演练脚本
  • 具备真实故障注入经验,熟悉Chaos Mesh、LitmusChaos、Gremlin、ChaosBlade等工具之一,或有自研故障注入平台经验
  • 熟悉日志、指标、链路追踪和告警体系,能够使用Prometheus、Grafana、ELK、Loki、SkyWalking、Jaeger等工具进行故障分析
  • 理解高可用、容灾、限流、熔断、降级、隔离、重试、幂等及故障自愈等稳定性设计原则
  • 具备良好的系统性思考、跨团队沟通和项目推动能力,能够将复杂工程问题沉淀为平台产品、标准规范及可度量机制
  • 加分项:主导过中大型研发效能平台、内部开发者平台或一站式工程平台建设;具备大型互联网业务、金融核心系统或高并发分布式系统的全链路压测经验
  • 加分项:组织过跨系统、跨团队的稳定性红队演练或重大容灾演练;具备生产环境故障注入经验,并建立过完善的准入、熔断、回滚和审计机制
  • 加分项:具备多活、异地容灾、单元化、流量调度或大规模Kubernetes集群稳定性治理经验
  • 加分项:熟悉DORA、SPACE、DevEx等研发效能度量框架,并有实际改善案例;具备开源项目贡献、技术社区分享或相关平台产品化经验
  • 加分项:对AI辅助研发、智能测试、智能故障定位或智能运维有实践经验

加分项

  • 主导过中大型研发效能平台、内部开发者平台或一站式工程平台建设
  • 具备大型互联网业务、金融核心系统或高并发分布式系统的全链路压测经验
  • 组织过跨系统、跨团队的稳定性红队演练或重大容灾演练
  • 具备生产环境故障注入经验,并建立过完善的准入、熔断、回滚和审计机制
  • 具备多活、异地容灾、单元化、流量调度或大规模 Kubernetes 集群稳定性治理经验
  • 熟悉 DORA、SPACE、DevEx 等研发效能度量框架,并有实际改善案例
  • 具备开源项目贡献、技术社区分享或相关平台产品化经验
  • 对 AI 辅助研发、智能测试、智能故障定位或智能运维有实践经验
  • 张先生 刚刚活跃

福利待遇

  • 提供30-60K·16薪薪酬

工作地址

北京海淀区搜狐网络大厦10