返回岗位列表

智谱AI

SRE工程师

地点:北京 薪资:20-30K 日期:2026-05-08

岗位摘要

负责集群机器及在线服务的稳定性与可用性保障;参与制定和优化运维流程、规范和应急预案,开发相关工具提高团队工作效率;参与监控系统、日志系统的建设与优化,及时发现并处理故障;进行复杂故障的排查与根因分析,制定并实施长期解决方案

岗位职责

  • 负责集群机器及在线服务的稳定性与可用性保障
  • 参与制定和优化运维流程、规范和应急预案,开发相关工具提高团队工作效率
  • 参与监控系统、日志系统的建设与优化,及时发现并处理故障
  • 进行复杂故障的排查与根因分析,制定并实施长期解决方案
  • 负责多集群环境的管理与优化,包括跨区域、跨云平台的集群协调
  • 参与Kubernetes集群的设计、部署、升级和日常维护,优化集群性能和资源利用率
  • 设计和实施大规模分布式系统的容灾方案,确保业务连续性
  • 与开发团队密切合作,在系统设计阶段提供可靠性、可扩展性方面的建议和最佳实践
  • 负责稳定性运营,制定和实施稳定性指标,监控系统健康状态,分析系统瓶颈,持续改进系统可靠性和性能

任职要求

  • 统招本科及以上学历,计算机或相关专业,3年以上SRE相关工作经验
  • 扎实的计算机基础知识,包括操作系统、计算机网络、数据结构和算法
  • 精通Linux/Unix系统管理,具备丰富的故障排查经验和性能调优能力
  • 熟练掌握Python、Go、Shell等至少一种编程语言,具备良好的编码习惯和代码重构能力
  • 熟悉使用Ansible等自动化工具
  • 熟练使用Kubernetes,有大规模集群管理经验
  • 精通主流监控系统(如Prometheus、Grafana)和日志管理工具(如Loki、VictoriaLogs),能熟练使用监控系统进行故障定位和问题排查
  • 具备出色的问题分析和解决能力,能够独立处理复杂的技术问题和系统故障
  • 良好的沟通能力和团队协作精神,能够在压力下保持冷静并高效工作
  • 认真负责,工作态度积极,能够主动跟进并完成任务

加分项

  • 有大型互联网公司SRE或运维经验者优先 熟悉计算机RDMA网络 对GPU算力机器有一定了解 熟悉监控告警熟练使用promQL解决可观测需求 熟悉云原生可观测性体系,具备分布式链路追踪(Distributed Tracing)实践经验,能够基于 OpenTelemetry 等系统进行调用链分析、性能优化与故障定位
  • 可以vibe coding快速迭代日常小型需求
  • 袁先生 本月活跃

福利待遇

  • 具有竞争力的薪酬,20-30K·14薪
  • 全额缴纳五险一金,福利保障完善
  • 年度绩效奖金与股权激励机会
  • 弹性工作制,平衡工作与生活
  • 丰富的专业培训与学习资源,助力职业成长
  • 年轻有活力的团队,氛围开放和谐

工作地址

北京海淀区智谱华章科技有限公司1