SRE工程师
岗位摘要
负责集群机器及在线服务的稳定性与可用性保障;参与制定和优化运维流程、规范和应急预案,开发相关工具提高团队工作效率;参与监控系统、日志系统的建设与优化,及时发现并处理故障;进行复杂故障的排查与根因分析,制定并实施长期解决方案
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责集群机器及在线服务的稳定性与可用性保障
- 参与制定和优化运维流程、规范和应急预案,开发相关工具提高团队工作效率
- 参与监控系统、日志系统的建设与优化,及时发现并处理故障
- 进行复杂故障的排查与根因分析,制定并实施长期解决方案
- 负责多集群环境的管理与优化,包括跨区域、跨云平台的集群协调
- 参与Kubernetes集群的设计、部署、升级和日常维护,优化集群性能和资源利用率
- 设计和实施大规模分布式系统的容灾方案,确保业务连续性
- 与开发团队密切合作,在系统设计阶段提供可靠性、可扩展性方面的建议和最佳实践
- 负责稳定性运营,制定和实施稳定性指标,监控系统健康状态,分析系统瓶颈,持续改进系统可靠性和性能
任职要求
- 统招本科及以上学历,计算机或相关专业,3年以上SRE相关工作经验
- 扎实的计算机基础知识,包括操作系统、计算机网络、数据结构和算法
- 精通Linux/Unix系统管理,具备丰富的故障排查经验和性能调优能力
- 熟练掌握Python、Go、Shell等至少一种编程语言,具备良好的编码习惯和代码重构能力
- 熟悉使用Ansible等自动化工具
- 熟练使用Kubernetes,有大规模集群管理经验
- 精通主流监控系统(如Prometheus、Grafana)和日志管理工具(如Loki、VictoriaLogs),能熟练使用监控系统进行故障定位和问题排查
- 具备出色的问题分析和解决能力,能够独立处理复杂的技术问题和系统故障
- 良好的沟通能力和团队协作精神,能够在压力下保持冷静并高效工作
- 认真负责,工作态度积极,能够主动跟进并完成任务
加分项
- 有大型互联网公司SRE或运维经验者优先 熟悉计算机RDMA网络 对GPU算力机器有一定了解 熟悉监控告警熟练使用promQL解决可观测需求 熟悉云原生可观测性体系,具备分布式链路追踪(Distributed Tracing)实践经验,能够基于 OpenTelemetry 等系统进行调用链分析、性能优化与故障定位
- 可以vibe coding快速迭代日常小型需求
- 袁先生 本月活跃
福利待遇
- 具有竞争力的薪酬,20-30K·14薪
- 全额缴纳五险一金,福利保障完善
- 年度绩效奖金与股权激励机会
- 弹性工作制,平衡工作与生活
- 丰富的专业培训与学习资源,助力职业成长
- 年轻有活力的团队,氛围开放和谐
工作地址
北京海淀区智谱华章科技有限公司1
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。