工程师
岗位摘要
为面向亿级日活的AI基础设施的构建与维护,提供专业的稳定性和架构改善方案;负责持续优化系统稳定性、可观测性,深入参与业务和系统的监控与故障排除工作;负责内部基础设施的开发与运维自动化,提高人员效率
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 为面向亿级日活的AI基础设施的构建与维护,提供专业的稳定性和架构改善方案
- 负责持续优化系统稳定性、可观测性,深入参与业务和系统的监控与故障排除工作
- 负责内部基础设施的开发与运维自动化,提高人员效率
任职要求
- 有扎实的编程功底,熟练脚本语言(Python,Bash等),熟练掌握SQL,有较强动手能力
- 熟悉K8S集群运维、多集群管理、集群容灾多活
- 熟悉Linux,熟悉计算机网络、操作系统基础知识
- 熟悉开源OpenTelemetry可观测生态log、metric、trace最佳实践及相关工具
- 有责任感,能够及时处理线上故障告警,合作意识好
- 有线上系统的运维管理经验,熟悉各类监控、告警基础设施,能帮助完善各种监控、告警工具链
- 【加分项】了解LLM训练/推理流程,熟悉GPU/RDMA的问题诊断,提高集群稳定性
加分项
- 了解LLM训练/推理流程,熟悉GPU/RDMA的问题诊断,提高集群稳定性
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。