大模型服务运维工程师
岗位摘要
负责大模型服务的稳定性和高可用性,确保平台在高并发和大流量下的稳定运行;设计和实施监控、报警和自动化运维平台建设,及时发现和解决问题;负责故障的快速定位和修复,制定并执行应急预案,确保业务连续性
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责大模型服务的稳定性和高可用性,确保平台在高并发和大流量下的稳定运行
- 设计和实施监控、报警和自动化运维平台建设,及时发现和解决问题
- 负责故障的快速定位和修复,制定并执行应急预案,确保业务连续性
- 参与故障复盘,分析根本原因,提出改进措施,防止类似问题再次发生
- 开发和维护自动化运维平台与工具,提高运维效率,减少人为操作失误
- 进行资源使用优化,提高资源利用率,提升系统性能
- 分析和深入发掘现有系统的不足,数据驱动找到薄弱点,推动系统优化落地改进
- 负责资源规划和管理,确保资源的合理分配和高效利用
- 进行资源成本分析,监控和评估资源使用情况,提出成本优化方案
- 结合业界硬件演进路线图与技术平台需求,推动最优配置选型与迭代
任职要求
- 计算机科学或相关专业本科及以上学历
- 具备3年以上大规模分布式系统运维经验,有高并发、高可用性平台维护经验
- 熟练掌握自动化运维工具开发,具备Python/Go/Shell等编程能力
- 具备故障诊断、应急响应及复盘分析能力,能制定有效的应急预案
- 熟悉资源规划、成本优化及硬件选型,具备数据驱动的性能优化经验
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。