大模型运维工程师
岗位摘要
负责大模型服务的稳定性和高可用性,确保平台在高并发和大流量下的稳定运行;设计和实施监控、报警和自动化运维平台建设,及时发现和解决问题;负责故障的快速定位和修复,制定并执行应急预案,确保业务连续性
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责大模型服务的稳定性和高可用性,确保平台在高并发和大流量下的稳定运行
- 设计和实施监控、报警和自动化运维平台建设,及时发现和解决问题
- 负责故障的快速定位和修复,制定并执行应急预案,确保业务连续性
- 参与故障复盘,分析根本原因,提出改进措施,防止类似问题再次发生
- 开发和维护自动化运维平台与工具,提高运维效率,减少人为操作失误
- 进行资源使用优化,提高资源利用率,提升系统性能
- 分析和深入发掘现有系统的不足,数据驱动找到薄弱点,推动系统优化落地改进
- 负责资源规划和管理,确保资源的合理分配和高效利用
- 进行资源成本分析,监控和评估资源使用情况,提出成本优化方案
- 结合业界硬件演进路线图与技术平台需求,推动最优配置选型与迭代
任职要求
- 具备大模型服务或高并发分布式系统的运维经验,熟悉稳定性保障和高可用架构设计原理
- 熟练掌握监控报警系统、自动化运维平台的建设及运维技能
- 具备快速故障定位、应急响应及根因分析能力,能够独立制定应急预案
- 具备自动化运维工具开发能力,熟悉资源优化、性能调优及成本控制方法
- 具备较强的数据分析能力,能够通过数据驱动识别系统瓶颈并推动优化落地
- 熟悉资源规划管理、硬件选型及成本分析,了解业界硬件技术演进趋势
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。