返回岗位列表

腾讯

大模型运维工程师

地点:深圳 薪资:薪资未公开 日期:未知

岗位摘要

负责大模型服务的稳定性和高可用性,确保平台在高并发和大流量下的稳定运行;设计和实施监控、报警和自动化运维平台建设,及时发现和解决问题;负责故障的快速定位和修复,制定并执行应急预案,确保业务连续性

岗位职责

  • 负责大模型服务的稳定性和高可用性,确保平台在高并发和大流量下的稳定运行
  • 设计和实施监控、报警和自动化运维平台建设,及时发现和解决问题
  • 负责故障的快速定位和修复,制定并执行应急预案,确保业务连续性
  • 参与故障复盘,分析根本原因,提出改进措施,防止类似问题再次发生
  • 开发和维护自动化运维平台与工具,提高运维效率,减少人为操作失误
  • 进行资源使用优化,提高资源利用率,提升系统性能
  • 分析和深入发掘现有系统的不足,数据驱动找到薄弱点,推动系统优化落地改进
  • 负责资源规划和管理,确保资源的合理分配和高效利用
  • 进行资源成本分析,监控和评估资源使用情况,提出成本优化方案
  • 结合业界硬件演进路线图与技术平台需求,推动最优配置选型与迭代

任职要求

  • 具备大模型服务或高并发分布式系统的运维经验,熟悉稳定性保障和高可用架构设计原理
  • 熟练掌握监控报警系统、自动化运维平台的建设及运维技能
  • 具备快速故障定位、应急响应及根因分析能力,能够独立制定应急预案
  • 具备自动化运维工具开发能力,熟悉资源优化、性能调优及成本控制方法
  • 具备较强的数据分析能力,能够通过数据驱动识别系统瓶颈并推动优化落地
  • 熟悉资源规划管理、硬件选型及成本分析,了解业界硬件技术演进趋势