返回岗位列表

腾讯

大模型服务运维工程师

地点:深圳 薪资:薪资未公开 日期:2026-01-29

岗位摘要

负责大模型服务的稳定性和高可用性,确保平台在高并发和大流量下的稳定运行;设计和实施监控、报警和自动化运维平台建设,及时发现和解决问题;负责故障的快速定位和修复,制定并执行应急预案,确保业务连续性

岗位职责

  • 负责大模型服务的稳定性和高可用性,确保平台在高并发和大流量下的稳定运行
  • 设计和实施监控、报警和自动化运维平台建设,及时发现和解决问题
  • 负责故障的快速定位和修复,制定并执行应急预案,确保业务连续性
  • 参与故障复盘,分析根本原因,提出改进措施,防止类似问题再次发生
  • 开发和维护自动化运维平台与工具,提高运维效率,减少人为操作失误
  • 进行资源使用优化,提高资源利用率,提升系统性能
  • 分析和深入发掘现有系统的不足,数据驱动找到薄弱点,推动系统优化落地改进
  • 负责资源规划和管理,确保资源的合理分配和高效利用
  • 进行资源成本分析,监控和评估资源使用情况,提出成本优化方案
  • 结合业界硬件演进路线图与技术平台需求,推动最优配置选型与迭代

任职要求

  • 计算机科学或相关专业本科及以上学历
  • 具备3年以上大规模分布式系统运维经验,有高并发、高可用性平台维护经验
  • 熟练掌握自动化运维工具开发,具备Python/Go/Shell等编程能力
  • 具备故障诊断、应急响应及复盘分析能力,能制定有效的应急预案
  • 熟悉资源规划、成本优化及硬件选型,具备数据驱动的性能优化经验