返回岗位列表

月之暗面

Kimi 资深业务SRE工程师

地点:北京 薪资:薪资未公开 日期:2026-09-19

岗位摘要

定义Kimi业务的稳定性标准,与研发团队共建SLO/SLI体系,在可用性、延迟与迭代速度之间取得平衡,让可靠性目标与业务影响直接挂钩;建立信号清晰的分级告警体系,实现故障的分钟级发现与精准定位,降低噪音干扰

岗位职责

  • 定义Kimi业务的稳定性标准,与研发团队共建SLO/SLI体系,在可用性、延迟与迭代速度之间取得平衡,让可靠性目标与业务影响直接挂钩
  • 建立信号清晰的分级告警体系,实现故障的分钟级发现与精准定位,降低噪音干扰
  • 主导故障响应与复盘流程,推动系统性改进,确保同类问题不重复发生
  • 为高频模型发布与产品迭代设计安全变更框架,涵盖灰度、金丝雀发布、自动回滚及变更可观测性
  • 护航关键发布,负责发布前readiness评估、发布中值守及发布后复盘
  • 将发布runbook沉淀为工具与流水线,把手工核验转化为持续自动校验
  • 与研发共建统一Telemetry标准(Metrics/Logs/Traces),构建从业务指标到基础设施的全链路可观测性
  • 通过自动化诊断、容量与性能管理、混沌工程等手段消除重复性人工操作,持续优化资源利用率与成本效率
  • 利用AI Agent重做可靠性工作,包括告警分析、事故总结、自动巡检,探索AI时代SRE的工作方式
  • 参与需求与架构评审,将可靠性前置到设计阶段,帮助业务团队早期规避技术债

任职要求

  • 具备架构能力与意识,能清晰定义业务架构全貌,能对跨团队技术方向形成判断并推动对齐
  • 系统功底扎实,精通Linux操作系统、网络与存储,具备深度诊断与优化能力
  • 精通Cloud Native架构,具备Kubernetes、Grafana、Loki、Helm、ArgoCD等生产环境实践经验
  • 具备AI-native工作方式,对AI Agent有独到理解,能用AI工具重做运维流程、提升工程效率
  • 具备扎实的开发能力,精通Go语言,有DevOps平台或系统开发经验,能用代码实现自动化
  • 具备大规模在线业务生产可靠性实战经验,包括on-call、故障响应与复盘驱动的持续改进
  • 对业务充满热情,对细节一丝不苟,具备强烈的owner意识和推动问题解决的意愿
  • 熟悉国内外主流云厂商的资源配置与使用
  • 【加分项】具备大模型serving/推理链路运维经验,理解AI产品的可靠性特性
  • 【加分项】主导过SRE体系从零到一的建设,包括报警治理、发布流程重构、On-call体系搭建
  • 【加分项】为可观测性或基础设施开源项目做过贡献,熟悉Chaos Engineering、eBPF、Service Mesh等前沿技术

加分项

  • 有大模型 serving / 推理链路运维经验,理解 AI 产品的可靠性特性
  • 主导过从混乱到秩序的 SRE 建设:报警治理、发布流程重构、On-call 体系搭建
  • 可观测性或基础设施开源项目贡献者;熟悉 Chaos Engineering、eBPF、Service Mesh 等前沿技术
  • 我们能提供什么
  • 直接的业务影响力:千万级用户的产品与高频模型发布,你的改进立即作用于核心业务,解决真实且紧迫的痛点
  • 前沿的真实战场:参与快速变化的 AI 架构与产品演进路线,你遇到的可靠性问题大多是新问题
  • 建设而非维护:我们处于快速成长期,你需要建立标准而非遵守过时的标准,有充足的发挥空间和资源支持
  • AI-native 的实践场:把 AI Agent 用进可靠性工程,把你的 SRE Agent 产品化,这是一次全新的尝试
  • 与优秀的工程团队协作:我们是一群务实、对技术有追求的工程师,相信你能在这里找到技术共鸣
  • 允许6个月内投递3个职位,请选择适合的职位进行投递

福利待遇

  • 直接的业务影响力:你的改进立即作用于千万级用户的核心业务,解决真实且紧迫的痛点
  • 前沿的真实战场:深度参与快速变化的AI架构与产品演进,持续面对全新的可靠性挑战
  • 建设而非维护:处于快速成长期,有充足的发挥空间和资源支持,由你来建立行业标准
  • AI-native实践场:将AI Agent融入可靠性工程,探索并产品化SRE Agent,开创全新工作模式
  • 与优秀工程团队协作:团队务实且对技术有追求,能在此找到技术共鸣与成长空间