Kimi 资深业务SRE工程师
岗位摘要
定义Kimi业务的稳定性标准,与研发团队共建SLO/SLI体系,在可用性、延迟与迭代速度之间取得平衡,让可靠性目标与业务影响直接挂钩;建立信号清晰的分级告警体系,实现故障的分钟级发现与精准定位,降低噪音干扰
岗位职责
- 定义Kimi业务的稳定性标准,与研发团队共建SLO/SLI体系,在可用性、延迟与迭代速度之间取得平衡,让可靠性目标与业务影响直接挂钩
- 建立信号清晰的分级告警体系,实现故障的分钟级发现与精准定位,降低噪音干扰
- 主导故障响应与复盘流程,推动系统性改进,确保同类问题不重复发生
- 为高频模型发布与产品迭代设计安全变更框架,涵盖灰度、金丝雀发布、自动回滚及变更可观测性
- 护航关键发布,负责发布前readiness评估、发布中值守及发布后复盘
- 将发布runbook沉淀为工具与流水线,把手工核验转化为持续自动校验
- 与研发共建统一Telemetry标准(Metrics/Logs/Traces),构建从业务指标到基础设施的全链路可观测性
- 通过自动化诊断、容量与性能管理、混沌工程等手段消除重复性人工操作,持续优化资源利用率与成本效率
- 利用AI Agent重做可靠性工作,包括告警分析、事故总结、自动巡检,探索AI时代SRE的工作方式
- 参与需求与架构评审,将可靠性前置到设计阶段,帮助业务团队早期规避技术债
任职要求
- 具备架构能力与意识,能清晰定义业务架构全貌,能对跨团队技术方向形成判断并推动对齐
- 系统功底扎实,精通Linux操作系统、网络与存储,具备深度诊断与优化能力
- 精通Cloud Native架构,具备Kubernetes、Grafana、Loki、Helm、ArgoCD等生产环境实践经验
- 具备AI-native工作方式,对AI Agent有独到理解,能用AI工具重做运维流程、提升工程效率
- 具备扎实的开发能力,精通Go语言,有DevOps平台或系统开发经验,能用代码实现自动化
- 具备大规模在线业务生产可靠性实战经验,包括on-call、故障响应与复盘驱动的持续改进
- 对业务充满热情,对细节一丝不苟,具备强烈的owner意识和推动问题解决的意愿
- 熟悉国内外主流云厂商的资源配置与使用
- 【加分项】具备大模型serving/推理链路运维经验,理解AI产品的可靠性特性
- 【加分项】主导过SRE体系从零到一的建设,包括报警治理、发布流程重构、On-call体系搭建
- 【加分项】为可观测性或基础设施开源项目做过贡献,熟悉Chaos Engineering、eBPF、Service Mesh等前沿技术
加分项
- 有大模型 serving / 推理链路运维经验,理解 AI 产品的可靠性特性
- 主导过从混乱到秩序的 SRE 建设:报警治理、发布流程重构、On-call 体系搭建
- 可观测性或基础设施开源项目贡献者;熟悉 Chaos Engineering、eBPF、Service Mesh 等前沿技术
- 我们能提供什么
- 直接的业务影响力:千万级用户的产品与高频模型发布,你的改进立即作用于核心业务,解决真实且紧迫的痛点
- 前沿的真实战场:参与快速变化的 AI 架构与产品演进路线,你遇到的可靠性问题大多是新问题
- 建设而非维护:我们处于快速成长期,你需要建立标准而非遵守过时的标准,有充足的发挥空间和资源支持
- AI-native 的实践场:把 AI Agent 用进可靠性工程,把你的 SRE Agent 产品化,这是一次全新的尝试
- 与优秀的工程团队协作:我们是一群务实、对技术有追求的工程师,相信你能在这里找到技术共鸣
- 允许6个月内投递3个职位,请选择适合的职位进行投递
福利待遇
- 直接的业务影响力:你的改进立即作用于千万级用户的核心业务,解决真实且紧迫的痛点
- 前沿的真实战场:深度参与快速变化的AI架构与产品演进,持续面对全新的可靠性挑战
- 建设而非维护:处于快速成长期,有充足的发挥空间和资源支持,由你来建立行业标准
- AI-native实践场:将AI Agent融入可靠性工程,探索并产品化SRE Agent,开创全新工作模式
- 与优秀工程团队协作:团队务实且对技术有追求,能在此找到技术共鸣与成长空间