机器学习运维负责人
岗位摘要
负责生产环境中推理和微调服务在无服务器和专用部署中的可用性与性能SLA;负责改进多集群ML基础设施的测试、部署、配置管理和监控实践,并与基础设施SRE紧密合作;构建自助式工具和自动化流程,以减少运营负担,并赋能内部用户(MLOps、客户体验)及自助服务产品
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责生产环境中推理和微调服务在无服务器和专用部署中的可用性与性能SLA
- 负责改进多集群ML基础设施的测试、部署、配置管理和监控实践,并与基础设施SRE紧密合作
- 构建自助式工具和自动化流程,以减少运营负担,并赋能内部用户(MLOps、客户体验)及自助服务产品
- 定义并强制执行推理引擎(vLLM、tvLLM、Pulsar)的配置最佳实践,以防止运行时问题
- 领导事件响应,进行事后分析,并推动可靠性改进
- 招聘、指导并发展MLOps工程团队
- 与基础设施和ML工程团队合作,提高系统可靠性和成本效益
任职要求
- 5年以上大规模生产ML推理或训练系统的运营经验
- 2年以上领导工程团队的经验,有从零开始组建团队的经验
- 精通Kubernetes、多集群编排和ML服务框架
- 拥有负责生产SLA(如可用性、TTFT、TPS)的良好记录
- 具有LLM推理服务系统(vLLM、TRT-LLM或类似)的经验
- 具备影响跨职能团队并做出部署/架构决策的能力
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。