运维工程师/SRE(AI方向)
岗位摘要
独立负责Docker+Kubernetes集群部署、优化与日常运维,支撑高并发Agent服务与GPU推理任务,实现弹性伸缩与资源治理;管理GPU资源池,保障LLM/多模态模型的稳定推理与轻量训练,持续提升资源利用率
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 独立负责Docker+Kubernetes集群部署、优化与日常运维,支撑高并发Agent服务与GPU推理任务,实现弹性伸缩与资源治理
- 管理GPU资源池,保障LLM/多模态模型的稳定推理与轻量训练,持续提升资源利用率
- 搭建并维护CI/CD流水线(GitLab CI/Jenkins+ArgoCD),支持模型、Agent及后端服务的联合发布与灰度回滚
- 构建Prometheus+Grafana监控、链路追踪(Jaeger/SkyWalking)及日志系统(Loki/ELK),保障全链路稳定
- 运维Redis、Kafka、MySQL/MongoDB及向量数据库,确保高并发下的性能与数据安全
- 定期压测分析系统瓶颈,制定扩缩容方案,平衡业务增长与成本
任职要求
- 3年以上Linux运维/SRE经验,有AI服务或高并发广告/推荐系统运维背景者优先
- 熟练掌握Docker、K8s(HPA、Ingress、GPU调度),具备生产环境排错经验
- 熟悉GPU服务器管理与NVIDIA驱动栈,能部署Triton/vLLM等模型推理服务并配置监控
- 精通Prometheus/Grafana及日志系统,熟悉分布式追踪,能定义SLI/SLO
- 有GitLab CI/Jenkins+ArgoCD落地经验,了解灰度发布策略并能独立实施
- 能与算法、后端高效协作,对服务SLA负责,具备On-Call能力
工作地址
北京朝阳区引力传媒股份有限公司12层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。