高级SRE工程师
岗位摘要
负责AI超算集群的日常运维与稳定性保障;基于Kubernetes进行二次开发,通过CRD或自定义Apiserver实现Controller-manager开发;构建并维护Prometheus/Alertmanager监控告警平台,基于API和Webhook实现自定义告警通知
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责AI超算集群的日常运维与稳定性保障
- 基于Kubernetes进行二次开发,通过CRD或自定义Apiserver实现Controller-manager开发
- 构建并维护Prometheus/Alertmanager监控告警平台,基于API和Webhook实现自定义告警通知
- 优化Docker容器镜像制作流程,推进AI服务容器化部署
- 配置底层物理网络,包括IB/RoCE/NVLink/PCI-e等通信协议及网卡配置
- 基于Ubuntu、CentOS进行系统二次封装,维护PXE kickstart自动化装机流程
- 使用Tcpdump/Wireshark进行网络问题分析与排查
- 开展Linux内核故障分析,基于eBPF收集系统事件
任职要求
- 本科及以上学历,3-5年相关工作经验
- 熟悉Grafana、Prometheus、Ray等AI超算集群运维工具
- 熟练掌握Kubernetes集群运维,具备大规模K8s生产环境运维经验
- 熟练使用Docker容器技术,具备容器镜像制作与优化经验
- 熟悉基本数据结构与网络知识,掌握MongoDB/MySQL等数据库使用
- 熟悉底层物理网络,掌握Bond、Vlan、Vxlan、Macvlan、Tap等Linux接口配置
- 熟悉DHCP、DNS等常见网络协议
- 精通K8S二次开发,具备基于CRD或自定义Apiserver开发Controller-manager的能力
- 掌握Prometheus/Alertmanager监控告警平台及自定义告警通知实现
- 掌握基于PXE kickstart的自动化装机流程
- 熟悉Linux内核网络协议栈,清楚Iptables四表五链数据包路径
- 具备内核故障分析能力,包括内核模块开发及基于eBPF的事件收集
福利待遇
- 月薪28-55K,16薪
- 工作地点位于上海徐汇区西岸凤巢AI PLAZA
工作地址
上海徐汇区西岸凤巢AI PLAZA30楼
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。