AI服务器运维开发工程师
岗位摘要
将硬件等相关运营数据指标化,为集群硬件SLA负责,降低硬件层面故障率;负责公司硬件引入与选型、管理与运维等工作;协调和组织组内外项目,保障项目按期进行;参与公司基础架构的设计与实现,包括但不限于集群建设、网络治理、系统调优等
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 将硬件等相关运营数据指标化,为集群硬件SLA负责,降低硬件层面故障率
- 负责公司硬件引入与选型、管理与运维等工作
- 协调和组织组内外项目,保障项目按期进行
- 参与公司基础架构的设计与实现,包括但不限于集群建设、网络治理、系统调优等
- 协助优化业务使用体验,定位和解决高并发场景下的性能瓶颈和稳定性问题
- 参与AI基础设施建设,包括模型训练框架优化、推理服务部署、异构计算资源调度等
- 研究前沿技术(如RDMA、DPU、新型存储系统),并推动其在生产环境中的落地
- 撰写技术文档,参与团队技术分享和代码评审
任职要求
- 计算机科学、软件工程等相关专业本科及以上学历
- 有互联网大厂或AI公司基础架构/研发相关经验,熟悉系统原理
- 熟练掌握至少一种编程语言(Go、Java、C++),具备良好的编码风格和编程习惯
- 熟悉Linux系统、常用命令及调试工具,了解网络编程和多线程编程
- 对基础架构有强烈兴趣,关注技术发展趋势,有主动学习和探索新技术的热情
- 具备良好的沟通能力和团队协作精神,能够快速适应高强度的工作节奏
- 有AI集群搭建实践经验者优先
- 有开源贡献者经历者优先
加分项
- 对基础架构相关工作充满热忱
- 有开源贡献者经历
- 李先生 刚刚活跃
工作地址
北京海淀区蓟门壹号1
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。