高级工程师,分布式存储、高性能计算与人工智能基础设施
岗位摘要
设计多PB级AI/ML存储系统;集成WekaFS、Ceph等技术;主导容量规划与成本优化(通过分层、生命周期策略、规模调整实现30-50%的成本节约);设计/优化RDMA、InfiniBand、400GbE网络;针对最大吞吐量和最低延迟进行调优;实施NVMe-oF/iSCSI;排查瓶颈;优化存储相…
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计多PB级AI/ML存储系统;集成WekaFS、Ceph等技术;主导容量规划与成本优化(通过分层、生命周期策略、规模调整实现30-50%的成本节约)
- 设计/优化RDMA、InfiniBand、400GbE网络;针对最大吞吐量和最低延迟进行调优;实施NVMe-oF/iSCSI;排查瓶颈;优化存储相关的TCP/IP协议
- 构建Kubernetes存储操作器/控制器;实现自动化配置、自助服务抽象、多租户隔离、配额管理;创建可复用的Helm/Terraform模式
- 为每个GPU节点提供10-50 GB/s的吞吐量;优化缓存(权重/数据集/检查点)、并行文件系统和数据路径;使用性能分析工具进行故障排除;将系统扩展至数千个节点
- 构建多层缓存(本地NVMe、分布式、对象存储);优化数据局部性和模型权重分布;实施智能预取/淘汰策略
- 实施监控、告警和服务水平目标;设计灾难恢复/备份方案及操作手册;进行混沌工程;通过主动/自动化修复确保99.9%以上的运行时间
- 与ML/SRE团队合作;指导存储最佳实践;为开源项目做出贡献;编写文档、事故报告并公开分享经验
任职要求
- 8年以上存储工程经验,其中3年以上管理多PB级分布式存储系统的经验
- 拥有为GPU/HPC集群部署和运营高性能存储的可靠记录
- 在生产环境中具备深厚的Kubernetes和云原生存储经验
- 熟练掌握Go和Python编程,具备构建生产级工具的能力
- 拥有计算机科学、工程学学士/硕士学位,或同等的实践经验
- 具备技术领导力历史:设计过能显著提升性能(>3倍)、可靠性(99.9%+运行时间)或成本效益的系统
福利待遇
- 混合工作模式:每周在阿姆斯特丹办公室工作2天
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。