返回岗位列表

Together AI

高级工程师,分布式存储、高性能计算与人工智能基础设施

地点:荷兰 薪资:薪资未公开 日期:2026-01-29

岗位摘要

设计多PB级AI/ML存储系统;集成WekaFS、Ceph等技术;主导容量规划与成本优化(通过分层、生命周期策略、规模调整实现30-50%的成本节约);设计/优化RDMA、InfiniBand、400GbE网络;针对最大吞吐量和最低延迟进行调优;实施NVMe-oF/iSCSI;排查瓶颈;优化存储相…

岗位职责

  • 设计多PB级AI/ML存储系统;集成WekaFS、Ceph等技术;主导容量规划与成本优化(通过分层、生命周期策略、规模调整实现30-50%的成本节约)
  • 设计/优化RDMA、InfiniBand、400GbE网络;针对最大吞吐量和最低延迟进行调优;实施NVMe-oF/iSCSI;排查瓶颈;优化存储相关的TCP/IP协议
  • 构建Kubernetes存储操作器/控制器;实现自动化配置、自助服务抽象、多租户隔离、配额管理;创建可复用的Helm/Terraform模式
  • 为每个GPU节点提供10-50 GB/s的吞吐量;优化缓存(权重/数据集/检查点)、并行文件系统和数据路径;使用性能分析工具进行故障排除;将系统扩展至数千个节点
  • 构建多层缓存(本地NVMe、分布式、对象存储);优化数据局部性和模型权重分布;实施智能预取/淘汰策略
  • 实施监控、告警和服务水平目标;设计灾难恢复/备份方案及操作手册;进行混沌工程;通过主动/自动化修复确保99.9%以上的运行时间
  • 与ML/SRE团队合作;指导存储最佳实践;为开源项目做出贡献;编写文档、事故报告并公开分享经验

任职要求

  • 8年以上存储工程经验,其中3年以上管理多PB级分布式存储系统的经验
  • 拥有为GPU/HPC集群部署和运营高性能存储的可靠记录
  • 在生产环境中具备深厚的Kubernetes和云原生存储经验
  • 熟练掌握Go和Python编程,具备构建生产级工具的能力
  • 拥有计算机科学、工程学学士/硕士学位,或同等的实践经验
  • 具备技术领导力历史:设计过能显著提升性能(>3倍)、可靠性(99.9%+运行时间)或成本效益的系统

福利待遇

  • 混合工作模式:每周在阿姆斯特丹办公室工作2天