高级工程师,分布式存储与HPC及AI基础设施
岗位摘要
为Together AI架构并实施技术战略和存储路线图,在扩展GPU集群时推动高性能架构决策;通过集成Vast、Weka和Ceph,工程化并扩展多PB级AI/ML存储系统,并通过自动化分层和生命周期策略执行深度成本优化
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 为Together AI架构并实施技术战略和存储路线图,在扩展GPU集群时推动高性能架构决策
- 通过集成Vast、Weka和Ceph,工程化并扩展多PB级AI/ML存储系统,并通过自动化分层和生命周期策略执行深度成本优化
- 开发智能缓存和分层存储架构,为训练和推理工作负载实现GPU规模下的极端IOPS和集群级吞吐量
- 在L2/L3网络层调整存储隔离,确保存储客户端的安全、生产级多租户
- 编写Kubernetes存储操作器和控制器,实现自动化配置、自助服务抽象和配额管理
- 工程化端到端数据路径,实现每个GPU节点10+ GB/s的吞吐量;为模型权重和数据集架构多层缓存;使用高级分析工具调整并行文件系统;跨数千个节点扩展存储基础设施
- 通过高级基准测试和分析优化端到端数据路径,为开源存储项目和内部工具贡献高影响力代码
任职要求
- 8年以上存储工程经验,管理多PB级分布式存储
- 在GPU/HPC集群上部署和运营高性能存储的可靠记录
- 在生产环境中具有深厚的Kubernetes和云原生存储经验
- 精通Go和Python编程,具备构建生产级系统和工具的能力
- 计算机科学、工程学或相关领域的学士/硕士学位,或同等实践经验
- 技术领导力历史:设计显著提升性能、可靠性(99.999%+正常运行时间)或成本效益的系统
- 分布式存储系统:在Ceph、WekaFS、Lustre、Vast、GPFS或类似并行文件系统方面具有多PB级深度专业知识
- 对象存储:具有S3、MinIO、Ceph或R2的生产经验,包括性能优化和成本管理
- Kubernetes存储:CSI驱动、StatefulSets、PersistentVolumes、存储操作器和自定义控制器
- 针对GPU工作负载的存储优化、RDMA/InfiniBand网络、并行文件系统优化(TB/s级集群聚合吞吐量 - 线路饱和)
- 编程:Go和Python用于自动化、操作器和工具
- 基础设施即代码:Terraform、Ansible、Helm、GitOps(ArgoCD)
- Linux存储栈:文件系统(ext4、xfs)、LVM、NVMe优化、RAID配置的高级知识
- 可观测性:Prometheus、Grafana、Thanos架构和运营
- 加分项:GPU Direct Storage(GDS)、NVMe-oF、存储网络、RDMA实现
- 加分项:ML/AI存储模式(模型权重、检查点、数据集缓存)
- 加分项:存储基准测试和分析工具(fio、iperf3、iostat、blktrace)
福利待遇
- 加入研究驱动的人工智能公司,参与开放透明AI系统的建设
- 与顶尖团队合作,解决AI基础设施领域的重大挑战
- 有机会在GPU集群规模下推动存储技术创新
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。