返回岗位列表

Together AI

工程师

地点:美国 薪资:薪资未公开 日期:2026-01-29

岗位摘要

设计、构建和维护高性能、安全、高可用的后端服务/操作器,用于数据中心自动化硬件管理(如Infiniband分区、数据中心内并行存储配置、虚拟机配置);为拥有数千个GPU的新GB200数据中心设计和构建IaaS软件层

岗位职责

  • 设计、构建和维护高性能、安全、高可用的后端服务/操作器,用于数据中心自动化硬件管理(如Infiniband分区、数据中心内并行存储配置、虚拟机配置)
  • 为拥有数千个GPU的新GB200数据中心设计和构建IaaS软件层
  • 开发全球多艾字节高性能对象存储,为预训练提供海量数据集服务
  • 为客户构建先进的观测性堆栈,实现故障容错分布式预训练的自动化节点生命周期管理
  • 为去中心化AI工作负载进行架构和研究工作
  • 开发核心的Together AI开源平台
  • 创建服务、工具和开发者文档
  • 为健壮性和故障容错性创建测试框架

任职要求

  • 5年以上专业软件开发经验,精通至少一种后端编程语言(优先考虑Golang)
  • 5年以上编写高性能、经过良好测试、生产质量代码的经验
  • 具备在一个或多个云提供商(AWS、Azure、GCP)上构建和运营高性能和/或全球分布式微服务架构的经验
  • 优秀的沟通能力——能够撰写清晰的设计文档,并与技术和非技术团队成员有效协作
  • 深入了解Kubernetes内部原理者优先(例如实现非平凡的Kubernetes操作器、设备/存储/网络插件、自定义调度器或其补丁)
  • 深入了解数据中心网络技术和解决方案者优先