返回岗位列表

Together AI

高级软件工程师 - Together 云基础设施

地点:荷兰 薪资:薪资未公开 日期:2026-09-18

岗位摘要

设计、构建并维护高性能、安全且高可用的后端服务与 Operator,在数据中心内实现硬件管理自动化,如 Infiniband 分区、数据中心内并行存储供给与虚拟机供给;为拥有数千块 GPU 的新建 GB200 数据中心设计并构建 IaaS 软件层

岗位职责

  • 设计、构建并维护高性能、安全且高可用的后端服务与 Operator,在数据中心内实现硬件管理自动化,如 Infiniband 分区、数据中心内并行存储供给与虚拟机供给
  • 为拥有数千块 GPU 的新建 GB200 数据中心设计并构建 IaaS 软件层
  • 参与构建全球多艾字节级高性能对象存储,为预训练提供海量数据集服务
  • 为客户构建先进的可观测性技术栈,并提供自动化节点生命周期管理,以支持容错型分布式预训练
  • 针对去中心化 AI 工作负载开展架构设计与研究工作
  • 参与 Together AI 核心开源平台的开发与维护
  • 创建服务、工具以及面向开发者的技术文档
  • 构建测试框架,以确保系统的健壮性与容错能力

任职要求

  • 5 年以上专业软件开发经验,精通至少一门后端编程语言(优先考虑 Golang)
  • 5 年以上编写高性能、测试充分的生产级代码的经验
  • 具备在一个或多个云服务商(AWS、Azure、GCP)上构建并运维高性能或全球分布式微服务架构的实际经验
  • 优秀的沟通能力,能够撰写清晰的设计文档,并与技术和非技术团队成员高效协作
  • 深入了解 Kubernetes 内部机制者优先,例如实现复杂的 Kubernetes Operator、设备/存储/网络插件、自定义调度器,或对上述组件及 Kubernetes 本身进行补丁修改
  • 深入了解虚拟机与虚拟化监控程序者优先,例如 QEMU/KVM、cloud-hypervisor、VFIO、virtio、PCIE 直通、Kubevirt、SR-IOV
  • 深入了解数据中心网络技术与解决方案者优先,例如 VLAN、VXLAN、VPN、VPC、OVS/OVN
  • 具备 Cluster API 或类似工具的使用经验者优先
  • 具备高性能计算、网络或存储领域的工作经验者优先
  • 具备 GPU 或 Infiniband 虚拟化经验者优先
  • 在计算、网络和存储方面具备扎实的系统知识,包括并发、内存管理、高性能 I/O 与规模化能力
  • 具备基础设施自动化工具(Terraform、Ansible)、监控与可观测性技术栈(Prometheus、Grafana)以及 CI/CD 流水线(GitHub Actions、ArgoCD)的使用经验
  • 具备大规模构建 IaaS 或 PaaS 系统的经验者优先
  • 具备 DPU/SmartNIC 相关经验者优先
  • 具备 GPU 编程、NCCL、CUDA 相关知识者优先
  • 需要具备深厚的技术功底,以及出色的沟通、协作与协调能力,并拥有扎实的软件开发基础与系统知识、故障排查能力