返回岗位列表

Together AI

网络架构师

地点:美国 薪资:薪资未公开 日期:2026-01-29

岗位摘要

定义和发展Together AI的全球路由及骨干网架构,涵盖自建数据中心、合作伙伴托管站点、接入点、云区域和互联网络;为高带宽AI工作负载建立端到端拓扑策略,包括东西向网络结构、骨干/超骨干/核心网络、数据中心互联和跨区域互联

岗位职责

  • 定义和发展Together AI的全球路由及骨干网架构,涵盖自建数据中心、合作伙伴托管站点、接入点、云区域和互联网络
  • 为高带宽AI工作负载建立端到端拓扑策略,包括东西向网络结构、骨干/超骨干/核心网络、数据中心互联和跨区域互联
  • 设计流量工程、负载均衡和容量规划模型,以确保大规模下的低延迟、确定性性能和容错能力
  • 制定多云互联和对等策略,包括BGP策略框架、路由泄露缓解以及异构网络间的安全态势
  • 为可编程性、稳定性和自动化构建控制平面堆栈,包括路由设计、资源调配、配置管理和状态一致性
  • 为全球骨干网建立基础可观测性原语,包括遥测、流采样、路径验证、合成测试和健康模型
  • 与计算、存储、硬件和数据平台团队紧密合作,确保网络设计满足分布式AI训练工作负载的性能需求
  • 与运维和网络运营中心团队协作,确保设计在实际故障条件下是可支持的、可调试的和有弹性的
  • 为整个组织的工程师提供架构指导和指导,影响物理和虚拟网络领域的长期战略
  • 为下一代工作负载(如多Tbps东西向流量、高扇入/扇出分布式系统、GPU集群网络)建模不断演进的拓扑结构
  • 评估并指导新兴技术的采用,如先进光传输、RoCEv2、高速以太网结构、Infiniband覆盖网络、EVPN/VXLAN

任职要求

  • 拥有定义和运营大规模全球网络的经验,涵盖数据中心、骨干网和云环境
  • 精通IP路由协议,特别是BGP、IS-IS、OSPF,以及大规模流量工程和策略控制
  • 具备现代数据中心网络架构的深厚知识,包括Clos拓扑、VXLAN/EVPN、路由反射器设计
  • 具备网络性能分析和容量规划经验,包括遥测、流分析和建模工具
  • 拥有与计算、存储和硬件团队合作设计高性能分布式系统的经验
  • 具备出色的沟通能力,能够向技术和非技术受众阐明复杂的架构权衡
  • 能够在模糊和快速变化的环境中独立工作,并推动项目从概念到生产