返回岗位列表

DeepSeek

超算集群系统架构师(实习/全职)

地点:北京 薪资:薪资未公开 日期:2026-06-27

岗位摘要

设计并实现大规模异构计算资源的调度系统,解决CPU/GPU/NPU等计算资源的抽象、池化与拓扑感知调度,优化调度算法以平衡任务吞吐、排队延迟和资源利用率;开发集群管理系统,覆盖任务和节点生命周期管理、日志采集与召回、关键性能数据收集与可视化、故障发现与自动容灾,以及新硬件和新软件栈的导入与适配

岗位职责

  • 设计并实现大规模异构计算资源的调度系统,解决CPU/GPU/NPU等计算资源的抽象、池化与拓扑感知调度,优化调度算法以平衡任务吞吐、排队延迟和资源利用率
  • 开发集群管理系统,覆盖任务和节点生命周期管理、日志采集与召回、关键性能数据收集与可视化、故障发现与自动容灾,以及新硬件和新软件栈的导入与适配
  • 从集群视角进行端到端系统性能调优,覆盖CPU/GPU/NPU计算任务优化、Linux内核、I/O和网络协议栈,构建可观测性体系,主导大规模训练下的故障诊断、性能回归和全链路排障
  • 分析大规模并行系统中的性能抖动、长尾延迟和性能不均等系统性瓶颈,支持团队更高效地使用集群
  • 负责AI超算集群网络的拓扑设计、路由策略、多路径负载均衡和拥塞控制,深入研究RDMA(RoCEv2/InfiniBand)协议栈,与通信算子和存储团队协作提供高性能网络底层支撑
  • 参与新一代超算集群的架构规划与建设,探索和评估GPU、国产AI加速器、网卡等新兴硬件,与IDC数据中心团队配合,以集群架构需求驱动数据中心的规划、建设与交付

任职要求

  • 扎实的计算机体系结构基础,深刻理解计算机组成、操作系统、计算机网络等核心原理,能系统性思考和定位大规模计算带来的性能优化与复杂性问题
  • 熟悉C/C++/Rust/Python之一,具备优秀的设计能力、极强的动手和工程能力以及代码质量意识
  • 对分布式系统有深刻理解与实践经验,如熟悉分布式任务调度与资源编排,或能设计高性能、高可用的系统架构
  • 对性能优化有较高热情,发自内心地想要跑满所有计算资源,榨干每一份算力
  • 良好的中文沟通能力和团队协作能力

福利待遇

  • 直接参与定义并建设下一代超算基础设施,挑战更大规模数十万卡集群的极限性能
  • 与顶尖算子、框架研发和算法研究员协作,从硬件到软件、从平台到应用全栈贯通
  • 深入多种硬件体系结构,系统性地积累跨架构实践经验
  • 你的工作直接影响大模型训练与推理的效率、成本和稳定性