超算集群系统架构师(实习/全职)
岗位摘要
设计并实现大规模异构计算资源的调度系统,解决CPU/GPU/NPU等计算资源的抽象、池化与拓扑感知调度,优化调度算法以平衡任务吞吐、排队延迟和资源利用率;开发集群管理系统,覆盖任务和节点生命周期管理、日志采集与召回、关键性能数据收集与可视化、故障发现与自动容灾,以及新硬件和新软件栈的导入与适配
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计并实现大规模异构计算资源的调度系统,解决CPU/GPU/NPU等计算资源的抽象、池化与拓扑感知调度,优化调度算法以平衡任务吞吐、排队延迟和资源利用率
- 开发集群管理系统,覆盖任务和节点生命周期管理、日志采集与召回、关键性能数据收集与可视化、故障发现与自动容灾,以及新硬件和新软件栈的导入与适配
- 从集群视角进行端到端系统性能调优,覆盖CPU/GPU/NPU计算任务优化、Linux内核、I/O和网络协议栈,构建可观测性体系,主导大规模训练下的故障诊断、性能回归和全链路排障
- 分析大规模并行系统中的性能抖动、长尾延迟和性能不均等系统性瓶颈,支持团队更高效地使用集群
- 负责AI超算集群网络的拓扑设计、路由策略、多路径负载均衡和拥塞控制,深入研究RDMA(RoCEv2/InfiniBand)协议栈,与通信算子和存储团队协作提供高性能网络底层支撑
- 参与新一代超算集群的架构规划与建设,探索和评估GPU、国产AI加速器、网卡等新兴硬件,与IDC数据中心团队配合,以集群架构需求驱动数据中心的规划、建设与交付
任职要求
- 扎实的计算机体系结构基础,深刻理解计算机组成、操作系统、计算机网络等核心原理,能系统性思考和定位大规模计算带来的性能优化与复杂性问题
- 熟悉C/C++/Rust/Python之一,具备优秀的设计能力、极强的动手和工程能力以及代码质量意识
- 对分布式系统有深刻理解与实践经验,如熟悉分布式任务调度与资源编排,或能设计高性能、高可用的系统架构
- 对性能优化有较高热情,发自内心地想要跑满所有计算资源,榨干每一份算力
- 良好的中文沟通能力和团队协作能力
福利待遇
- 直接参与定义并建设下一代超算基础设施,挑战更大规模数十万卡集群的极限性能
- 与顶尖算子、框架研发和算法研究员协作,从硬件到软件、从平台到应用全栈贯通
- 深入多种硬件体系结构,系统性地积累跨架构实践经验
- 你的工作直接影响大模型训练与推理的效率、成本和稳定性
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。