返回岗位列表

MiniMax

高性能算力集群工程师

地点:上海 薪资:薪资未公开 日期:2025-09-26

岗位摘要

参与自建 万卡规模算力集群 的架构设计与优化,涵盖 GPU/CPU、网络、存储、冷却等核心模块;分析并解决大规模训练和推理中的集群级问题,如通信效率、资源调度、带宽与能耗;研究并验证新型硬件(GPU、加速器、网络设备),提出选型与优化建议

岗位职责

  • 参与自建 万卡规模算力集群 的架构设计与优化,涵盖 GPU/CPU、网络、存储、冷却等核心模块
  • 分析并解决大规模训练和推理中的集群级问题,如通信效率、资源调度、带宽与能耗
  • 研究并验证新型硬件(GPU、加速器、网络设备),提出选型与优化建议
  • 参与算力平台与自动化运维系统的建设,提升集群的稳定性和利用率
  • 与算法、系统团队协作,推动硬件潜能在端到端场景中的发挥

任职要求

  • 芯片硬件/架构/设计经验,理解 GPU/CPU/加速器的体系结构
  • 超算竞赛(ASC、ISC、HPC Challenge 等)经历,熟悉大规模并行计算与系统优化
  • 具备扎实的计算机体系结构知识,对内存、网络、I/O 等硬件性能因素敏感
  • 具备良好的工程素养和学习能力,乐于在万卡规模集群中解决真实工程挑战
  • 有大规模 GPU 集群或超算系统实践经验
  • 在 HPC 或硬件相关研究/竞赛中有突出成绩