高性能算力集群工程师
岗位摘要
参与自建 万卡规模算力集群 的架构设计与优化,涵盖 GPU/CPU、网络、存储、冷却等核心模块;分析并解决大规模训练和推理中的集群级问题,如通信效率、资源调度、带宽与能耗;研究并验证新型硬件(GPU、加速器、网络设备),提出选型与优化建议
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与自建 万卡规模算力集群 的架构设计与优化,涵盖 GPU/CPU、网络、存储、冷却等核心模块
- 分析并解决大规模训练和推理中的集群级问题,如通信效率、资源调度、带宽与能耗
- 研究并验证新型硬件(GPU、加速器、网络设备),提出选型与优化建议
- 参与算力平台与自动化运维系统的建设,提升集群的稳定性和利用率
- 与算法、系统团队协作,推动硬件潜能在端到端场景中的发挥
任职要求
- 芯片硬件/架构/设计经验,理解 GPU/CPU/加速器的体系结构
- 超算竞赛(ASC、ISC、HPC Challenge 等)经历,熟悉大规模并行计算与系统优化
- 具备扎实的计算机体系结构知识,对内存、网络、I/O 等硬件性能因素敏感
- 具备良好的工程素养和学习能力,乐于在万卡规模集群中解决真实工程挑战
- 有大规模 GPU 集群或超算系统实践经验
- 在 HPC 或硬件相关研究/竞赛中有突出成绩
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。