高性能计算系统工程师,消费产品
岗位摘要
设计、部署和运营支持消费产品开发关键仿真工作负载的大规模高性能计算集群(1000+节点);使用NC、IBM/Platform LSF和Slurm优化工作负载管理,重点关注吞吐量、公平性和最小化产品团队的队列等待时间
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计、部署和运营支持消费产品开发关键仿真工作负载的大规模高性能计算集群(1000+节点)
- 使用NC、IBM/Platform LSF和Slurm优化工作负载管理,重点关注吞吐量、公平性和最小化产品团队的队列等待时间
- 设计和实施工作负载平衡、集群联合和多调度器环境的策略,以支持多样化的产品工作流程
- 与产品设计、机械、电气和仿真工程师紧密合作,调试作业、改进并行扩展并加速设计到验证周期
- 管理和加固基于Linux的高性能计算系统(RHEL、Rocky Linux、AlmaLinux),包括补丁、内核调优和性能优化
- 操作和优化软件许可基础设施(FlexLM、DSLS、LUM、RLM),以最大化利用率并防止许可相关的开发瓶颈
- 部署和管理Azure CycleCloud和/或TotalCAE,以在产品开发高峰期实现弹性容量、云爆发和混合高性能计算工作流程
- 配置和调优高速互连,包括InfiniBand(HDR/EDR/FDR),以支持低延迟、紧密耦合的仿真工作负载
- 设计和维护高性能存储系统(NFS、DFS、Lustre、GPFS / Spectrum Scale、BeeGFS、Azure NetApp),优化仿真I/O模式
- 使用Python和Bash构建自动化和内部工具,以简化配置、监控、诊断和作业提交工作流程
- 实施监控、警报和容量规划系统(Grafana/Prometheus、Slurm会计、LSF监控),以确保产品团队的可预测性能
- 确保全球分布式高性能计算集群和混合云环境的高可用性和弹性
- 管理认证、网络和安全访问(LDAP/AD集成、网络、VPN)
- 生成关于集群架构、政策和最佳实践的清晰文档,针对消费产品工程工作流程进行定制
任职要求
- 7年以上设计和运营大规模高性能计算集群(1000+节点)的经验
- 对NC、IBM/Platform LSF和Slurm工作负载管理器有深入了解
- 强大的Linux系统管理经验(首选RHEL系列)
- 有MPI、并行扩展和仿真工作负载性能调优的实际经验
- 使用Azure CycleCloud在混合云环境中配置和管理高性能计算集群的经验
- 有操作InfiniBand或其他高速互连的经验
- 强大的Python和Bash技能,用于自动化、工具和工作流程优化
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。