高性能计算系统工程师
岗位摘要
架构、部署和运维大规模HPC集群(1000+节点),支持对消费产品开发至关重要的仿真工作负载(Abaqus、Ansys、COMSOL、LS-DYNA等工具);使用NC、IBM/Platform LSF和Slurm优化工作负载管理,重点关注吞吐量、公平性并最小化产品团队的队列等待时间
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 架构、部署和运维大规模HPC集群(1000+节点),支持对消费产品开发至关重要的仿真工作负载(Abaqus、Ansys、COMSOL、LS-DYNA等工具)
- 使用NC、IBM/Platform LSF和Slurm优化工作负载管理,重点关注吞吐量、公平性并最小化产品团队的队列等待时间
- 设计和实施工作负载平衡、集群联合以及支持多样化产品工作流程的多调度器环境策略
- 与产品设计、机械、电气和仿真工程师紧密合作,调试作业、改进并行扩展并加速从设计到验证的周期
- 管理和加固基于Linux的HPC系统(RHEL、Rocky Linux、AlmaLinux),包括打补丁、内核调优和性能优化
- 运维和优化软件许可基础设施(FlexLM、DSLS、LUM、RLM),以最大化利用率并防止与许可相关的开发瓶颈
- 部署和管理Azure CycleCloud和/或TotalCAE,以在产品开发高峰期实现弹性容量、云爆发和混合HPC工作流程
- 配置和调优高速互连,包括InfiniBand(HDR/EDR/FDR),以支持低延迟、紧密耦合的仿真工作负载
- 使用Python和Bash构建自动化和内部工具,以简化配置、监控、诊断和作业提交工作流程
- 实施监控、警报和容量规划系统(Grafana/Prometheus、Slurm计费、LSF监控),以确保产品团队获得可预测的性能
- 确保全球分布式HPC集群和混合云环境的高可用性和弹性
- 管理身份验证、网络和安全访问(LDAP/AD集成、网络、VPN)
- 制作关于系统架构、操作程序和故障排除步骤的清晰文档
任职要求
- 具备大规模高性能计算(HPC)集群(1000个以上节点)的架构设计、部署和运维经验
- 熟悉工程仿真软件(如Abaqus、Ansys、COMSOL、LS-DYNA等)及其在HPC环境中的工作负载特性
- 精通作业调度管理系统(如NC、IBM/Platform LSF、Slurm)的配置优化和性能调优
- 具备Linux操作系统(RHEL、Rocky Linux、AlmaLinux)的系统管理、安全加固和内核参数调优经验
- 熟悉软件许可证管理基础设施(如FlexLM、DSLS、LUM、RLM)的运维和利用率优化
- 具备Azure CycleCloud和/或TotalCAE等混合云HPC平台的部署和管理经验,支持弹性计算和云 bursting 工作流
- 熟悉高速互联网络(如InfiniBand HDR/EDR/FDR)的配置和性能优化
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。