返回岗位列表

OpenAI

高性能计算系统工程师

地点:美国 薪资:薪资未公开 日期:2025-12-15

岗位摘要

架构、部署和运维大规模HPC集群(1000+节点),支持对消费产品开发至关重要的仿真工作负载(Abaqus、Ansys、COMSOL、LS-DYNA等工具);使用NC、IBM/Platform LSF和Slurm优化工作负载管理,重点关注吞吐量、公平性并最小化产品团队的队列等待时间

岗位职责

  • 架构、部署和运维大规模HPC集群(1000+节点),支持对消费产品开发至关重要的仿真工作负载(Abaqus、Ansys、COMSOL、LS-DYNA等工具)
  • 使用NC、IBM/Platform LSF和Slurm优化工作负载管理,重点关注吞吐量、公平性并最小化产品团队的队列等待时间
  • 设计和实施工作负载平衡、集群联合以及支持多样化产品工作流程的多调度器环境策略
  • 与产品设计、机械、电气和仿真工程师紧密合作,调试作业、改进并行扩展并加速从设计到验证的周期
  • 管理和加固基于Linux的HPC系统(RHEL、Rocky Linux、AlmaLinux),包括打补丁、内核调优和性能优化
  • 运维和优化软件许可基础设施(FlexLM、DSLS、LUM、RLM),以最大化利用率并防止与许可相关的开发瓶颈
  • 部署和管理Azure CycleCloud和/或TotalCAE,以在产品开发高峰期实现弹性容量、云爆发和混合HPC工作流程
  • 配置和调优高速互连,包括InfiniBand(HDR/EDR/FDR),以支持低延迟、紧密耦合的仿真工作负载
  • 使用Python和Bash构建自动化和内部工具,以简化配置、监控、诊断和作业提交工作流程
  • 实施监控、警报和容量规划系统(Grafana/Prometheus、Slurm计费、LSF监控),以确保产品团队获得可预测的性能
  • 确保全球分布式HPC集群和混合云环境的高可用性和弹性
  • 管理身份验证、网络和安全访问(LDAP/AD集成、网络、VPN)
  • 制作关于系统架构、操作程序和故障排除步骤的清晰文档

任职要求

  • 具备大规模高性能计算(HPC)集群(1000个以上节点)的架构设计、部署和运维经验
  • 熟悉工程仿真软件(如Abaqus、Ansys、COMSOL、LS-DYNA等)及其在HPC环境中的工作负载特性
  • 精通作业调度管理系统(如NC、IBM/Platform LSF、Slurm)的配置优化和性能调优
  • 具备Linux操作系统(RHEL、Rocky Linux、AlmaLinux)的系统管理、安全加固和内核参数调优经验
  • 熟悉软件许可证管理基础设施(如FlexLM、DSLS、LUM、RLM)的运维和利用率优化
  • 具备Azure CycleCloud和/或TotalCAE等混合云HPC平台的部署和管理经验,支持弹性计算和云 bursting 工作流
  • 熟悉高速互联网络(如InfiniBand HDR/EDR/FDR)的配置和性能优化