GPU RAS工程师
岗位摘要
设计并实现GPU错误上报、隔离、诊断与恢复机制,压缩MTTD/MTTR;构建覆盖预测、诊断、自愈的GPU/CPU集群全链路稳定性体系;攻关硬件与分布式软件栈交叉疑难问题,沉淀系统化解决方案
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计并实现GPU错误上报、隔离、诊断与恢复机制,压缩MTTD/MTTR
- 构建覆盖预测、诊断、自愈的GPU/CPU集群全链路稳定性体系
- 攻关硬件与分布式软件栈交叉疑难问题,沉淀系统化解决方案
- 优化集群SLA,主导复杂故障根因分析与架构改进
任职要求
- 计算机、电子、软件等相关专业本科及以上学历
- 3年以上系统可靠性、硬件可靠性或容错系统经验
- 精通C/C++及Linux内核驱动开发,熟悉AER、RAS等硬件错误上报机制
- 熟悉PCIe、NoC互联错误处理,具备故障隔离与恢复设计经验
- 有GPU/AI加速器RAS或数据中心集群运维经验者优先
加分项
- 有GPU、AI加速器或其他并行计算硬件的RAS设计经验
- 熟悉数据中心CPU、GPU集群的运维和故障处理流程
- 了解超节点架构下的故障影响控制
- 具备跨节点通讯软硬协同容错方案设计经验
- 郑女士 刚刚活跃
福利待遇
- 参与前沿GPU集群稳定性核心技术,直面AI大模型与超算挑战
- 与顶级架构师协作,快速积累高价值疑难问题攻关经验
- 上海核心地段办公,技术氛围浓厚,职业发展路径清晰
工作地址
上海浦东新区长泰广场B座12楼
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。