软件工程师 - 超级计算团队
岗位摘要
设计、实施和维护超级计算环境的稳健、可扩展基础设施;监控和优化系统性能,确保高可用性和最短停机时间;开发自动化工具和脚本,以简化操作并提高系统可靠性;排查分布式系统、网络和存储解决方案中的复杂问题
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计、实施和维护超级计算环境的稳健、可扩展基础设施
- 监控和优化系统性能,确保高可用性和最短停机时间
- 开发自动化工具和脚本,以简化操作并提高系统可靠性
- 排查分布式系统、网络和存储解决方案中的复杂问题
- 与AI研究人员和工程师合作,支持计算密集型工作负载
- 实施安全最佳实践,保护敏感数据和基础设施
- 参与容量规划和灾难恢复策略的制定
- 参与待命轮换,确保7x24小时系统可靠性
任职要求
- 计算机科学、工程或相关领域的学士学位(或同等经验)
- 3年以上站点可靠性工程、DevOps或系统工程师经验
- 精通Linux系统管理和脚本编写(例如Python、Bash)
- 深刻理解网络、分布式系统和存储技术
- 熟悉HPC环境、GPU集群或大规模数据处理
- 出色的解决问题能力,能在快节奏、动态环境中工作
- 强大的沟通技巧和协作精神
- 加分项:具有基础设施即代码(例如Terraform、Ansible)或监控工具(例如Prometheus、Grafana)经验
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。