基础设施研究工程师
岗位摘要
构建并拥有跨GPU集群可靠运行大规模训练任务的系统,包括任务启动器、检查点与恢复、容错机制及监控;拥有支撑数十万并发编码智能体在虚拟机沙箱中运行的底层基础设施,涵盖高保真环境设计与分布式系统
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 构建并拥有跨GPU集群可靠运行大规模训练任务的系统,包括任务启动器、检查点与恢复、容错机制及监控
- 拥有支撑数十万并发编码智能体在虚拟机沙箱中运行的底层基础设施,涵盖高保真环境设计与分布式系统
- 端到端分析并优化训练吞吐量,识别数据加载、通信开销、内存利用率和计算效率等方面的瓶颈,并实施有效改进
- 设计并维护研究人员用于启动、跟踪和分析实验的系统,减少研究循环中的摩擦
- 构建高吞吐量、高可靠性的训练与评估数据管道,确保数据质量、可复现性和效率
- 诊断并解决跨GPU、网络、数值计算和数据方面的训练故障,构建优雅降级和快速恢复的系统
- 实现并优化数据、张量、流水线和序列并行等并行策略,以最大化硬件利用率
- 主动预测研究团队未来需求,并提前构建基础设施,避免其成为约束
任职要求
- 具备构建和运营大型模型分布式训练系统的深厚经验,能够端到端地拥有从集群层到训练循环的基础设施
- 扎实的系统工程基础,包括分布式系统、网络、存储,以及跨硬件-软件栈进行性能分析的能力
- 精通Python和C++,具备PyTorch或同等深度学习框架的系统级经验,而不仅仅是API使用
福利待遇
- 与顶尖AI研究团队并肩工作,直接参与前沿技术研发
- 拥有高度自主权,负责核心基础设施的架构设计与实现
- 在快节奏、高影响力的环境中持续学习和成长
- 参与解决世界级难题,构建能够推理真实世界任务的AI
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。