分布式系统工程师
岗位摘要
设计、构建和实施大规模分布式训练系统;对多主机GPU利用率进行分析、调试和优化;进行硬件/软件/算法的协同设计;维护并创新代码库;构建工具以提高团队生产力;具备配置和排查操作系统以实现最佳性能的经验
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计、构建和实施大规模分布式训练系统
- 对多主机GPU利用率进行分析、调试和优化
- 进行硬件/软件/算法的协同设计
- 维护并创新代码库
- 构建工具以提高团队生产力
任职要求
- 具备配置和排查操作系统以实现最佳性能的经验
- 曾为HPC集群中的AI模型构建可扩展的训练框架,包括但不限于:可扩展的编排框架和工具;机器学习编译器和运行时,如XLA、MLIR和Triton;分布式训练策略,如FSDP、Megatron和流水线并行;用于高性能通信集合操作的NCCL或自定义通信库
- 熟悉Linux和POSIX系统
- 具备出色的沟通能力,能够简洁准确地与团队成员分享知识
- 工作积极主动,注重工程卓越,能在扁平化组织结构中直接为公司使命做出贡献
- 该职位位于加利福尼亚州帕洛阿尔托,候选人需位于湾区附近或愿意搬迁
福利待遇
- 全面的医疗、视力和牙科保险
- 401(k)退休计划
- 短期和长期残疾保险
- 各种其他折扣和福利
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。