高级工程师 - 大规模语言模型训练框架
岗位摘要
构建并负责用于大规模LLM训练的训练框架;设计分布式训练抽象(数据/张量/流水线并行,FSDP/ZeRO策略,内存管理,检查点);在多节点集群(例如GB200/300,AMD,H200/100)上提高训练吞吐量和稳定性
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 构建并负责用于大规模LLM训练的训练框架
- 设计分布式训练抽象(数据/张量/流水线并行,FSDP/ZeRO策略,内存管理,检查点)
- 在多节点集群(例如GB200/300,AMD,H200/100)上提高训练吞吐量和稳定性
- 开发和维护用于监控、日志记录、调试和开发者工效学的工具
- 与基础设施团队紧密合作,确保Slurm设置、容器环境和硬件配置支持高性能训练
- 调查并解决整个ML系统堆栈中的性能瓶颈
- 构建健壮的系统,确保大规模运行的可重复性和可调试性
任职要求
- 在大规模分布式训练或HPC系统方面拥有丰富的工程经验
- 深入了解JAX内部原理、分布式训练库或自定义内核/融合操作
- 具有多节点集群编排经验(Slurm、Ray、Kubernetes或类似工具)
- 能够熟练调试CUDA/NCCL、网络、IO和数据管道中的性能问题
- 拥有为ML团队构建提高开发效率工具的良好记录
- 在权衡取舍方面具备出色的判断力:性能与复杂性、研究速度与可维护性
- 具备强大的协作能力——将与基础设施、研究和部署团队紧密合作
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。