分布式训练系统工程师
岗位摘要
负责流式视频生成模型大规模分布式训练系统的架构设计与持续优化,涵盖FSDP2、Context Parallel、Pipeline Parallel等多维并行策略;设计和优化训练框架核心模块,持续提升训练吞吐与资源利用率
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责流式视频生成模型大规模分布式训练系统的架构设计与持续优化,涵盖FSDP2、Context Parallel、Pipeline Parallel等多维并行策略
- 设计和优化训练框架核心模块,持续提升训练吞吐与资源利用率
- 紧密配合算法团队,为新算法范式快速搭建高效训练流水线,降低算法迭代到实验验证的周期
- 深入GPU内核层面进行性能调优,包括算子融合、通信与计算重叠、显存精细化管理等
- 结合profiling工具定位瓶颈并驱动端到端训练效率提升
任职要求
- 计算机、人工智能、电子信息、数学等相关专业
- 有扎实的工程算法基础,熟悉GPU架构、内存层次与分布式计算理论
- 熟练掌握各种编译、调试、性能分析工具(pdb/gdb/nsys/torchprofiler)
- 熟悉Megatron/DeepSpeed/Torch-FSDP等分布式训练框架,能够设计并协同落地高效并行机制
- 推动框架持续演进,满足模型架构升级(多模态、复杂结构、超大参数)带来的各种能力诉求
- 熟悉主流大模型结构细节及其训练方法或显著开源贡献者优先
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。