预训练Infra负责人
岗位摘要
负责预训练基础设施的整体架构设计与技术规划,主导Infra方案的落地实施;搭建并优化大规模预训练系统,确保千/万卡级别集群的高效稳定运行;主导分布式训练框架的选型、优化与二次开发,持续提升训练效率与资源利用率
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责预训练基础设施的整体架构设计与技术规划,主导Infra方案的落地实施
- 搭建并优化大规模预训练系统,确保千/万卡级别集群的高效稳定运行
- 主导分布式训练框架的选型、优化与二次开发,持续提升训练效率与资源利用率
- 带领团队解决预训练过程中的系统瓶颈问题,包括通信、存储、调度等关键环节
- 与算法团队紧密协作,推动预训练流程的工程化与自动化建设
任职要求
- 本科及以上学历,计算机、软件工程等相关专业,有千卡/万卡规模预训练项目经验
- 深入理解大模型预训练原理,熟悉Transformer架构及主流大模型训练流程
- 精通分布式训练原理,熟悉Megatron-LM、FSDP等主流分布式训练框架
- 熟悉GPU集群架构、高性能网络(RDMA/InfiniBand)、并行存储系统
- 熟悉NCCL/Gloo等通信库原理,有通信优化经验
- 具备较强的技术视野和团队管理能力,能够带领团队攻克技术难题
- 有开源社区贡献或技术影响力者优先
加分项
- 有开源社区贡献或技术影响力
- 薛明畅 刚刚活跃
工作地址
北京海淀区科建大厦301
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。