大模型训练框架研发工程师
岗位摘要
你将加入一支把“把万卡集群跑到极致”当日常的团队,与业内领先的通用大模型一起成长。你的核心任务是:突破大规模训练的速度、成本与稳定性的极限;大规模分布式训练系统研发(Scale Matters)
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 你将加入一支把“把万卡集群跑到极致”当日常的团队,与业内领先的通用大模型一起成长。你的核心任务是:突破大规模训练的速度、成本与稳定性的极限
- 大规模分布式训练系统研发(Scale Matters)
- 主导 Data / Tensor / Pipeline / Expert 并行 策略的研发与优化
- 优化高性能通信、计算通信掩盖、显存复用,提升近万卡训练的集群利用率
- 面向上百亿〜万亿参数模型,实践高效并行范式
- 性能极限优化(Performance Engineering)
- 系统性分析训练吞吐瓶颈(comm / compute / IO / kernel / memory)
- 针对关键路径做深度优化:算子融合、精度压缩、通信调度、显存管理策略
- 与推理体系协同推进量化、MoE、Speculative Training 等最新机制的训练端落地
- 前沿训练技术探索(Frontier Research → Engineering)
任职要求
- 我们希望你具备(不求全,但求强)
- 可以 0 优化经验,但在其他领域有过优秀成果
- 熟悉高级编程语言,具备扎实的数据结构、并行编程、系统基础
- 对 PyTorch、DeepSpeed、Megatron、Horovod、JAX、XLA 等之一有体系化理解
- 对以下任一方向有深入经验或潜力
- 大型分布式训练(DP/TP/PP/MoE)
- GPU/多机通信优化(NCCL、RDMA、通信拓扑)
- 训练框架/执行引擎研发
- 大模型训练的性能与稳定性优化
- 对前沿训练问题有明确兴趣,如
加分项
- 为什么加入我们
- 你将直接参与 领先通用大模型的核心训练体系,工作成果会快速转化为真实产品力
- 足够高的解决问题自由度,我们的工作不仅局限于特定scope,也不受限于特定工程算法方案,只要能够挑战更高的极限,可以放下当前所有的约束
- 和有“偏执工程美学”的伙伴一起,把“更快、更稳、更大规模”做成一种乐趣
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。