返回岗位列表

摩尔线程

AI训练产品总监

地点:北京 薪资:40-70K 日期:2026-06-26

岗位摘要

定义从千卡到十万卡的训练软件平台愿景与多阶段路线图,覆盖单模态到多模态、从监督到RL/世界模型的连续能力梯队;在框架协同优化、Megatron类并行栈、弹性与容错、可观测性、数据/解码/仿真加速等关键价值点上做取舍与节奏管理

岗位职责

  • 定义从千卡到十万卡的训练软件平台愿景与多阶段路线图,覆盖单模态到多模态、从监督到RL/世界模型的连续能力梯队
  • 在框架协同优化、Megatron类并行栈、弹性与容错、可观测性、数据/解码/仿真加速等关键价值点上做取舍与节奏管理
  • 深访头部AI实验室、视频/内容生成企业、机器人/自动驾驶/数字孪生客户群,沉淀用例—痛点—指标—价值闭环
  • 持续竞品对标(NVIDIA CUDA/NCCL、Megatron/DeepSpeed、ROCm、Cloud TPU、各框架增强/发行版),明确差异化与赢面
  • 与研发团队(编译器/内核、驱动、框架、调度/控制面、仿真/数据团队)共拟技术路线与PRD,管理范围/优先级/依赖
  • 与市场/销售/解决方案协同制定GTM:多模态/世界模型参考架构、白皮书、标杆案例、TCO计算器与性能基准口径
  • 与DevRel/社区合作,推动开源贡献与生态集成(Megatron/DeepSpeed/FSDP配方、数据/仿真工具链),提升采用度
  • 深度参与大客户售前,面向CTO/技术VP阐述跨模态与世界模型能力路线图,驱动关键订单与战略合作
  • 对产品线Adoption、满意度与营收目标负责,探索授权/订阅/支持/云市场等商业模式

任职要求

  • 8年以上技术产品管理经验;5年以上AI/ML基础设施、分布式系统或云平台相关经验
  • GPU训练平台实战,亲手操盘过千卡级以上GPU训练(或等规模TPU/ROCm)平台/方案,理解并行策略、通信/存储瓶颈与性能调优
  • 深入理解Megatron类分布式训练框架与并行体系:Tensor/Pipeline/Sequence/Context Parallelism,Interleaved Pipeline,激活与优化器分片、重计算/检查点
  • 熟悉MoE的Expert Parallel与TP/DP/EP复合并行、AllToAll优化,FSDP/ZeRO(Stage 1/2/3)与Megatron-Core/DeepSpeed的协同实践
  • 掌握长上下文训练稳定性(Flash/SDPA、KV缓存/重排、分布式注意力)、大批次/高吞吐训练与通信–计算重叠策略
  • 多模态或生成方向:至少满足一项,包括MLLM/VLM、扩散(图像/视频/音频)、长视频生成、语音(ASR/TTS)的大规模训练与评测落地,或多模态数据管线与评测指标体系
  • 或世界模型/模型化强化学习平台化经验:Actor–Learner架构、并行环境/仿真调度、Env Steps/s与Train Steps/s平衡、离线/在线/混合训练、回放与一致性
  • 有复杂平台产品从0→1与1→N的成功实践,能用指标与客户价值证明
  • 优秀的跨团队领导与商业敏锐度,兼顾技术深度与价值叙事
  • 计算机/电气工程或相关专业本科/硕士

加分项

  • NVIDIA/AMD/TPU/AWS/Azure/GCP 或顶尖 AI 实验室训练基础设施经验
  • 对 PyTorch/JAX/TensorFlow、Megatron/DeepSpeed/FSDP 社区有贡献
  • 熟悉 Kubernetes/Slurm、NCCL/InfiniBand/RDMA、并行文件系统(Lustre/DAOS/GPFS)、DALI 类数据加速与视频解码
  • 面向大型企业客户的方案与谈判经验
  • 中英双语沟通优秀
  • 袁先生 刚刚活跃
  • 摩尔线程 · 技术市场经理

福利待遇

  • 薪资范围40-70K·16薪
  • 工作地点北京朝阳区望京国际研发园
  • 有机会参与前沿AI训练平台产品从0到1的构建
  • 与顶尖AI实验室和客户深度合作
  • 跨职能领导与商业决策的广阔发展空间

工作地址

北京朝阳区望京国际研发园I座I3