AI训练产品总监
岗位摘要
定义从千卡到十万卡的训练软件平台愿景与多阶段路线图,覆盖单模态到多模态、从监督到RL/世界模型的连续能力梯队;在框架协同优化、Megatron类并行栈、弹性与容错、可观测性、数据/解码/仿真加速等关键价值点上做取舍与节奏管理
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 定义从千卡到十万卡的训练软件平台愿景与多阶段路线图,覆盖单模态到多模态、从监督到RL/世界模型的连续能力梯队
- 在框架协同优化、Megatron类并行栈、弹性与容错、可观测性、数据/解码/仿真加速等关键价值点上做取舍与节奏管理
- 深访头部AI实验室、视频/内容生成企业、机器人/自动驾驶/数字孪生客户群,沉淀用例—痛点—指标—价值闭环
- 持续竞品对标(NVIDIA CUDA/NCCL、Megatron/DeepSpeed、ROCm、Cloud TPU、各框架增强/发行版),明确差异化与赢面
- 与研发团队(编译器/内核、驱动、框架、调度/控制面、仿真/数据团队)共拟技术路线与PRD,管理范围/优先级/依赖
- 与市场/销售/解决方案协同制定GTM:多模态/世界模型参考架构、白皮书、标杆案例、TCO计算器与性能基准口径
- 与DevRel/社区合作,推动开源贡献与生态集成(Megatron/DeepSpeed/FSDP配方、数据/仿真工具链),提升采用度
- 深度参与大客户售前,面向CTO/技术VP阐述跨模态与世界模型能力路线图,驱动关键订单与战略合作
- 对产品线Adoption、满意度与营收目标负责,探索授权/订阅/支持/云市场等商业模式
任职要求
- 8年以上技术产品管理经验;5年以上AI/ML基础设施、分布式系统或云平台相关经验
- GPU训练平台实战,亲手操盘过千卡级以上GPU训练(或等规模TPU/ROCm)平台/方案,理解并行策略、通信/存储瓶颈与性能调优
- 深入理解Megatron类分布式训练框架与并行体系:Tensor/Pipeline/Sequence/Context Parallelism,Interleaved Pipeline,激活与优化器分片、重计算/检查点
- 熟悉MoE的Expert Parallel与TP/DP/EP复合并行、AllToAll优化,FSDP/ZeRO(Stage 1/2/3)与Megatron-Core/DeepSpeed的协同实践
- 掌握长上下文训练稳定性(Flash/SDPA、KV缓存/重排、分布式注意力)、大批次/高吞吐训练与通信–计算重叠策略
- 多模态或生成方向:至少满足一项,包括MLLM/VLM、扩散(图像/视频/音频)、长视频生成、语音(ASR/TTS)的大规模训练与评测落地,或多模态数据管线与评测指标体系
- 或世界模型/模型化强化学习平台化经验:Actor–Learner架构、并行环境/仿真调度、Env Steps/s与Train Steps/s平衡、离线/在线/混合训练、回放与一致性
- 有复杂平台产品从0→1与1→N的成功实践,能用指标与客户价值证明
- 优秀的跨团队领导与商业敏锐度,兼顾技术深度与价值叙事
- 计算机/电气工程或相关专业本科/硕士
加分项
- NVIDIA/AMD/TPU/AWS/Azure/GCP 或顶尖 AI 实验室训练基础设施经验
- 对 PyTorch/JAX/TensorFlow、Megatron/DeepSpeed/FSDP 社区有贡献
- 熟悉 Kubernetes/Slurm、NCCL/InfiniBand/RDMA、并行文件系统(Lustre/DAOS/GPFS)、DALI 类数据加速与视频解码
- 面向大型企业客户的方案与谈判经验
- 中英双语沟通优秀
- 袁先生 刚刚活跃
- 摩尔线程 · 技术市场经理
福利待遇
- 薪资范围40-70K·16薪
- 工作地点北京朝阳区望京国际研发园
- 有机会参与前沿AI训练平台产品从0到1的构建
- 与顶尖AI实验室和客户深度合作
- 跨职能领导与商业决策的广阔发展空间
工作地址
北京朝阳区望京国际研发园I座I3
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。