大模型后训练引擎工程师
岗位摘要
负责后训练阶段SFT、RL等训练引擎建设与分布式训练性能优化,支撑不同后训练任务的高效接入、稳定运行与规模化迭代;负责低精度训练能力建设,提升低精度训练场景下的效率、精度与稳定性;负责长上下文训练能力建设,支撑长序列后训练任务的高效训练
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责后训练阶段SFT、RL等训练引擎建设与分布式训练性能优化,支撑不同后训练任务的高效接入、稳定运行与规模化迭代
- 负责低精度训练能力建设,提升低精度训练场景下的效率、精度与稳定性
- 负责长上下文训练能力建设,支撑长序列后训练任务的高效训练
- 负责后训练中的训推协同优化,提升RL等场景下训练与推理链路的整体效率
- 负责训练稳定性与可观测性建设,提升大规模训练过程中的问题发现、定位与恢复效率
任职要求
- 熟悉PyTorch、Megatron、FSDP等大模型训练框架,理解分布式训练基本原理
- 具备大模型训练性能优化经验,熟悉通信优化、显存优化、重计算、算子融合、通信计算重叠等优化方法
- 熟悉低精度训练、量化训练、长上下文训练、Sparse Attention、投机采样等方向者优先
- 熟悉SFT、PPO、GRPO、DPO等后训练算法原理,理解后训练算法对训练系统的需求
- 熟悉Nsight、PyTorch Profiler等性能分析工具,具备独立定位训练性能、精度和稳定性问题的能力
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。