大模型后训练系统工程师(实习)
岗位摘要
基础训练/推理引擎开发、精度保障、效率优化等;低精度训推效率优化、训推一致性建设等;大规模RL框架设计/优化,面向下一代长程任务训练深度优化;稳定性建设,提升大规模训练过程中容错定位及恢复效率
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 基础训练/推理引擎开发、精度保障、效率优化等
- 低精度训推效率优化、训推一致性建设等
- 大规模RL框架设计/优化,面向下一代长程任务训练深度优化
- 稳定性建设,提升大规模训练过程中容错定位及恢复效率
- 算法/工程协同设计,共同优化系统易用性、提升算法效果
- 提升系统可观测性,支持细粒度指标建设、生命周期追溯管理等
任职要求
- 熟悉PyTorch分布式训练/推理原理,熟悉Megatron/FSDP、vLLM/Sglang优先
- 熟悉PPO原理及各变种RL算法,熟悉verl、slime等框架优先
- 熟悉性能分析、问题排查相关工具,具备独立定位解决复杂问题能力
- 熟悉AI Coding,有使用或建设代码助手、自动化研发工具、Coding Agent的经验
加分项
- 大规模分布式训/推/强化框架经验
- 长程AgenticRL任务算法策略调优
- 上述相关领域发表过顶会论文
福利待遇
- 实习薪资500-550元/天
- 深度参与前沿大模型技术研发
- 与顶尖算法和工程团队合作
工作地址
北京海淀区大恒科技大厦12F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。