RL Infra&强化学习系统工程师
岗位摘要
负责RL训练与推理基础设施的设计、开发与优化;负责分布式训练、任务调度、权重同步、热更新等核心链路建设;持续优化系统性能,包括吞吐、时延、GPU利用率、训练效率等指标;建设稳定性与可观测能力,定位并解决OOM、超时、通信瓶颈、一致性问题等
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责RL训练与推理基础设施的设计、开发与优化
- 负责分布式训练、任务调度、权重同步、热更新等核心链路建设
- 持续优化系统性能,包括吞吐、时延、GPU利用率、训练效率等指标
- 建设稳定性与可观测能力,定位并解决OOM、超时、通信瓶颈、一致性问题等
- 参与Agent RL相关训练与系统支持工作,推动训练框架适配更复杂的Agent场景
任职要求
- 熟悉PyTorch、CUDA、NCCL、Linux,理解分布式训练与推理系统基本原理
- 了解RLHF或相关训练方法,对PPO、DPO、GRPO、Agent RL等方向有实际经验或较强理解
- 有性能分析、问题排查和系统优化经验,能独立定位复杂问题
- 熟悉AI Coding,有使用或建设代码助手、自动化研发工具、Coding Agent的经验
- 有代码品味,对工程质量有要求,乐于学习新技术、新工具和新方法
加分项
- 有大模型训练或推理系统相关经验
- 有多机多卡、集群训练或在线服务稳定性治理经验
- 对 Agent、推理优化、系统架构演进有持续兴趣
- 许先生 刚刚活跃
福利待遇
- 薪资范围80-110K·16薪
- 工作地点北京或上海
- 参与前沿大模型RL系统建设
工作地址
北京海淀区大恒科技大厦南座F9层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。