Agent RL 基础设施工程师
岗位摘要
负责 Agent 训练与推理全链路框架建设,支撑大规模模型后训练实验高效运行;与后训练算法团队紧密合作,支持 SFT、RL 等训练范式在 Agent 场景下的快速落地;持续优化训练/推理系统的吞吐、稳定性、成本与实验效率
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责 Agent 训练与推理全链路框架建设,支撑大规模模型后训练实验高效运行
- 与后训练算法团队紧密合作,支持 SFT、RL 等训练范式在 Agent 场景下的快速落地
- 持续优化训练/推理系统的吞吐、稳定性、成本与实验效率
- 参与实验平台、评测对比、数据流水线及执行环境等基础设施建设
任职要求
- 具备大模型训练、推理、后训练或分布式系统相关经验
- 熟悉 PyTorch、DeepSpeed、Megatron、FSDP、Ray、vLLM 等相关框架或生态
- 对 SFT、RLHF、PPO、GRPO、DPO、Reward Model、评测体系等有实际经验或深入理解
- 有训练框架、推理框架、实验平台或 RL Infra 经验者优先
- 具备较强工程实现、系统优化和复杂问题排查能力
加分项
- 有 Agent / Tool Use / Code Agent 相关训练或基础设施经验
- 有 rollout、评测平台、数据流水线、沙箱执行环境经验
- 有训练/推理框架或 Agent runtime 开源项目经验
- 许先生 今日活跃
福利待遇
- Base 北上 50-80K·16薪,具有竞争力的薪酬待遇
- 参与前沿 Agent 训练与推理基础设施建设
- 与顶尖后训练算法团队深度合作
- 助力大模型在 Agent 场景的快速落地与创新
工作地址
北京海淀区大恒科技大厦南座F9层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。