强化学习训练基础设施工程师
岗位摘要
负责Agentic RL训练基础设施建设,覆盖沙箱/环境运行时、脚手架、多阶段强化学习工作流、评估与回放等核心链路;支持大规模环境生产、数据回流与训练闭环,持续优化系统稳定性、吞吐量与可扩展性
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责Agentic RL训练基础设施建设,覆盖沙箱/环境运行时、脚手架、多阶段强化学习工作流、评估与回放等核心链路
- 支持大规模环境生产、数据回流与训练闭环,持续优化系统稳定性、吞吐量与可扩展性
- 与算法、数据、基础设施团队深度协同,推动复杂智能体任务训练体系工程化落地
任职要求
- 具备扎实工程能力,熟悉Python或Go等至少一种编程语言
- 理解RLHF、Agentic RL、工具使用、环境、回放等核心机制
- 有后训练、智能体、沙箱或大规模数据循环相关经验者优先
- 既能理解算法需求,也能抽象通用系统能力,推动训练基础设施持续演进
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。