返回岗位列表

阶跃星辰

强化学习训练基础设施工程师

地点:北京 薪资:薪资未公开 日期:2026-07-20

岗位摘要

负责Agentic RL训练基础设施建设,覆盖沙箱/环境运行时、脚手架、多阶段强化学习工作流、评估与回放等核心链路;支持大规模环境生产、数据回流与训练闭环,持续优化系统稳定性、吞吐量与可扩展性

岗位职责

  • 负责Agentic RL训练基础设施建设,覆盖沙箱/环境运行时、脚手架、多阶段强化学习工作流、评估与回放等核心链路
  • 支持大规模环境生产、数据回流与训练闭环,持续优化系统稳定性、吞吐量与可扩展性
  • 与算法、数据、基础设施团队深度协同,推动复杂智能体任务训练体系工程化落地

任职要求

  • 具备扎实工程能力,熟悉Python或Go等至少一种编程语言
  • 理解RLHF、Agentic RL、工具使用、环境、回放等核心机制
  • 有后训练、智能体、沙箱或大规模数据循环相关经验者优先
  • 既能理解算法需求,也能抽象通用系统能力,推动训练基础设施持续演进