返回岗位列表

阶跃星辰

后训练环境与训练平台工程师

地点:北京 薪资:40-70K 日期:2026-06-26

岗位摘要

设计并维护大规模Sandbox/Environment Runtime,支持代码执行、终端操作、Web交互等多类Agent任务场景,保障并发、隔离、超时恢复与可复现性;统一接入多种Scaffold框架(如SWE-agent、ReAct、自研scaffold),抽象出标准化的环境接口,屏蔽底层差异

岗位职责

  • 设计并维护大规模Sandbox/Environment Runtime,支持代码执行、终端操作、Web交互等多类Agent任务场景,保障并发、隔离、超时恢复与可复现性
  • 统一接入多种Scaffold框架(如SWE-agent、ReAct、自研scaffold),抽象出标准化的环境接口,屏蔽底层差异
  • 建设大规模Environment生产与数据回流体系:Trajectory采集、过滤、格式化,闭合'采样→训练→再采样'的数据飞轮
  • 与算法团队协作,设计可接入RL训练框架(slime/veRL等)的数据格式与reward传递接口,确保训练侧能稳定消费
  • 保障RL Workflow的大规模稳定性:任务调度、异常恢复、资源隔离、全链路可观测性
  • 建设Eval与Replay能力:支持对复杂Agent任务的系统化评测,以及对历史轨迹的回放与debug

任职要求

  • 扎实的系统工程能力,熟悉Python,了解Go或其他系统语言优先
  • 有分布式任务调度或大规模训练平台的工程经验(Ray、K8s、Slurm等)
  • 理解Sandbox隔离机制(Docker、gVisor、VM、进程沙箱),做过容器化执行环境优先
  • 理解RLHF/Agentic RL的基本训练范式(GRPO、PPO),知道数据侧需要提供什么
  • 有RL环境构建经验(Gym/Gymnasium风格,或SWE-bench/WebArena/OSWorld类任务环境)优先
  • 有大规模数据采集、清洗、回流管道经验优先
  • 能读懂算法需求,将其转化为可落地的系统设计,在算法与工程之间担任翻译者

加分项

  • 贡献过 slime、veRL、OpenRLHF 等开源后训练框架
  • bench、TerminalBench 等 coding agent 评测环境
  • 有 Trajectory Replay、分布式 Eval 系统的设计经验
  • 吴珣 刚刚活跃

福利待遇

  • 薪资范围:40-70K·16薪
  • 工作地点:北京海淀区
  • 参与前沿Agent模型后训练基础设施建设
  • 与顶尖算法团队合作
  • 贡献开源项目机会

工作地址

北京海淀区大恒科技大厦00