后训练环境与训练平台工程师
岗位摘要
设计并维护大规模Sandbox/Environment Runtime,支持代码执行、终端操作、Web交互等多类Agent任务场景,保障并发、隔离、超时恢复与可复现性;统一接入多种Scaffold框架(如SWE-agent、ReAct、自研scaffold),抽象出标准化的环境接口,屏蔽底层差异
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计并维护大规模Sandbox/Environment Runtime,支持代码执行、终端操作、Web交互等多类Agent任务场景,保障并发、隔离、超时恢复与可复现性
- 统一接入多种Scaffold框架(如SWE-agent、ReAct、自研scaffold),抽象出标准化的环境接口,屏蔽底层差异
- 建设大规模Environment生产与数据回流体系:Trajectory采集、过滤、格式化,闭合'采样→训练→再采样'的数据飞轮
- 与算法团队协作,设计可接入RL训练框架(slime/veRL等)的数据格式与reward传递接口,确保训练侧能稳定消费
- 保障RL Workflow的大规模稳定性:任务调度、异常恢复、资源隔离、全链路可观测性
- 建设Eval与Replay能力:支持对复杂Agent任务的系统化评测,以及对历史轨迹的回放与debug
任职要求
- 扎实的系统工程能力,熟悉Python,了解Go或其他系统语言优先
- 有分布式任务调度或大规模训练平台的工程经验(Ray、K8s、Slurm等)
- 理解Sandbox隔离机制(Docker、gVisor、VM、进程沙箱),做过容器化执行环境优先
- 理解RLHF/Agentic RL的基本训练范式(GRPO、PPO),知道数据侧需要提供什么
- 有RL环境构建经验(Gym/Gymnasium风格,或SWE-bench/WebArena/OSWorld类任务环境)优先
- 有大规模数据采集、清洗、回流管道经验优先
- 能读懂算法需求,将其转化为可落地的系统设计,在算法与工程之间担任翻译者
加分项
- 贡献过 slime、veRL、OpenRLHF 等开源后训练框架
- bench、TerminalBench 等 coding agent 评测环境
- 有 Trajectory Replay、分布式 Eval 系统的设计经验
- 吴珣 刚刚活跃
福利待遇
- 薪资范围:40-70K·16薪
- 工作地点:北京海淀区
- 参与前沿Agent模型后训练基础设施建设
- 与顶尖算法团队合作
- 贡献开源项目机会
工作地址
北京海淀区大恒科技大厦00
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。