返回岗位列表

阶跃星辰

Agent RL Infra工程师

地点:北京 薪资:50-80K 日期:2026-05-22

岗位摘要

负责Agent训练与推理全链路框架建设,支撑大规模模型后训练实验高效运行;与后训练算法团队紧密合作,支持SFT、RL等训练范式在Agent场景下的快速落地;持续优化训练/推理系统的吞吐、稳定性、成本与实验效率

岗位职责

  • 负责Agent训练与推理全链路框架建设,支撑大规模模型后训练实验高效运行
  • 与后训练算法团队紧密合作,支持SFT、RL等训练范式在Agent场景下的快速落地
  • 持续优化训练/推理系统的吞吐、稳定性、成本与实验效率
  • 参与实验平台、评测对比、数据流水线及执行环境等基础设施建设

任职要求

  • 具备大模型训练、推理、后训练或分布式系统相关经验
  • 熟悉PyTorch、DeepSpeed、Megatron、FSDP、Ray、vLLM等相关框架或生态
  • 对SFT、RLHF、PPO、GRPO、DPO、Reward Model、评测体系等有实际经验或深入理解
  • 有训练框架、推理框架、实验平台或RL infra经验者优先
  • 具备较强工程实现、系统优化和复杂问题排查能力

加分项

  • 有 Agent / Tool Use / Code Agent 相关训练或基础设施经验
  • 有 rollout、评测平台、数据流水线、沙箱执行环境经验
  • 有训练/推理框架或 Agent runtime 开源项目经验
  • 许先生 今日活跃

福利待遇

  • Base北上50-80K·16薪,具有竞争力的薪酬待遇
  • 加入头部大模型创业公司,参与前沿Agent与RL技术基础设施建设
  • 与优秀的算法与工程团队紧密协作,成长空间大

工作地址

北京海淀区大恒科技大厦南座F9层