返回岗位列表

阶跃星辰

大模型强化学习训练与推理系统工程师

地点:北京 薪资:薪资未公开 日期:2026-07-20

岗位摘要

负责强化学习训练与推理基础设施的设计、开发与优化;负责分布式训练、任务调度、权重同步、热更新等核心链路建设;持续优化系统性能,包括吞吐量、时延、GPU利用率、训练效率等指标;建设稳定性与可观测能力,定位并解决OOM、超时、通信瓶颈、一致性问题等

岗位职责

  • 负责强化学习训练与推理基础设施的设计、开发与优化
  • 负责分布式训练、任务调度、权重同步、热更新等核心链路建设
  • 持续优化系统性能,包括吞吐量、时延、GPU利用率、训练效率等指标
  • 建设稳定性与可观测能力,定位并解决OOM、超时、通信瓶颈、一致性问题等
  • 参与Agent强化学习相关训练与系统支持工作,推动训练框架适配更复杂的Agent场景

任职要求

  • 熟悉PyTorch、CUDA、NCCL、Linux,理解分布式训练与推理系统基本原理
  • 了解RLHF或相关训练方法,对PPO、DPO、GRPO、Agent强化学习等方向有实际经验或较强理解
  • 有性能分析、问题排查和系统优化经验,能独立定位复杂问题
  • 熟悉AI编程,有使用或建设代码助手、自动化研发工具、编程Agent的经验
  • 有代码品味,对工程质量有要求,乐于学习新技术、新工具和新方法

加分项

  • 有大模型训练或推理系统相关经验
  • 有多机多卡、集群训练或在线服务稳定性治理经验
  • 对 Agent、推理优化、系统架构演进有持续兴趣
  • 负责大模型 RL 训练与推理系统建设,支持训练效率、系统稳定性和工程迭代速度的持续提升

福利待遇

  • 有大模型训练或推理系统相关经验者优先
  • 有多机多卡、集群训练或在线服务稳定性治理经验者优先
  • 对Agent、推理优化、系统架构演进有持续兴趣者优先