返回岗位列表

阶跃星辰

大模型训推系统工程师

地点:北京 薪资:薪资未公开 日期:2026-07-20

岗位摘要

维护并持续优化Post-Train训推框架,降低使用门槛,让研究员专注于实验本身而非环境问题;深入训练与推理全链路,覆盖显存优化、通信加速、调度策略、吞吐与延迟等核心指标,缩短实验周期,提升资源利用率

岗位职责

  • 维护并持续优化Post-Train训推框架,降低使用门槛,让研究员专注于实验本身而非环境问题
  • 深入训练与推理全链路,覆盖显存优化、通信加速、调度策略、吞吐与延迟等核心指标,缩短实验周期,提升资源利用率
  • 构建高效稳定的数据处理与供给流水线,支持多源异构数据的清洗、混合与动态调度

任职要求

  • 熟悉Post-Train训练流程(SFT、RLVR、RLHF、AgentRL等),对训推基建有深入了解
  • 有大模型系统开发和优化经验,具备从零搭建或大规模改造训推系统的实际案例
  • 独立思考,不迷信权威,敢于提出正确观点
  • 有工程项目维护经验,注重系统可观测性、可复现性及快速定位根因的能力
  • 真正理解分布式训推底层逻辑(tensor parallelism、pipeline scheduling、NCCL通信、GPU显存布局等),能解释性能瓶颈原因
  • 高强度使用AI工具辅助开发、调试和分析,并能判断AI产出质量,知道何时放手、何时亲自审查

福利待遇

  • 参与前沿大模型训推系统建设
  • 与顶尖研究员和工程师协作
  • 推动AI基础设施创新