大模型训推系统工程师
岗位摘要
维护并持续优化Post-Train训推框架,降低使用门槛,让研究员专注于实验本身而非环境问题;深入训练与推理全链路,覆盖显存优化、通信加速、调度策略、吞吐与延迟等核心指标,缩短实验周期,提升资源利用率
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 维护并持续优化Post-Train训推框架,降低使用门槛,让研究员专注于实验本身而非环境问题
- 深入训练与推理全链路,覆盖显存优化、通信加速、调度策略、吞吐与延迟等核心指标,缩短实验周期,提升资源利用率
- 构建高效稳定的数据处理与供给流水线,支持多源异构数据的清洗、混合与动态调度
任职要求
- 熟悉Post-Train训练流程(SFT、RLVR、RLHF、AgentRL等),对训推基建有深入了解
- 有大模型系统开发和优化经验,具备从零搭建或大规模改造训推系统的实际案例
- 独立思考,不迷信权威,敢于提出正确观点
- 有工程项目维护经验,注重系统可观测性、可复现性及快速定位根因的能力
- 真正理解分布式训推底层逻辑(tensor parallelism、pipeline scheduling、NCCL通信、GPU显存布局等),能解释性能瓶颈原因
- 高强度使用AI工具辅助开发、调试和分析,并能判断AI产出质量,知道何时放手、何时亲自审查
福利待遇
- 参与前沿大模型训推系统建设
- 与顶尖研究员和工程师协作
- 推动AI基础设施创新
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。