AI系统工程师(推理引擎/分布式训练)
岗位摘要
参与推理引擎、深度学习框架、分布式训练、深度学习算法等相关方向的技术调研、设计以及原型开发;探索业界领先技术,如在千卡、万卡集群上进行大模型(如LLM、文生图、文生视频)的分布式训练和推理、故障容错、弹性训练、自动并行、异构训练,并在特定GPGPU上进行原型开发验证
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与推理引擎、深度学习框架、分布式训练、深度学习算法等相关方向的技术调研、设计以及原型开发
- 探索业界领先技术,如在千卡、万卡集群上进行大模型(如LLM、文生图、文生视频)的分布式训练和推理、故障容错、弹性训练、自动并行、异构训练,并在特定GPGPU上进行原型开发验证
- 针对搜索、广告、推荐等场景,研究大规模稀疏模型训练框架和预估引擎,研究大模型驱动的新型AI工程架构,并在特定GPGPU上进行原型开发验证
任职要求
- 计算机、电子、数学及相关专业背景
- 熟练使用C++和Python编程
- 熟悉CUDA等异构编程及GPGPU架构者优先
- 熟悉RDMA、NCCL、NIXL等通信加速技术者优先;熟悉PD分离、大EP等技术者优先
- 熟悉Wide&Deep、DLRM、DIEN、MMOE等传统广告/推荐场景算法者优先;熟悉TIGER、GR、OneRec等大模型驱动的新型算法者优先
- 熟悉大规模稀疏模型训练框架如AIBox、HugeCTR、TorchRec、DeepRec者优先;熟悉稀疏模型预估引擎架构设计和业务落地者优先
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。