返回岗位列表

壁仞科技

AI系统工程师(推理引擎/分布式训练)

地点:上海 薪资:薪资未公开 日期:2026-01-29

岗位摘要

参与推理引擎、深度学习框架、分布式训练、深度学习算法等相关方向的技术调研、设计以及原型开发;探索业界领先技术,如在千卡、万卡集群上进行大模型(如LLM、文生图、文生视频)的分布式训练和推理、故障容错、弹性训练、自动并行、异构训练,并在特定GPGPU上进行原型开发验证

岗位职责

  • 参与推理引擎、深度学习框架、分布式训练、深度学习算法等相关方向的技术调研、设计以及原型开发
  • 探索业界领先技术,如在千卡、万卡集群上进行大模型(如LLM、文生图、文生视频)的分布式训练和推理、故障容错、弹性训练、自动并行、异构训练,并在特定GPGPU上进行原型开发验证
  • 针对搜索、广告、推荐等场景,研究大规模稀疏模型训练框架和预估引擎,研究大模型驱动的新型AI工程架构,并在特定GPGPU上进行原型开发验证

任职要求

  • 计算机、电子、数学及相关专业背景
  • 熟练使用C++和Python编程
  • 熟悉CUDA等异构编程及GPGPU架构者优先
  • 熟悉RDMA、NCCL、NIXL等通信加速技术者优先;熟悉PD分离、大EP等技术者优先
  • 熟悉Wide&Deep、DLRM、DIEN、MMOE等传统广告/推荐场景算法者优先;熟悉TIGER、GR、OneRec等大模型驱动的新型算法者优先
  • 熟悉大规模稀疏模型训练框架如AIBox、HugeCTR、TorchRec、DeepRec者优先;熟悉稀疏模型预估引擎架构设计和业务落地者优先