返回岗位列表

昆仑万维

AI基础设施研发工程师

地点:北京 薪资:45-75K 日期:2026-06-26

岗位摘要

负责多模态大模型(音乐、视频、世界模型、通用Agent)的分布式训练基建建设,基于PyTorch/Megatron-LM等框架优化多维混合并行策略(DP/TP/PP/EP),解决多卡多机分布式训练的通信瓶颈、梯度同步、负载不均问题,提升大规模训练的稳定性与线性加速比

岗位职责

  • 负责多模态大模型(音乐、视频、世界模型、通用Agent)的分布式训练基建建设,基于PyTorch/Megatron-LM等框架优化多维混合并行策略(DP/TP/PP/EP),解决多卡多机分布式训练的通信瓶颈、梯度同步、负载不均问题,提升大规模训练的稳定性与线性加速比
  • 针对音视频、世界模型、Agent长序列训练特性,定制适配专属训练优化方案,解决长时序、高分辨率、多模态融合训练的性能痛点
  • 搭建大模型推理服务平台,支撑文生音乐、文生视频、世界模型仿真、Agent智能交互等多样化线上业务
  • 基于TensorRT、vLLM、Triton等框架完成推理引擎优化、算子融合、量化压缩(FP8/INT8)、动态批处理优化,降低推理延时、提升吞吐与算力利用率,适配C端高并发、低延迟业务场景
  • 负责GPU集群基础设施运维与调度优化,基于K8s/Slurm搭建高效的算力调度体系,统一管理训练、微调、推理、仿真任务
  • 针对多模型混跑场景,优化资源隔离、任务排队、弹性扩容机制,解决算力碎片问题,大幅提升集群整体利用率,保障多产品线业务稳定迭代
  • 构建集群、训练任务、推理服务全维度监控告警体系,覆盖GPU利用率、显存、网络带宽、通信延时、任务报错、服务QPS/延时等核心指标
  • 定位并解决训练中断、推理卡顿、算力异常、节点故障等线上问题,保障大模型业务7×24小时稳定运行

任职要求

  • 本科及以上学历,计算机、人工智能、数学等相关专业
  • 1-3年相关工作经验
  • 熟悉PyTorch、Megatron-LM等深度学习框架,具备分布式训练优化经验
  • 熟悉TensorRT、vLLM、Triton等推理引擎,有推理加速和量化压缩经验
  • 熟悉Kubernetes或Slurm等集群调度系统,具备GPU集群运维经验
  • 具备良好的问题定位和解决能力,能应对大规模分布式系统中的稳定性挑战

福利待遇

  • 具有竞争力的薪资待遇,月薪45-75K
  • 参与前沿大模型技术研发,接触多模态、世界模型等创新方向
  • 与顶尖技术团队合作,快速提升技术深度与广度
  • 提供丰富的学习资源和职业发展机会

工作地址

北京东城区明阳国际中心B座