AI基础设施研发工程师
岗位摘要
负责多模态大模型(音乐、视频、世界模型、通用Agent)的分布式训练基建建设,基于PyTorch/Megatron-LM等框架优化多维混合并行策略(DP/TP/PP/EP),解决多卡多机分布式训练的通信瓶颈、梯度同步、负载不均问题,提升大规模训练的稳定性与线性加速比
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责多模态大模型(音乐、视频、世界模型、通用Agent)的分布式训练基建建设,基于PyTorch/Megatron-LM等框架优化多维混合并行策略(DP/TP/PP/EP),解决多卡多机分布式训练的通信瓶颈、梯度同步、负载不均问题,提升大规模训练的稳定性与线性加速比
- 针对音视频、世界模型、Agent长序列训练特性,定制适配专属训练优化方案,解决长时序、高分辨率、多模态融合训练的性能痛点
- 搭建大模型推理服务平台,支撑文生音乐、文生视频、世界模型仿真、Agent智能交互等多样化线上业务
- 基于TensorRT、vLLM、Triton等框架完成推理引擎优化、算子融合、量化压缩(FP8/INT8)、动态批处理优化,降低推理延时、提升吞吐与算力利用率,适配C端高并发、低延迟业务场景
- 负责GPU集群基础设施运维与调度优化,基于K8s/Slurm搭建高效的算力调度体系,统一管理训练、微调、推理、仿真任务
- 针对多模型混跑场景,优化资源隔离、任务排队、弹性扩容机制,解决算力碎片问题,大幅提升集群整体利用率,保障多产品线业务稳定迭代
- 构建集群、训练任务、推理服务全维度监控告警体系,覆盖GPU利用率、显存、网络带宽、通信延时、任务报错、服务QPS/延时等核心指标
- 定位并解决训练中断、推理卡顿、算力异常、节点故障等线上问题,保障大模型业务7×24小时稳定运行
任职要求
- 本科及以上学历,计算机、人工智能、数学等相关专业
- 1-3年相关工作经验
- 熟悉PyTorch、Megatron-LM等深度学习框架,具备分布式训练优化经验
- 熟悉TensorRT、vLLM、Triton等推理引擎,有推理加速和量化压缩经验
- 熟悉Kubernetes或Slurm等集群调度系统,具备GPU集群运维经验
- 具备良好的问题定位和解决能力,能应对大规模分布式系统中的稳定性挑战
福利待遇
- 具有竞争力的薪资待遇,月薪45-75K
- 参与前沿大模型技术研发,接触多模态、世界模型等创新方向
- 与顶尖技术团队合作,快速提升技术深度与广度
- 提供丰富的学习资源和职业发展机会
工作地址
北京东城区明阳国际中心B座
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。