大模型训练基础设施稳定性与效率资深工程师
岗位摘要
训练全栈基础设施保障:负责GPU算力(机器交付、健康管理、坏卡检测与自愈)、RDMA/高性能网络(IB/RoCE稳定性、抖动定位)、网络通信库(NCCL调优与故障定位)、高性能存储(数据与checkpoint高吞吐链路)、集群调度(大规模作业调度、故障容错与弹性伸缩)及训练任务生命周期(启动、断点…
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 训练全栈基础设施保障:负责GPU算力(机器交付、健康管理、坏卡检测与自愈)、RDMA/高性能网络(IB/RoCE稳定性、抖动定位)、网络通信库(NCCL调优与故障定位)、高性能存储(数据与checkpoint高吞吐链路)、集群调度(大规模作业调度、故障容错与弹性伸缩)及训练任务生命周期(启动、断点续训、快速恢复)
- 训练稳定性工程:建设训练专属可观测体系,实现硬件健康、慢节点检测;建立故障自动发现、定位、自愈闭环,降低MTTR;以ETTR、有效训练时长等指标量化并持续改善稳定性
- 训练效率工程:定位并消除通信、IO、计算、调度等瓶颈,与算法和框架团队协同提升MFU、扩展效率与吞吐
- 深入训练框架层:理解Megatron-LM/DeepSpeed等分布式训练框架的并行策略、通信模式和checkpoint机制,将框架层问题转化为基础设施侧改进
任职要求
- 5年以上相关经验,具备大规模GPU集群(千卡级及以上)训练稳定性或AI Infra一线实战经验
- 在RDMA/高性能网络、NCCL等通信库、并行/高性能存储、大规模作业调度、GPU集群运维与故障处理中至少2-3个方向有深度理解
- 熟悉分布式训练原理与框架(Megatron/DeepSpeed至少其一),理解并行训练中常见hang、慢、OOM、掉队问题的成因与定位手段
- 扎实的编程与工程化能力(Python/Go/C++至少一门过硬),能通过代码和自动化构建平台工具
- 成熟的稳定性方法论:掌握SLO、可观测、根因分析、先止损再定位等体系化方法
- 强Owner意识与跨团队协同能力,能端到端扛事,与算法、训练、网络、存储等多方拉通
福利待遇
- 参与公司最核心的大模型训练项目,直接决定旗舰模型成败
- 端到端Owner角色,拥有从0到1搭建训练稳定性体系的广阔空间
- 与顶尖算法和训练团队紧密协作,深入技术前沿
- 持续学习与成长机会,接触AI/大模型领域最新技术
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。