大模型训练系统工程师-实验平台
岗位摘要
建设超大规模AI训练集群,保证训练的高稳定性和高效率,提升资源利用率和硬件效率;深度参与大模型技术迭代,构建预训练、SFT、RLHF等算法方向的工程架构,解决底层基建问题;探索业界前沿的AI Infra技术,建设行业领先的大模型基础设施解决方案
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 建设超大规模AI训练集群,保证训练的高稳定性和高效率,提升资源利用率和硬件效率
- 深度参与大模型技术迭代,构建预训练、SFT、RLHF等算法方向的工程架构,解决底层基建问题
- 探索业界前沿的AI Infra技术,建设行业领先的大模型基础设施解决方案
任职要求
- 扎实的计算机体系结构和分布式系统基础,熟悉GPU硬件架构,具备Kubernetes及云原生技术栈,了解RDMA、InfiniBand、NVLink等高性能网络技术
- 扎实的工程素养,良好的代码习惯(Golang/Python/C++),善于使用AI Coding提升工作效率
- 对大模型架构和工程链路有了解,了解Megatron、Verl、Ray等训练框架
- 优秀的学习能力,对AI有热情和好奇心,追求技术成长和认知快速迭代,表达清晰,逻辑严谨
- 良好的沟通协作能力,能够与算法团队紧密配合,一起探索大模型新技术,推动模型快速迭代
福利待遇
- 40-70K·15薪,有竞争力的薪酬待遇
- 位于北京海淀区蓟门壹号,地理位置优越,交通便利
- 与顶尖算法团队紧密合作,探索大模型前沿技术
- 参与行业领先的超大规模AI训练基础设施建设和技术创新
工作地址
北京海淀区蓟门壹号8楼
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。