多模态训练加速研发工程师-infra
岗位摘要
负责大规模分布式训练和推理的基础架构设计、开发与优化,支持千卡以上级别大规模模型训练;针对多模态数据特点,通过多样化的分布式并行策略和通信优化技术,支持长序列训练,解决多模态场景下的训练效率瓶颈
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责大规模分布式训练和推理的基础架构设计、开发与优化,支持千卡以上级别大规模模型训练
- 针对多模态数据特点,通过多样化的分布式并行策略和通信优化技术,支持长序列训练,解决多模态场景下的训练效率瓶颈
- 构建和维护海量多模态数据的流式处理管道,支撑多模态大模型在大规模预训练阶段的数据高速加载
- 负责多模态推理引擎的功能开发和性能优化,包括吞吐率优化、延迟优化和性能瓶颈排查
任职要求
- 熟练掌握Transformer系列模型架构原理,精通至少一种开源训练框架(如Megatron-LM、DeepSpeed、Colossal-AI等),有大模型分布式训练调优经验者优先
- 精通GPU系统架构和内存原理,有丰富的CUDA编程经验,能进行全面的GPU Profiling分析
- 熟悉至少一种开源Serving框架(如vLLM、SGlang等)
- 有扎实的工程算法基础和极佳的工程实现能力,精通C/C++和Python开发,熟悉常用设计模式、算法及数据结构
福利待遇
- 具有竞争力的薪酬(50-80K·15薪)
- 本科及以上学历,经验不限
- 加入面壁智能,参与前沿多模态大模型研发
工作地址
上海徐汇区西岸智塔-西塔楼云锦路700号
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。