多模态训练加速研发工程师-Infra
岗位摘要
负责大规模分布式训练和推理的基础架构设计、开发、优化,支持千卡以上级别大规模模型训练;针对多模态数据特点,通过多样化的分布式并行策略和通信优化技术,支持长序列训练,有效解决多模态场景下的训练效率瓶颈,追求业界最领先的性能
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责大规模分布式训练和推理的基础架构设计、开发、优化,支持千卡以上级别大规模模型训练
- 针对多模态数据特点,通过多样化的分布式并行策略和通信优化技术,支持长序列训练,有效解决多模态场景下的训练效率瓶颈,追求业界最领先的性能
- 构建和维护海量多模态数据的流式处理管道,有效支撑多模态大模型在大规模预训练阶段的数据高速加载
- 负责多模态推理引擎的功能开发和性能优化,包括吞吐率优化、latency时延优化和性能瓶颈排查
任职要求
- 熟练掌握C++/Python等编程语言,具有良好的编程习惯
- 熟悉分布式训练框架(如DeepSpeed、Megatron-LM等),有大规模训练经验优先
- 了解GPU/CPU体系结构,具备性能调优经验
- 具备良好的团队协作和沟通能力,能与其他团队高效协作
福利待遇
- 具有竞争力的薪酬福利体系
- 扁平化的管理氛围,技术氛围浓厚
- 广阔的成长空间,参与前沿大模型训练基础设施建设
工作地址
北京海淀区科建大厦面壁智能
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。