多模态训练加速研发工程师-infra
岗位摘要
负责大规模分布式训练和推理的基础架构设计、开发与优化,支持千卡以上级别大规模模型训练;针对多模态数据特点,通过多样化分布式并行策略和通信优化技术,支持长序列训练,有效解决多模态场景下的训练效率瓶颈
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责大规模分布式训练和推理的基础架构设计、开发与优化,支持千卡以上级别大规模模型训练
- 针对多模态数据特点,通过多样化分布式并行策略和通信优化技术,支持长序列训练,有效解决多模态场景下的训练效率瓶颈
- 构建和维护海量多模态数据的流式处理管道,有效支撑多模态大模型在大规模预训练阶段的数据高速加载
- 负责多模态推理引擎的功能开发和性能优化,包括吞吐率优化、延迟优化和性能瓶颈排查
任职要求
- 熟练掌握Transformer系列模型架构原理,精通至少一种开源训练框架(如Megatron-LM、DeepSpeed、Colossal-AI等),有大模型分布式训练调优经验者优先
- 精通GPU系统架构和内存原理,有丰富的CUDA编程经验,能进行全面的GPU Profiling分析
- 熟悉至少一种开源Serving框架(如vLLM、SGlang等)
- 有扎实的工程算法基础和极佳的工程实现能力,精通C/C++和Python开发,常用设计模式、算法及数据结构
- 本科及以上学历,经验不限
福利待遇
- 薪资待遇优厚:50-80K·15薪
- 扁平化管理,团队氛围开放
- 接触前沿大模型训练技术,成长空间大
- 公司位于深圳南山区,办公环境优越
工作地址
深圳南山区深圳市平山民企科技园3栋
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。