大模型训练框架开发工程师
岗位摘要
参与深度学习训练底层框架研发,负责超大规模训练技术在公司实际业务场景中的计算效率优化;在超大规模训练场景下,探索前沿的分布式系统设计,包括不限于通信优化、内存优化、计算优化等;维护线上大规模训练任务的稳定性和易用性
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与深度学习训练底层框架研发,负责超大规模训练技术在公司实际业务场景中的计算效率优化
- 在超大规模训练场景下,探索前沿的分布式系统设计,包括不限于通信优化、内存优化、计算优化等
- 维护线上大规模训练任务的稳定性和易用性
- 负责PyTorch 2.0/TorchDynamo/TorchInductor/Triton等相关算子开发和性能优化工作
任职要求
- 编程能力扎实,熟悉C++/Python,熟悉常见数据结构和设计模式
- 熟悉计算机系统原理,理解硬件机制
- 熟悉深度学习基本原理和AI框架(TensorFlow/PyTorch/JAX等),有对PyTorch二次开发经验者优先
- 熟悉深度学习框架优化/问题定位相关工具链基本原理,有二次开发经验者优先
- 拥有高性能计算或模型优化经验和兴趣(CUDA/Triton/OpenMP)
- 有ACM、OI、Kaggle等各类竞赛获奖经历者优先
- 热爱技术,有较强的学习能力和复杂问题归纳梳理能力
工作地址
北京海淀区蓟门壹号8楼
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。