大模型推理性能优化工程师
岗位摘要
负责百度文心大模型的推理性能优化;参与飞桨深度学习平台(PaddlePaddle)推理框架的设计、开发和业务支持;负责深度学习框架的性能优化工作,包括但不限于功能模块在CPU/GPU上的深度优化工作
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责百度文心大模型的推理性能优化
- 参与飞桨深度学习平台(PaddlePaddle)推理框架的设计、开发和业务支持
- 负责深度学习框架的性能优化工作,包括但不限于功能模块在CPU/GPU上的深度优化工作
- 负责深度学习推理框架前瞻技术的跟踪调研,实现技术创新突破
- 参与深度学习框架的易用性优化工作,使开发者能够以更简单的方式实现各类任务,降低学习成本和开发成本
- 负责异构高性能计算平台的设计、研发,高性能计算库、通信库开发与优化
- 支持百度萝卜快跑、搜索等业务大模型的推理性能优化
任职要求
- 热爱编程,精通C++/Python,精通CUDA编程
- 具有独立开发能力,精通计算机体系结构,有汇编级别开发经验,对AI算法和主流框架有丰富的应用或开发经验
- 了解FlashAttention、PagedAttention、MoE、Chunked Prefill等大模型核心技术
- 了解常见的大模型量化算法(如AWQ、GPTQ、SmoothQuant等)及量化算子的实现
- 了解大模型通信算子(如Allreduce等)及计算通信overlap实现
- 有分离式部署(PD分离)开发经验
- 目标驱动,并有探索精神
- 有极强的学习能力和知识迁移能力
- 具有以下条件加分:精通PaddlePaddle、Pytorch、TensorFlow等主流开源框架,做过源码级优化移植等工作,有vLLM、TGI、SGLang、TensorRT-LLM等大模型推理框架的使用或优化经验
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。