大模型推理优化工程师
岗位摘要
负责公司大模型推理系统的端到端适配与调优工作;针对大模型推理系统运行过程中出现的功能性、稳定性以及性能异常问题进行定位与解决;针对公司自研GPU架构优化大模型推理系统;3年及以上相关工作经历
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责公司大模型推理系统的端到端适配与调优工作
- 针对大模型推理系统运行过程中出现的功能性、稳定性以及性能异常问题进行定位与解决
- 针对公司自研GPU架构优化大模型推理系统
任职要求
- 3年及以上相关工作经历
- 优秀的代码能力、数据结构和基础算法功底,熟练C/C++或Python
- 熟悉至少一种主流的机器学习框架,如PyTorch
- 熟悉至少一种主流的大模型推理框架,如SGLang、vLLM等
- 熟悉大模型服务部署及优化技术,例如动态batching、投机预测、负载均衡等
- 熟悉大模型推理系统的profile工具使用与性能分析方法
- 熟悉至少一种大模型的结构,如DeepSeek、Llama等
- 熟悉GPU分布式推理中的常见通信原语
- 掌握分布式推理并行策略,包括TP、PP、EP等
- 有强烈的工作责任心,较好的学习能力、沟通能力和自驱力
- 良好的沟通协作能力,能和团队一起探索新技术,推进技术进步
加分项
- 熟悉NLP、CV相关的算法和技术,熟悉大模型训练、RL算法者优先
- 有以下某一方向领域的经验:GPU kernel 开发(不限于 cuda、tilelang、triton),RDMA,AI Infrastructure,HW/SW Co
- Design,Distributed Storage,k8s 部署
- 在大模型领域,参与过大影响力的项目或论文者优先
- 有软硬协同优化经验者优先
福利待遇
- 薪资范围30-60K·16薪
- 工作地点在北京朝阳区望京国际研发园
- 有机会参与自研GPU架构优化等前沿技术工作
- 团队氛围积极,鼓励技术探索与创新
工作地址
北京朝阳区望京国际研发园-I座1
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。