大模型推理框架开发工程师
岗位摘要
基于壁仞GPU软件栈,开发大模型和多模态大模型推理服务框架;围绕并行策略优化GPU通信效率,提升模型推理整体性能;通过算子融合与量化压缩技术,降低大语言模型推理延迟;持续优化线上模型服务吞吐,保障高并发场景下的稳定性
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 基于壁仞GPU软件栈,开发大模型和多模态大模型推理服务框架
- 围绕并行策略优化GPU通信效率,提升模型推理整体性能
- 通过算子融合与量化压缩技术,降低大语言模型推理延迟
- 持续优化线上模型服务吞吐,保障高并发场景下的稳定性
任职要求
- 硕士及以上学历,计算机、数学、软件工程、自动化、通信、微电子等相关专业
- 具备三年及以上相关工作经历
- 扎实编程能力,熟练使用C/C++或Python
- 熟悉大模型推理技术栈,有vLLM、SGLang、LMDeploy、TensorRT-LLM等框架适配开发经验者优先
- 有CUDA编程经验者优先
- 热爱技术、追求卓越,具备良好的学习能力和团队协作能力,自驱力强、逻辑思维清晰
福利待遇
- 具有竞争力的薪酬体系,20-40K·15薪
- 壁仞科技GPU软硬件全栈技术平台支持
- 参与前沿大模型推理技术研究与落地
- 开放包容的技术氛围,鼓励创新与持续学习
工作地址
上海闵行区壁仞科技16号楼
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。