大模型推理框架开发工程师
岗位摘要
基于壁仞GPU软件栈,开发并维护大模型与多模态大模型推理服务框架;设计并实现并行策略、GPU通信、算子融合、量化压缩等核心优化方案;持续降低大语言模型推理延迟,提升线上服务吞吐与稳定性
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 基于壁仞GPU软件栈,开发并维护大模型与多模态大模型推理服务框架
- 设计并实现并行策略、GPU通信、算子融合、量化压缩等核心优化方案
- 持续降低大语言模型推理延迟,提升线上服务吞吐与稳定性
- 与硬件、算法团队协同,推动新特性快速落地并上线
- 跟踪前沿推理技术,沉淀最佳实践并输出技术文档
任职要求
- 硕士及以上学历,计算机、数学、软件工程、自动化、通信、微电子等相关专业
- 3年以上高性能计算或AI推理系统开发经验
- 精通C/C++或Python,具备扎实编程与系统调优能力
- 熟悉vLLM、SGLang、LMDeploy、TensorRT-LLM等推理框架,有CUDA开发经验优先
- 热爱技术,逻辑清晰,自驱力强,具备优秀团队协作与学习能力
福利待遇
- 15薪高薪结构,年薪50-75万
- 弹性工作制,顶配GPU算力资源
- 核心技术团队,参与业界领先大模型项目
- 年度体检、补充医疗、餐补、交通补全覆盖
- 上海闵行核心科技园区,地铁直达,办公环境优越
工作地址
上海闵行区壁仞科技
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。